본문으로 이동

속성:Observation

S3 연구 메모리

Text

직접 확인한 결과를 적습니다. 원인에 대한 해석은 따로 적습니다.

( | ) (20 | 50 | 100 | 250 | 500) 보기
이 속성을 사용하는 문서 20개를 보여줍니다.
d
workloads=multi-adapter LoRA serving workloads; baselines=vLLM; Hugging Face PEFT; S-LoRA; metrics=throughput; average latency; results=up to 57.9x throughput vs vLLM; up to 26x vs PEFT; up to 1.8x lower latency vs S-LoRA  +
128KB I/O 단위에서 기존 기법보다 유효 페이지 탐색 지연을 최대 83% 줄였다고 공식 초록이 보고한다.  +
Software zeroing은 SPEC foreground를 최대 11.2%, 기하평균 5.1% 저하시켰지만 Secure DRAM은 약 0.1%였다. 실행시간 표준편차도 20.1% 줄었고 forkbench에서 software 방식은 평균 12.8% slowdown, Secure DRAM은 slowdown이 없었다. 추정 cell-array transistor overhead는 0.3%, 총 chip area overhead는 0.6-0.75%다.  +
tier와 slo_budget 상관이 -0.93이었고, `value_urgency`와 `tier_priority`가 해당 run의 모든 tier/metric에서 동일한 숫자를 냈다. 이 설계의 결과는 2026-07-11 retracted 처리되었다. deadline을 tier와 독립적으로 샘플링한 corrected simulation에서는 realistic regime의 best가 `length_aware`(8.15%)였고 DW-KV는 9.54%로 3위였으며, neutral에서도 length-aware가 앞섰다.  +
이미 deadline을 맞출 수 없는 request가 최대 priority를 얻어 capacity를 소비하고, 다른 request를 doomed 상태로 밀어 다시 최고 urgency를 부여하는 domino가 관찰되었다. `demote`는 laxity<=0 request를 urgency floor로 낮췄고, archive GPU comparison에서는 rate 6에서 DW-KV weighted miss가 73.8%→42.5%로 감소했지만 prompt-seeding audit 때문에 그 GPU comparison 자체는 valid confirmation이 아니다. GPU에서는 KV denominator 차이도 유의하지 않았다.  +
예를 들어 control은 seeds 1–5만 존재했고, 다른 payload는 1,800 requests 중 3개, 2,400 중 4개, 2,400 중 20개가 실패했다. patch cells는 다른 process의 prompt pool을 사용해 pair-mate와 workload가 달라졌다. `FAILED_RUNS.md`는 10개 artifact를 paper_grade=false로 분류하고 Git commit/SHA-256/recovery path를 보존한다.  +
11/12 GPU samples가 sequence-slot cap에 도달했지만 sampled instant에서 KV-capacity saturation은 보이지 않았다. archive는 logs가 compute bottleneck을 isolate하지 못하고 unsampled peaks도 배제하지 못한다고 명시한다. 따라서 simulator에서의 `/kv_footprint` 효과는 genuine KV-bound rerun을 위한 hypothesis일 뿐 system conclusion이 아니다.  +
`dwkv_v0.21.0.patch.RETRACTED.md`는 patch가 current implementation보다 앞선 obsolete artifact이며 성능 claim에 사용할 수 없다고 명시한다. archive README도 current checked-out source tree와 recorded Git revision/diff가 canonical implementation artifact라고 안내한다.  +
단일 corrected seed에서 DW-KV-order-only는 value-weighted tardiness 2398 ms로 최저였지만 premium miss 36.4%였고, tier-priority와 length-aware는 premium miss 12.1%였다. DW-KV premium E2E p90은 약 33.1 s, tier-priority는 약 6.0 s였다. 같은 run에서 KV denominator 기여는 value-urgency 2492→DW-KV 2398 ms, 3.8%였으며 single-seed/unverified였다.  +
한 process 안에서는 모든 seed가 같은 prompt sequence를 재사용했고, 별도 process에서 같은 seed를 실행하면 unseeded shuffle 때문에 서로 다른 prompt workload가 되었다. 따라서 prompt length가 만드는 decode-work variance를 seed가 샘플링하지 못했고, pair-mate도 보장되지 않았다. pre-fix GPU artifacts와 patch cells는 모두 retracted/paper_grade=false로 분류되었다.  +
코드상 DW-KV는 `tier_value * urgency / kv_footprint`, value-urgency는 denominator 없이 `tier_value * urgency`, tier-priority는 value만 사용하고, KV-footprint은 prompt+max output footprint의 역수를 사용한다. `demote`는 raw_laxity<=0일 때 urgency floor로 내리며, tests는 tier ordering, urgency override, KV denominator isolation, ablation semantics를 검증한다.  +
e
3D-TSV in-package DRAM 평가에서 기존 TDC 대비 off-package bandwidth 평균 32.0% 감소, IPC 17.7% 향상, EDP 25.4% 개선을 보고한다.  +
두 개의 주요 embedded processor architecture를 지원했고, 실제 embedded software에서 program activity를 성공적으로 수집하면서 overhead가 미미했다고 보고한다. 공개 초록에 수치는 없다.  +
light load에서 기존 hybrid polling 대비 CPU 사용 5~40% 절감하면서 classic polling에 가까운 latency 유지. heavy load에서 CPU 5~30% 절감, I/O latency 최대 10% 감소.  +
공식 초록은 기존 접근과 같은 메모리 절감을 유지하면서 계산비용을 유의하게 줄였다고 보고한다. 정량값은 공개 초록에 없다.  +
workloads=I/O passthrough VM micro/macrobenchmarks; baselines=ballooning; IOPF; metrics=reclaim/reallocation latency; application impact; results=Microsecond operations; two orders of magnitude faster than ballooning/IOPF.  +
workloads=Linux workloads on ECPT and FPT prototypes; baselines=native Linux translation paths; metrics=framework overhead and compatibility; results=negligible overhead; no exact value in abstract  +
workloads=LevelDB; ArckFS; two customized file systems; baselines=existing NVM file systems; ArckFS; metrics=application throughput; results=3.1–17× vs existing NVM FS; customized FS 1.3× vs ArckFS.  +
simulation에서 Dynamic Repartitioning은 당시 최선의 energy-efficient partitioning 대비 약 8%를 추가 절감했고, Dynamic Core Scaling은 low load에서 약 26%를 절감했다.  +
Linux bridge architecture 대비 최대 4.1배 성능을 개선하고 비싼 SR-IOV network와 사실상 유사한 성능을 냈다고 보고한다.  +