본문으로 이동

속성:Observation

S3 연구 메모리

Text

직접 확인한 결과를 적습니다. 원인에 대한 해석은 따로 적습니다.

( | ) (20 | 50 | 100 | 250 | 500) 보기
이 속성을 사용하는 문서 20개를 보여줍니다.
g
확인된 사실은 권상윤·안민우·정진규가 이 제목의 논문을 KSC 2022에 발표했다는 서지정보뿐이다. GPU 종류, 커널, baseline, metric, 예측 정확도와 speedup은 공개 근거에서 확인되지 않았다.  +
workloads=T5-family language tasks; baselines=MHA; MQA; metrics=quality; inference speed; uptraining compute; results=Near-MHA quality, near-MQA speed using 5% pretraining compute.  +
MapReduce, MPI, file-I/O workloads를 사용한 KVM 평가에서 strict inter-group isolation을 유지하면서 workload별 정책으로 intra-group memory efficiency를 확보했다. 공개 초록은 정량값을 제시하지 않는다.  +
h
workloads=stateful serverless workloads; baselines=Boki; metrics=latency; logging overhead; results=20–40% lower latency; 1.5–4× lower logging overhead.  +
workloads=memory-bound applications; names not enumerated in abstract; baselines=SMT; no harvesting; metrics=harvesting throughput; latency SLO compliance; results=up to 72% of SMT harvesting throughput under SLOs where SMT is unusable  +
workloads=YCSB and Twitter traces; baselines=second-best evaluated LSM optimization; metrics=throughput; results=up to 1.6x on balanced YCSB and 1.5x on Twitter  +
확인된 사실은 Junghoon Kim·Sangwook Kim·Joonwon Lee·Jinkyu Jeong의 poster가 2015년 4월 Bordeaux에서 열린 EuroSys 2015 프로그램에 포함됐다는 점이다. 기기, 앱, workload, metric과 정량 결과는 확인되지 않았다.  +
workloads=Redis, proxy, and HarmonyOS-kernel scenarios; baselines=existing copy paths and prior work; metrics=application performance; results=up to 1.8x overall and 1.6x over prior work  +
i
workloads=FIO; CacheLib data placement; baselines=Linux block I/O path; metrics=peak IOPS; results=16–40% higher peak IOPS.  +
workloads=millions of realistic LLM requests; baselines=uncached and conventional serving; metrics=similarity coverage, throughput, latency, quality; results=>70% reusable counterparts; 1.4–5.9x throughput; 28–71% lower latency; no quality loss  +
workloads=foreground/background mobile application scenarios; baselines=state-of-the-art mobile memory/process management; metrics=frame rate; refaults; foreground responsiveness; results=1.57x average frame rate, cross-checked in authors' journal extension  +
bperf의 평균 성능 저하는 1.6%로 perf sampling 0.9%, tracing 3.6%와 비교해 perf보다 0.7%p 추가 비용. BCOZ end-to-end overhead는 평균 27.6%, 최대 64.7%. RocksDB 혼합 워크로드에서 병목을 식별했고 실제 최적화의 방향/순위가 가상 speedup 예측과 대체로 일치.  +
workloads=LLM inference with reusable long prefixes; baselines=state-of-the-art prefix KV storage systems; metrics=TTFT; inference accuracy; KV I/O; results=up to 2.8x lower TTFT with comparable accuracy  +
공식 초록은 대부분의 앱을 background에 준비시키고 launch latency를 유의하게 줄였다고 보고하지만 수치를 제공하지 않는다.  +
평가 장비는 NVIDIA A100 40GB 또는 H100 80GB, Intel Xeon Gold 6342(24 cores/48 threads), 1,632GB DDR4-3200입니다. HILOS는 최대 16개의 Samsung SmartSSD(각 3.84TB NVMe, Kintex UltraScale+ KU15P FPGA, 4GB device DRAM)를 PCIe expansion chassis의 aggregate PCIe 4.0×16에 연결했습니다. Conventional baseline은 같은 16 host lanes에 Samsung PM9A3 3.84TB SSD 4개를 사용했습니다. Software는 Ubuntu 20.04, PyTorch 2.4.1, DeepSpeed 1.15.1, CUDA 12.1과 Vitis/XRT입니다. Workload는 OPT-30B/66B/175B, Qwen2.5-32B, Mixtral-8×7B, GLaM-143B이며 context는 최대 128K, 기본 batch 16, FP16, output 64 tokens입니다. Baseline은 FLEX(DRAM), FLEX(SSD), FPGA를 끈 16개의 PCIe 3.0 SmartSSD, 저자들이 UVM을 추가한 DS+UVM(DRAM), 별도 8×RTX A6000 vLLM cluster입니다. 핵심 결과는 conventional SSD offloading 대비 최대 7.86× throughput과 최대 85% energy reduction입니다. 4개 SmartSSD는 FLEX(DRAM)보다 1.10–1.36×, 16개는 1.88–2.49× 빨랐습니다. FLEX(DRAM)이 batch 1도 실행하지 못한 설정에서는 FLEX(SSD)보다 5.3–7.8× 빨랐습니다. FPGA를 끈 16개 SSD는 FLEX(SSD)의 0.64–0.94×에 그쳐 SSD 수만 늘리는 것으로는 부족함을 보였습니다. GQA/MoE에서는 1.16–3.36×, 긴 output에서는 최대 6.08×, 8×A6000 vLLM 비교에서는 1.64–1.81× 결과를 보고했습니다. Ablation에서 attention near storage만으로 최대 3.39×, delayed writeback은 그 위에 최대 1.32×, cooperative X-cache는 최대 1.64×를 더했습니다. 측정 최적 X-cache 비율은 약 50%, spill interval은 16입니다. OPT-66B cost efficiency는 FLEX(SSD) 대비 최대 2.02×였지만 DRAM이 충분한 경우 FLEX(DRAM)이 1.53× 더 비용 효율적이었습니다. OPT-175B에서는 HILOS가 최대 1.68× 더 비용 효율적이었습니다. SSD endurance는 1.34–1.47× 개선되었고, exact attention은 FlashAttention 대비 lossless accuracy를 보고했습니다. 비교된 1/8 lossy InstAttention은 LongBench F1이 3.52–5.73 percentage points 낮았습니다.  +
workloads=representative LLMs; KV-offloading inference system; baselines=prior KV cache management methods; metrics=inference speed; accuracy; results=Up to 3.00× speedup with higher accuracy.  +
현재 공개 근거로 확인할 수 있는 것은 제목과 제한된 서지 메타데이터뿐이다. workload, baseline, metric, 정량 결과는 확인되지 않았다.  +
workloads=YCSB; SplinterDB; RocksDB; baselines=MultiPaxos; leader-read variant; Skyros/parallel protocols; metrics=throughput; read RTT; history size; results=1.8× vs leader-read; 16–38× throughput vs MultiPaxos; most reads in 1 RTT.  +
k
glibc/Linux prototype에서 throughput과 평균 response time 기준 overhead가 conventional allocator 대비 약 2%였고, synthetic leak workloads에서 address-space expansion을 억제했다.  +
workloads=Facebook traces; Twitter traces; production Facebook deployment; baselines=best prior DRAM-optimized flash cache; best prior write-optimized flash cache; metrics=miss ratio; DRAM bits/object; flash writes; results=29% fewer misses than state of the art; Pareto-optimal across evaluated budgets  +