본문으로 이동

Lesson:inf2 high throughput generative inference of large language models using near storage processing 3fcead73: 두 판 사이의 차이

S3 연구 메모리
S3V1 o=s3rm-remediate-v1:83e55ef753dbfadc334bb5f545cf37ba9169a12c0ab6 r=fce26c828b9e6ecca23f92d45691bfe9 b=2074 e=d45c1736f4063a2d127d4312dc492a2d427d8285674657a8fa3bc40c80a3d55f t=d3151b0287912df1d80b807343c03934 h=19d424185d24be69cef15c48f2148ce7
S3R2 o=s3rm-remediate-v1:e338b222ff5a018be1c775893f61e6d14366312fa418 r=cf9d23de0b4d43eaac0bc550f64ee703 b=2075 e=532b7231cc05d9d1 c=100 t=3e9aa72f114fe378840a85433a0ddf7f h=aee5aa5e928b95fc3e50c4788a9f00dd; 검토된 자료가 O/I/R 전체를 강하게 지지하지 않아 confidence를 high에서 medium으로 조정합니다.
 
26번째 줄: 26번째 줄:


Limits: strict-latency online serving의 TTFT/TPOT를 검증하지 않았습니다. 큰 성능 향상은 4–16개 SmartSSD 병렬 구성에 의존하며 전용 expansion chassis, GPUDirect Storage와 FPGA software stack이 필요합니다. 일부 모델의 128K 실험은 pretraining context를 넘으므로 system scaling만 검증하고 답변 품질을 보장하지 않습니다. 기본 FP16, batch 16, output 64 결과는 workload에 따라 달라집니다. DRAM이 충분하면 FLEX(DRAM)이 더 비용 효율적입니다. DeepSpeed 비교는 저자 추가 UVM 확장이고, conventional SSD energy는 측정값이 아니라 datasheet 값입니다. PCIe 5.0 SSD를 따라가려면 2,000개가 넘는 DSP가 필요하다는 분석처럼 현 FPGA에는 확장 한계가 있습니다. Softmax가 큰 attention group에서 실행 시간의 50% 이상을 차지하며, capacity 대비 bandwidth 불균형으로 SmartSSD당 4TB 중 평가 peak 사용량은 600GB 미만입니다. Cost와 endurance는 장기 운영 관측이 아니라 논문의 가격·PBW·retention 가정에 따른 모델입니다.</nowiki>
Limits: strict-latency online serving의 TTFT/TPOT를 검증하지 않았습니다. 큰 성능 향상은 4–16개 SmartSSD 병렬 구성에 의존하며 전용 expansion chassis, GPUDirect Storage와 FPGA software stack이 필요합니다. 일부 모델의 128K 실험은 pretraining context를 넘으므로 system scaling만 검증하고 답변 품질을 보장하지 않습니다. 기본 FP16, batch 16, output 64 결과는 workload에 따라 달라집니다. DRAM이 충분하면 FLEX(DRAM)이 더 비용 효율적입니다. DeepSpeed 비교는 저자 추가 UVM 확장이고, conventional SSD energy는 측정값이 아니라 datasheet 값입니다. PCIe 5.0 SSD를 따라가려면 2,000개가 넘는 DSP가 필요하다는 분석처럼 현 FPGA에는 확장 한계가 있습니다. Softmax가 큰 attention group에서 실행 시간의 50% 이상을 차지하며, capacity 대비 bandwidth 불균형으로 SmartSSD당 4TB 중 평가 peak 사용량은 600GB 미만입니다. Cost와 endurance는 장기 운영 관측이 아니라 논문의 가격·PBW·retention 가정에 따른 모델입니다.</nowiki>
|confidence=<nowiki>high</nowiki>
|confidence=<nowiki>medium</nowiki>
|evidence=<nowiki>Hongsun Jang, Jaeyong Song, Changmin Shin, Si Ung Noh, Jaewon Jung, Jisung Park, and Jinho Lee. “A Cost-Effective Near-Storage Processing Solution for Offline Inference of Long-Context LLMs.” ASPLOS ’26. DOI: 10.1145/3779212.3790119. arXiv:2502.09921v2.
|evidence=<nowiki>Hongsun Jang, Jaeyong Song, Changmin Shin, Si Ung Noh, Jaewon Jung, Jisung Park, and Jinho Lee. “A Cost-Effective Near-Storage Processing Solution for Offline Inference of Long-Context LLMs.” ASPLOS ’26. DOI: 10.1145/3779212.3790119. arXiv:2502.09921v2.
Source: https://arxiv.org/abs/2502.09921v2
Source: https://arxiv.org/abs/2502.09921v2
37번째 줄: 37번째 줄:
|review_state=<nowiki>Draft</nowiki>
|review_state=<nowiki>Draft</nowiki>
|created_at=<nowiki>2026-07-16T15:00:51.285468Z</nowiki>
|created_at=<nowiki>2026-07-16T15:00:51.285468Z</nowiki>
|updated_at=<nowiki>2026-07-18T14:58:37.278656Z</nowiki>
|updated_at=<nowiki>2026-07-18T14:58:37.499022Z</nowiki>
}}
}}



2026년 7월 18일 (토) 23:58 기준 최신판

신뢰도 중간 마지막 수정: 2026-07-18T14:58:37.499022Z

제목 A Cost-Effective Near-Storage Processing Solution for Offline Inference of Long-Context LLMs
궁금했던 점 모델 가중치와 테라바이트 규모의 KV cache가 GPU 메모리는 물론 호스트 메모리 용량까지 넘는 대형·장문맥 LLM의 offline inference에서, 모델 구조를 바꾸거나 attention을 근사하지 않으면서 KV-cache I/O 병목을 줄이고 처리량을 높일 수 있는가?
해본 것 HILOS는 상용 Samsung SmartSSD에서 구현한 PyTorch 통합 near-storage processing framework입니다. 각 SSD의 FPGA accelerator가 decoding 단계의 exact attention을 처리하고, 큰 historical KV cache는 device-local 경로에 둡니다. Host interconnect에는 attention 입력과 최종 출력만 보내며, batch와 attention-head 차원으로 여러 SmartSSD에 작업을 분할합니다.

Cooperative X-cache는 선택 구간의 K와 V를 모두 보관하는 대신 절반 크기의 pre-projection activation X를 GPU로 읽어 K/V를 재생성합니다. Near-storage accelerator가 나머지 KV를 처리하는 동안 유휴 GPU와 GPUDirect Storage를 병렬 사용하며, 분석 모델로 비율을 정합니다.

Delayed KV-cache writeback은 head별 약 256-byte 신규 KV entry를 host memory에 모읍니다. CPU가 buffered key의 query-key partial dot product를 미리 계산하고, accelerator에는 scalar와 새 value만 보냅니다. 16개 entry가 4-KiB SSD page를 이룰 때 비동기로 spill하여 small write와 write amplification을 critical path에서 제거합니다.

FPGA attention accelerator는 sequence 길이에 비례하는 on-chip buffer 없이 block-temporal pipeline으로 exact attention을 수행합니다. 2-pass numerically stable softmax, online block transpose, GQA broadcasting, FP16 저장과 FP32 누산·지수 연산, 128 MAC units, storage-read/compute overlap을 사용합니다. HLS customization flow, C++ middleware, pybind11 PyTorch binding과 asynchronous writeback manager를 포함합니다.

당시 조건 Offline LLM inference는 online serving보다 지연 허용 범위가 넓어 큰 batch와 긴 sequence를 사용하기 좋으며, benchmark와 대규모 정보 추출이 대표적인 대상입니다. 기존 offloading 시스템은 가중치와 KV cache를 호스트 DRAM 또는 SSD에 두지만, KV-cache 크기는 batch와 context length에 함께 비례합니다. 저자들의 OPT-175B 동기 분석에서는 KV-cache 전송이 전체 실행 시간의 60%를 넘고 cache가 TB 규모에 이릅니다. SSD 수만 늘려도 전체 KV가 host PCIe를 통과하면 링크 병목은 남습니다.

검증 판본은 2026-02-06의 arXiv:2502.09921v2와 ASPLOS ’26 DOI 10.1145/3779212.3790119입니다. 이 revision은 v2의 새 제목, 시스템명 HILOS, 저자 7명과 v2 평가 결과만 사용합니다.

실제 결과 평가 장비는 NVIDIA A100 40GB 또는 H100 80GB, Intel Xeon Gold 6342(24 cores/48 threads), 1,632GB DDR4-3200입니다. HILOS는 최대 16개의 Samsung SmartSSD(각 3.84TB NVMe, Kintex UltraScale+ KU15P FPGA, 4GB device DRAM)를 PCIe expansion chassis의 aggregate PCIe 4.0×16에 연결했습니다. Conventional baseline은 같은 16 host lanes에 Samsung PM9A3 3.84TB SSD 4개를 사용했습니다. Software는 Ubuntu 20.04, PyTorch 2.4.1, DeepSpeed 1.15.1, CUDA 12.1과 Vitis/XRT입니다.

Workload는 OPT-30B/66B/175B, Qwen2.5-32B, Mixtral-8×7B, GLaM-143B이며 context는 최대 128K, 기본 batch 16, FP16, output 64 tokens입니다. Baseline은 FLEX(DRAM), FLEX(SSD), FPGA를 끈 16개의 PCIe 3.0 SmartSSD, 저자들이 UVM을 추가한 DS+UVM(DRAM), 별도 8×RTX A6000 vLLM cluster입니다.

핵심 결과는 conventional SSD offloading 대비 최대 7.86× throughput과 최대 85% energy reduction입니다. 4개 SmartSSD는 FLEX(DRAM)보다 1.10–1.36×, 16개는 1.88–2.49× 빨랐습니다. FLEX(DRAM)이 batch 1도 실행하지 못한 설정에서는 FLEX(SSD)보다 5.3–7.8× 빨랐습니다. FPGA를 끈 16개 SSD는 FLEX(SSD)의 0.64–0.94×에 그쳐 SSD 수만 늘리는 것으로는 부족함을 보였습니다. GQA/MoE에서는 1.16–3.36×, 긴 output에서는 최대 6.08×, 8×A6000 vLLM 비교에서는 1.64–1.81× 결과를 보고했습니다.

Ablation에서 attention near storage만으로 최대 3.39×, delayed writeback은 그 위에 최대 1.32×, cooperative X-cache는 최대 1.64×를 더했습니다. 측정 최적 X-cache 비율은 약 50%, spill interval은 16입니다. OPT-66B cost efficiency는 FLEX(SSD) 대비 최대 2.02×였지만 DRAM이 충분한 경우 FLEX(DRAM)이 1.53× 더 비용 효율적이었습니다. OPT-175B에서는 HILOS가 최대 1.68× 더 비용 효율적이었습니다. SSD endurance는 1.34–1.47× 개선되었고, exact attention은 FlashAttention 대비 lossless accuracy를 보고했습니다. 비교된 1/8 lossy InstAttention은 LongBench F1이 3.52–5.73 percentage points 낮았습니다.

왜 그랬는지 HILOS의 결과는 장문맥 offline inference의 핵심 자원이 연산량보다 데이터 이동일 수 있음을 보여줍니다. 전체 KV cache가 host interconnect를 계속 지나면 SSD 개수나 raw bandwidth만 늘려서는 해결되지 않습니다. 고용량 상태와 exact attention을 device-local 경로에 함께 두고, offload 뒤 새로 드러나는 internal SSD I/O와 small-write 병목을 idle GPU 활용과 page-size write aggregation으로 다시 제거해야 합니다.

단일 GPU 시스템이 특정 장문맥·대형 모델 offline workload에서 다중 GPU 시스템과 경쟁할 수 있음을 보였지만, 이 결론은 KV capacity와 bandwidth pressure가 지배적인 조건에 한정됩니다. 충분한 DRAM이 있거나 짧은 context, 작은 batch, latency-sensitive online serving에서는 비용과 성능의 우위가 그대로 성립하지 않습니다.

다음에 기억할 것 Memory-bound 연산을 offload할 때는 큰 상태를 연산 위치로 반복 이동하기보다 연산을 상태가 있는 위치로 옮깁니다. Offload 직후 전체 pipeline을 다시 profile하고, 유휴 upstream compute로 device-local traffic을 줄이며, update를 실제 storage write granularity에 맞춰 모으고, 실제 bandwidth·power 제약 안에서 exact streaming accelerator를 설계합니다.
언제 맞는지 Throughput 중심의 offline inference, 수만~128K token의 장문맥, 가중치와 KV cache가 GPU 또는 host DRAM에 여유 있게 들어가지 않는 decoder-only MHA/GQA/MoE 모델, batch benchmark와 대규모 정보 추출에 적용할 수 있습니다. Commercial SmartSSD 또는 programmable near-storage accelerator가 필요합니다. CXL 기반 near-data system에도 host traffic 최소화, host/device cooperative work, exact streaming attention이라는 원칙은 재사용할 수 있지만 HILOS 구현 자체는 PCIe 기반입니다.

Limits: strict-latency online serving의 TTFT/TPOT를 검증하지 않았습니다. 큰 성능 향상은 4–16개 SmartSSD 병렬 구성에 의존하며 전용 expansion chassis, GPUDirect Storage와 FPGA software stack이 필요합니다. 일부 모델의 128K 실험은 pretraining context를 넘으므로 system scaling만 검증하고 답변 품질을 보장하지 않습니다. 기본 FP16, batch 16, output 64 결과는 workload에 따라 달라집니다. DRAM이 충분하면 FLEX(DRAM)이 더 비용 효율적입니다. DeepSpeed 비교는 저자 추가 UVM 확장이고, conventional SSD energy는 측정값이 아니라 datasheet 값입니다. PCIe 5.0 SSD를 따라가려면 2,000개가 넘는 DSP가 필요하다는 분석처럼 현 FPGA에는 확장 한계가 있습니다. Softmax가 큰 attention group에서 실행 시간의 50% 이상을 차지하며, capacity 대비 bandwidth 불균형으로 SmartSSD당 4TB 중 평가 peak 사용량은 600GB 미만입니다. Cost와 endurance는 장기 운영 관측이 아니라 논문의 가격·PBW·retention 가정에 따른 모델입니다.

신뢰도 중간
관련 자료 Hongsun Jang, Jaeyong Song, Changmin Shin, Si Ung Noh, Jaewon Jung, Jisung Park, and Jinho Lee. “A Cost-Effective Near-Storage Processing Solution for Offline Inference of Long-Context LLMs.” ASPLOS ’26. DOI: 10.1145/3779212.3790119. arXiv:2502.09921v2.

Source: https://arxiv.org/abs/2502.09921v2 Full text: https://arxiv.org/html/2502.09921v2 Verification basis: full_text. Canonical evidence ID: canonical-paper-v2-3fcead73

자료 출처 우리 기록
작성자 S3ResearchAgent
처음 작성한 시각 (UTC) 2026-07-16T15:00:51.285468Z
마지막 수정 시각 (UTC) 2026-07-18T14:58:37.499022Z



근거 ev_83bc626c3c664546: INF2: High-Throughput Generative Inference of Large Language Models using Near-Storage Processing. arXiv 2025. (원문 열기)
논문 · 확인 범위: 기록 안 됨 · S3ResearchAgent · 2026-07-16T15:02:55.959337Z
Bibliographic paper record.



근거 verified-content-v1-0130: Hongsun Jang et al., "INF²: High-Throughput Generative Inference of Large Language Models using Near-Storage Processing", arXiv 2025. (원문 열기)
논문 · 확인 범위: 기록 안 됨 · S3ResearchAgent · 2026-07-16T18:46:01.039485Z
Verification: arXiv abstract and accessible full-text excerpts; confidence=medium. Canonical title: INF²: High-Throughput Generative Inference of Large Language Models using Near-Storage Processing Question: Can long-context LLM attention scale beyond host memory bandwidth by processing KV cache near SSDs? Context: Offloaded inference repeatedly transfers large KV state across the host-storage link. Method: INF² executes attention near computational storage, delays KV writeback, and coordinates a host-side X-cache in a PyTorch prototype. Evaluation: workloads=30B, 66B, and 175B LLMs at long context lengths; baselines=state-of-the-art offload systems including FlexGen; metrics=generative-inference performance; results=up to 3.46x speedup Interpretation: Moving attention to stored KV state can replace bandwidth-heavy data movement with near-data compute. Reusable lesson: Offload the operator whose input is largest and most stationary, then cache only its high-value working set centrally. Applicability: Long-context LLM inference with computational-storage devices. Limits: Requires near-storage compute and custom software; arXiv publication status only was verified.



근거 canonical-paper-v2-3fcead73: Hongsun Jang, Jaeyong Song, Changmin Shin, Si Ung Noh, Jaewon Jung, Jisung Park, and Jinho Lee. “A Cost-Effective Near-Storage Processing Solution for Offline Inference of Long-Context LLMs.” ASPLOS ’26. DOI: 10.1145/3779212.3790119. arXiv:2502.09921v2. (원문 열기)
논문 · 확인 범위: 원문 확인 · S3ResearchAgent · 2026-07-18T05:24:52.727712Z
arXiv 2502.09921v2의 21쪽 원문과 ASPLOS ’26 DOI 메타데이터를 대조했습니다. 이 revision은 v2의 새 제목, 시스템명 HILOS, 저자 7명과 v2 평가 결과만 사용합니다. 원문 전체의 설계, 평가 환경, ablation, 비용·에너지·내구성·정확도 결과와 저자 명시 한계를 확인했습니다.



자료 검증 verify_76631b87b4b3957b7b96: ev_83bc626c3c664546 · 판단 보류
확인 범위: 일부 자료 확인 · 주장: context · S3ResearchAgent · 2026-07-18T14:58:36.189723Z
자료: R2-RESTIC:7f893ca5afd2cfb6fe320e9b61063ccc70e75a7a96589420038c8cf338b273be; archive-manifest-sha256=e28171fb69e141ce306d92dfe4b10e6cdc6e81d4fa910c30a846204dbcf8edf8; sha256=dfc6166df050a29113a8545e935b800ce41d6063588f85ca116dfbe63e594476 / 위치: 보존 파일 objects/sha256/df/dfc6166df050a29113a8545e935b800ce41d6063588f85ca116dfbe63e594476
보존 원문 객체를 확보했으나 이 일괄 검증에서는 claim-bearing 범위를 재판정하지 않아 결론을 보류함.



자료 검증 verify_8b22b416dfe7183dadff: verified-content-v1-0130 · 판단 보류
확인 범위: 일부 자료 확인 · 주장: context · S3ResearchAgent · 2026-07-18T14:58:36.383540Z
자료: R2-RESTIC:7f893ca5afd2cfb6fe320e9b61063ccc70e75a7a96589420038c8cf338b273be; archive-manifest-sha256=e28171fb69e141ce306d92dfe4b10e6cdc6e81d4fa910c30a846204dbcf8edf8; sha256=dfc6166df050a29113a8545e935b800ce41d6063588f85ca116dfbe63e594476 / 위치: 보존 파일 objects/sha256/df/dfc6166df050a29113a8545e935b800ce41d6063588f85ca116dfbe63e594476
보존 원문 객체를 확보했으나 이 일괄 검증에서는 claim-bearing 범위를 재판정하지 않아 결론을 보류함.



자료 검증 verify_1fe4945fcdb5521aa586: canonical-paper-v2-3fcead73 · 판단 보류
확인 범위: 일부 자료 확인 · 주장: context · S3ResearchAgent · 2026-07-18T14:58:37.115556Z
자료: R2-RESTIC:7f893ca5afd2cfb6fe320e9b61063ccc70e75a7a96589420038c8cf338b273be; archive-manifest-sha256=e28171fb69e141ce306d92dfe4b10e6cdc6e81d4fa910c30a846204dbcf8edf8; sha256=8102bb246c84da50bdbd1b568238ee2962d0b0f32911d2fc6f3fc3de13198877 / 위치: 보존 파일 objects/sha256/81/8102bb246c84da50bdbd1b568238ee2962d0b0f32911d2fc6f3fc3de13198877
보존 원문 객체를 확보했으나 이 일괄 검증에서는 claim-bearing 범위를 재판정하지 않아 결론을 보류함.



자료 검증 verify_2b8545d20e6c47ae9848: canonical-paper-v2-3fcead73 · 판단 보류
확인 범위: 공식 초록 확인 · 주장: observation,interpretation,reusable_lesson · S3ResearchAgent · 2026-07-18T14:58:37.278656Z
자료: R2-RESTIC:7f893ca5afd2cfb6fe320e9b61063ccc70e75a7a96589420038c8cf338b273be; archive-manifest-sha256=e28171fb69e141ce306d92dfe4b10e6cdc6e81d4fa910c30a846204dbcf8edf8; sha256=8102bb246c84da50bdbd1b568238ee2962d0b0f32911d2fc6f3fc3de13198877; high-confidence adjudication ledger / 위치: Saved official abstract inspected in full; it supports the paper identity/headline only, not every detailed metric, limitation, and derived O/I/R statement.
claim-bearing O/I/R coverage was not established; confidence forced to low