본문으로 이동

속성으로 검색

이 문서는 속성과 이름이 지정된 값으로 설명된 개체를 찾기 위한 간단한 탐색 인터페이스를 제공합니다. 그 밖에 사용 가능한 검색 인터페이스에는 문서 속성 검색Ask 쿼리 빌더가 있습니다.

속성으로 검색

"총 startup time을 35% 줄였다." 값의 "Observation" 속성을 가진 모든 문서의 목록입니다. 결과가 얼마 안 되기 때문에 주변의 값을 표시합니다.

1번 부터의 결과 23개입니다.

(이전 50개 | 다음 50개) (20 | 50 | 100 | 250 | 500) 보기


    

결과 목록

  • Lesson:technical review dflop a data driven framework for multimodal llm training pipeline optimization 9bf046db  + (최대 8개 HGX A100 노드(64 GPU), LLaVA-OneVision/InternVL 계열 7B~72B 평가에서 PyTorch 및 Megatron-LM 대비 처리량 최대 3.6배. GPU idle time은 PyTorch 대비 최대 82%, Megatron-LM 대비 최대 84% 감소.)
  • Lesson:dflop a data driven framework for multimodal llm training pipeline optimization f26871c0  + (최대 8개 HGX A100 노드(64 GPU), LLaVA-OneVision/InternVL 계열 7B~72B 평가에서 PyTorch 및 Megatron-LM 대비 처리량 최대 3.6배. GPU idle time은 PyTorch 대비 최대 82%, Megatron-LM 대비 최대 84% 감소.)
  • Lesson:dwkv score code contract  + (코드상 DW-KV는 `tier_value * urgency / kv_foot코드상 DW-KV는 `tier_value * urgency / kv_footprint`, value-urgency는 denominator 없이 `tier_value * urgency`, tier-priority는 value만 사용하고, KV-footprint은 prompt+max output footprint의 역수를 사용한다. `demote`는 raw_laxity<=0일 때 urgency floor로 내리며, tests는 tier ordering, urgency override, KV denominator isolation, ablation semantics를 검증한다.ominator isolation, ablation semantics를 검증한다.)
  • Lesson:inf2 high throughput generative inference of large language models using near storage processing 3fcead73  + (평가 장비는 NVIDIA A100 40GB 또는 H100 80GB, Inte평가 장비는 NVIDIA A100 40GB 또는 H100 80GB, Intel Xeon Gold 6342(24 cores/48 threads), 1,632GB DDR4-3200입니다. HILOS는 최대 16개의 Samsung SmartSSD(각 3.84TB NVMe, Kintex UltraScale+ KU15P FPGA, 4GB device DRAM)를 PCIe expansion chassis의 aggregate PCIe 4.0×16에 연결했습니다. Conventional baseline은 같은 16 host lanes에 Samsung PM9A3 3.84TB SSD 4개를 사용했습니다. Software는 Ubuntu 20.04, PyTorch 2.4.1, DeepSpeed 1.15.1, CUDA 12.1과 Vitis/XRT입니다.</br></br>Workload는 OPT-30B/66B/175B, Qwen2.5-32B, Mixtral-8×7B, GLaM-143B이며 context는 최대 128K, 기본 batch 16, FP16, output 64 tokens입니다. Baseline은 FLEX(DRAM), FLEX(SSD), FPGA를 끈 16개의 PCIe 3.0 SmartSSD, 저자들이 UVM을 추가한 DS+UVM(DRAM), 별도 8×RTX A6000 vLLM cluster입니다.</br></br>핵심 결과는 conventional SSD offloading 대비 최대 7.86× throughput과 최대 85% energy reduction입니다. 4개 SmartSSD는 FLEX(DRAM)보다 1.10–1.36×, 16개는 1.88–2.49× 빨랐습니다. FLEX(DRAM)이 batch 1도 실행하지 못한 설정에서는 FLEX(SSD)보다 5.3–7.8× 빨랐습니다. FPGA를 끈 16개 SSD는 FLEX(SSD)의 0.64–0.94×에 그쳐 SSD 수만 늘리는 것으로는 부족함을 보였습니다. GQA/MoE에서는 1.16–3.36×, 긴 output에서는 최대 6.08×, 8×A6000 vLLM 비교에서는 1.64–1.81× 결과를 보고했습니다.</br></br>Ablation에서 attention near storage만으로 최대 3.39×, delayed writeback은 그 위에 최대 1.32×, cooperative X-cache는 최대 1.64×를 더했습니다. 측정 최적 X-cache 비율은 약 50%, spill interval은 16입니다. OPT-66B cost efficiency는 FLEX(SSD) 대비 최대 2.02×였지만 DRAM이 충분한 경우 FLEX(DRAM)이 1.53× 더 비용 효율적이었습니다. OPT-175B에서는 HILOS가 최대 1.68× 더 비용 효율적이었습니다. SSD endurance는 1.34–1.47× 개선되었고, exact attention은 FlashAttention 대비 lossless accuracy를 보고했습니다. 비교된 1/8 lossy InstAttention은 LongBench F1이 3.52–5.73 percentage points 낮았습니다.nch F1이 3.52–5.73 percentage points 낮았습니다.)
  • Lesson:technical review selective memory deduplication for cost efficiency in mobile smart devices ef7d0fd2  + (프로토타입은 기존 접근과 같은 메모리 절감을 제공하면서 계산비용을 크게 줄였고, 확보한 메모리로 앱 실행시간도 개선했다. 공식 초록에는 수치가 없다.)
  • Lesson:selective memory deduplication for cost efficiency in mobile smart devices 9f3139a0  + (프로토타입은 기존 접근과 같은 메모리 절감을 제공하면서 계산비용을 크게 줄였고, 확보한 메모리로 앱 실행시간도 개선했다. 공식 초록에는 수치가 없다.)
  • Lesson:dwkv prompt seed bug  + (한 process 안에서는 모든 seed가 같은 prompt sequence한 process 안에서는 모든 seed가 같은 prompt sequence를 재사용했고, 별도 process에서 같은 seed를 실행하면 unseeded shuffle 때문에 서로 다른 prompt workload가 되었다. 따라서 prompt length가 만드는 decode-work variance를 seed가 샘플링하지 못했고, pair-mate도 보장되지 않았다. pre-fix GPU artifacts와 patch cells는 모두 retracted/paper_grade=false로 분류되었다.ls는 모두 retracted/paper_grade=false로 분류되었다.)
  • Lesson:technical review speculative multi level access in lsm tree based kv store 733f947b  + (현실적 KV workload에서 기존 방식 대비 throughput 최대 85% 증가. 평균 latency 최대 45% 감소.)
  • Lesson:speculative multi level access in lsm tree based kv store 72e42f29  + (현실적 KV workload에서 기존 방식 대비 throughput 최대 85% 증가. 평균 latency 최대 45% 감소.)
  • Lesson:intel accelerator ecosystem an soc oriented perspective bc8f0d20  + (현재 공개 근거로 확인할 수 있는 것은 제목과 제한된 서지 메타데이터뿐이다. workload, baseline, metric, 정량 결과는 확인되지 않았다.)
  • Lesson:what you cant forget exploiting parallelism for zoned namespaces 8d6c7c8e  + (현재 공개 근거로 확인할 수 있는 것은 제목과 제한된 서지 메타데이터뿐이다. workload, baseline, metric, 정량 결과는 확인되지 않았다.)
  • Lesson:pruneoff offloading lsm read path pruning in disaggregated key value stores f03d7e8e  + (현재 확인된 것은 작업 제목뿐입니다. 출판 여부, workload, baseline, metric, 구현과 정량 결과는 확인되지 않았습니다.)
  • Lesson:demand based coordinated scheduling for smp vms a57bd76a  + (혼합 PARSEC workloads에서 불필요한 synchronization latency와 CPU 소비를 줄여 전체 성능을 개선했으며, 특히 communication-intensive application에서 효과가 컸다. 공식 초록에는 정량값이 없다.)
  • Lesson:technical review demand based coordinated scheduling for smp vms 3d4e78ab  + (혼합 PARSEC workloads에서 불필요한 synchronization latency와 CPU 소비를 줄여 전체 성능을 개선했으며, 특히 communication-intensive application에서 효과가 컸다. 공식 초록에는 정량값이 없다.)
  • Lesson:memory deduplication in mobile systems 063e8b2e  + (확인된 사실은 Jinkyu Jeong·Hwanju Kim·Euiseong Seo·Joonwon Lee의 poster가 2012년 7월 서울에서 열린 ApSys 프로그램에 해당한다는 점이다. 메모리 절감량, CPU 비용, latency와 workload는 확인되지 않았다.)
  • Lesson:how storage i o affects user perceived latency in mobile apps b59ccb75  + (확인된 사실은 Junghoon Kim·Sangwook Kim·Joonwon Lee·Jinkyu Jeong의 poster가 2015년 4월 Bordeaux에서 열린 EuroSys 2015 프로그램에 포함됐다는 점이다. 기기, 앱, workload, metric과 정량 결과는 확인되지 않았다.)
  • Lesson:gpu c88d9a4d  + (확인된 사실은 권상윤·안민우·정진규가 이 제목의 논문을 KSC 2022에 발표했다는 서지정보뿐이다. GPU 종류, 커널, baseline, metric, 예측 정확도와 speedup은 공개 근거에서 확인되지 않았다.)
  • Lesson:nvme prp zero copy 76cd53aa  + (확인된 사실은 김성환·이규선·정진규의 논문이 KCC 2019 학술발표논문집 1432–1434쪽에 수록됐다는 점이다. 장치, I/O 크기, CPU 사용량, latency·throughput 결과는 확인되지 않았다.)
  • Lesson:lesson 5fa267f2  + (확인된 사실은 성민철·권세준·정진규의 이 논문이 2015년 한국정보과학회 동계학술발표회에 발표됐고 학부생부문 최우수상을 받았다는 점이다. 실험 조건과 정량 결과는 확인되지 않았다.)
  • Lesson:lesson 3f05b8ca  + (확인된 사실은 신석하·이규선·정진규가 이 제목의 논문을 KSC 2017에서 발표했다는 점이다. 저장장치, I/O 크기, CPU 구성, baseline, latency·throughput 수치는 확인되지 않았다.)
  • Lesson:nvme bb91a49b  + (확인된 사실은 우지원·이규선·정진규의 논문이 KCC 2019 학술발표논문집 1464–1466쪽에 수록됐다는 점이다. 장치, workload, baseline, fairness·latency·throughput 결과는 확인되지 않았다.)