속성으로 검색
외관
이 문서는 속성과 이름이 지정된 값으로 설명된 개체를 찾기 위한 간단한 탐색 인터페이스를 제공합니다. 그 밖에 사용 가능한 검색 인터페이스에는 문서 속성 검색 및 Ask 쿼리 빌더가 있습니다.
결과 목록
- Lesson:technical review memsos os guided selective memory mirroring 4aec983d + (기존 최신 partial mirroring 대비 시스템 FIT를 최대 19,000배 낮춤. 성능 오버헤드 3% 미만이며, 여러 경우 full mirroring에 근접한 신뢰성을 보고.)
- Lesson:memsos os guided selective memory mirroring ac9aab48 + (기존 최신 partial mirroring 대비 시스템 FIT를 최대 19,000배 낮춤. 성능 오버헤드 3% 미만이며, 여러 경우 full mirroring에 근접한 신뢰성을 보고.)
- Lesson:dwkv metric mismatch + (단일 corrected seed에서 DW-KV-order-only는 valu … 단일 corrected seed에서 DW-KV-order-only는 value-weighted tardiness 2398 ms로 최저였지만 premium miss 36.4%였고, tier-priority와 length-aware는 premium miss 12.1%였다. DW-KV premium E2E p90은 약 33.1 s, tier-priority는 약 6.0 s였다. 같은 run에서 KV denominator 기여는 value-urgency 2492→DW-KV 2398 ms, 3.8%였으며 single-seed/unverified였다.2398 ms, 3.8%였으며 single-seed/unverified였다.)
- Lesson:technical review efficient function call tracing with link time binary rewriting for ce devices 0c5c62cb + (두 개의 주요 embedded processor architecture를 지원했고, 실제 embedded software에서 program activity를 성공적으로 수집하면서 overhead가 미미했다고 보고한다. 공개 초록에 수치는 없다.)
- Lesson:efficient function call tracing with link time binary rewriting for ce devices 0fd13b41 + (두 개의 주요 embedded processor architecture를 지원했고, 실제 embedded software에서 program activity를 성공적으로 수집하면서 overhead가 미미했다고 보고한다. 공개 초록에 수치는 없다.)
- Lesson:technical review 5b128265 + (두 공유 모델의 성능과 멀티테넌시 특성을 실험적으로 비교했다고 공식 초록이 설명하지만 정량 수치는 공개하지 않는다.)
- Lesson:lesson 0bcd6499 + (두 공유 모델의 성능과 멀티테넌시 특성을 실험적으로 비교했다고 공식 초록이 설명하지만 정량 수치는 공개하지 않는다.)
- Lesson:technical review twob a two tier web browser architecture optimized for mobile network 448d8064 + (모바일 구간 패킷 수를 최대 52%, 평균 페이지 로딩시간을 최대 37% 줄였다.)
- Lesson:twob a two tier web browser architecture optimized for mobile network 1b67a324 + (모바일 구간 패킷 수를 최대 52%, 평균 페이지 로딩시간을 최대 37% 줄였다.)
- Lesson:a hybrid web browser architecture for mobile devices 0a9118ea + (모바일망 패킷 수를 최대 42%, 평균 페이지 로딩시간을 최대 52% 줄였다.)
- Lesson:technical review a hybrid web browser architecture for mobile devices 19197da7 + (모바일망 패킷 수를 최대 42%, 평균 페이지 로딩시간을 최대 52% 줄였다.)
- Lesson:technical review cache scheme of shared buffer mappings for energy efficiency of mobile devices f1dee859 + (상용 smartphone system 대비 video playback 중 processor utilization 약 64%, energy consumption 약 17% 감소를 보고한다.)
- Lesson:cache scheme of shared buffer mappings for energy efficiency of mobile devices 4b6db791 + (상용 smartphone system 대비 video playback 중 processor utilization 약 64%, energy consumption 약 17% 감소를 보고한다.)
- Lesson:technical review smartlmk a memory reclamation scheme for improving user perceived app launch ti e990e433 + (실제 Android smartphone에서 user-perceived app launch time을 최대 13.2% 개선했다.)
- Lesson:smartlmk a memory reclamation scheme for improving user perceived app launch time d60522c6 + (실제 Android smartphone에서 user-perceived app launch time을 최대 13.2% 개선했다.)
- Lesson:technical review a performance stable numa management scheme for linux based hpc systems e846c351 + (실행시간 CV의 기하평균을 Linux 대비 53-54% 개선했고, 실행시간을 7-25% 줄였으며, inter-NUMA migration을 21-53% 줄였다. 비교 기준과 서버에 따라 값은 달라진다.)
- Lesson:a performance stable numa management scheme for linux based hpc systems 6533e8f2 + (실행시간 CV의 기하평균을 Linux 대비 53-54% 개선했고, 실행시간을 7-25% 줄였으며, inter-NUMA migration을 21-53% 줄였다. 비교 기준과 서버에 따라 값은 달라진다.)
- Lesson:dwkv failed run fail closed + (예를 들어 control은 seeds 1–5만 존재했고, 다른 payload … 예를 들어 control은 seeds 1–5만 존재했고, 다른 payload는 1,800 requests 중 3개, 2,400 중 4개, 2,400 중 20개가 실패했다. patch cells는 다른 process의 prompt pool을 사용해 pair-mate와 workload가 달라졌다. `FAILED_RUNS.md`는 10개 artifact를 paper_grade=false로 분류하고 Git commit/SHA-256/recovery path를 보존한다.하고 Git commit/SHA-256/recovery path를 보존한다.)
- Lesson:dwkv doomed chase domino + (이미 deadline을 맞출 수 없는 request가 최대 priority를 … 이미 deadline을 맞출 수 없는 request가 최대 priority를 얻어 capacity를 소비하고, 다른 request를 doomed 상태로 밀어 다시 최고 urgency를 부여하는 domino가 관찰되었다. `demote`는 laxity<=0 request를 urgency floor로 낮췄고, archive GPU comparison에서는 rate 6에서 DW-KV weighted miss가 73.8%→42.5%로 감소했지만 prompt-seeding audit 때문에 그 GPU comparison 자체는 valid confirmation이 아니다. GPU에서는 KV denominator 차이도 유의하지 않았다.ion이 아니다. GPU에서는 KV denominator 차이도 유의하지 않았다.)
- Lesson:technical review transparent and selective real time interrupt services for performance improvem b78f264b + (이전 접근과 거의 같은 scheduling latency를 유지하면서 Hackbench throughput을 최대 86% 개선했다.)
- Lesson:transparent and selective real time interrupt services for performance improvement 6b173779 + (이전 접근과 거의 같은 scheduling latency를 유지하면서 Hackbench throughput을 최대 86% 개선했다.)
- Lesson:technical review cpc coordinated page cache for serverless computing a8af4792 + (이질적 함수가 한 worker를 공유할 때 AWS Lambda 대비 메모리 사용 최대 32.0% 감소. Azure trace 기반 평가에서 eviction 감소로 p99 latency 41.2% 감소.)
- Lesson:cpc coordinated page cache for serverless computing ff3acc8c + (이질적 함수가 한 worker를 공유할 때 AWS Lambda 대비 메모리 사용 최대 32.0% 감소. Azure trace 기반 평가에서 eviction 감소로 p99 latency 41.2% 감소.)
- Lesson:optimizing the startup time of embedded systems a case study of digital tv 7f9199bd + (총 startup time을 35% 줄였다.)
- Lesson:technical review optimizing the startup time of embedded systems a case study of digital tv cd15688d + (총 startup time을 35% 줄였다.)
- Lesson:technical review dflop a data driven framework for multimodal llm training pipeline optimization 9bf046db + (최대 8개 HGX A100 노드(64 GPU), LLaVA-OneVision/InternVL 계열 7B~72B 평가에서 PyTorch 및 Megatron-LM 대비 처리량 최대 3.6배. GPU idle time은 PyTorch 대비 최대 82%, Megatron-LM 대비 최대 84% 감소.)
- Lesson:dflop a data driven framework for multimodal llm training pipeline optimization f26871c0 + (최대 8개 HGX A100 노드(64 GPU), LLaVA-OneVision/InternVL 계열 7B~72B 평가에서 PyTorch 및 Megatron-LM 대비 처리량 최대 3.6배. GPU idle time은 PyTorch 대비 최대 82%, Megatron-LM 대비 최대 84% 감소.)
- Lesson:dwkv score code contract + (코드상 DW-KV는 `tier_value * urgency / kv_foot … 코드상 DW-KV는 `tier_value * urgency / kv_footprint`, value-urgency는 denominator 없이 `tier_value * urgency`, tier-priority는 value만 사용하고, KV-footprint은 prompt+max output footprint의 역수를 사용한다. `demote`는 raw_laxity<=0일 때 urgency floor로 내리며, tests는 tier ordering, urgency override, KV denominator isolation, ablation semantics를 검증한다.ominator isolation, ablation semantics를 검증한다.)
- Lesson:inf2 high throughput generative inference of large language models using near storage processing 3fcead73 + (평가 장비는 NVIDIA A100 40GB 또는 H100 80GB, Inte … 평가 장비는 NVIDIA A100 40GB 또는 H100 80GB, Intel Xeon Gold 6342(24 cores/48 threads), 1,632GB DDR4-3200입니다. HILOS는 최대 16개의 Samsung SmartSSD(각 3.84TB NVMe, Kintex UltraScale+ KU15P FPGA, 4GB device DRAM)를 PCIe expansion chassis의 aggregate PCIe 4.0×16에 연결했습니다. Conventional baseline은 같은 16 host lanes에 Samsung PM9A3 3.84TB SSD 4개를 사용했습니다. Software는 Ubuntu 20.04, PyTorch 2.4.1, DeepSpeed 1.15.1, CUDA 12.1과 Vitis/XRT입니다.</br></br>Workload는 OPT-30B/66B/175B, Qwen2.5-32B, Mixtral-8×7B, GLaM-143B이며 context는 최대 128K, 기본 batch 16, FP16, output 64 tokens입니다. Baseline은 FLEX(DRAM), FLEX(SSD), FPGA를 끈 16개의 PCIe 3.0 SmartSSD, 저자들이 UVM을 추가한 DS+UVM(DRAM), 별도 8×RTX A6000 vLLM cluster입니다.</br></br>핵심 결과는 conventional SSD offloading 대비 최대 7.86× throughput과 최대 85% energy reduction입니다. 4개 SmartSSD는 FLEX(DRAM)보다 1.10–1.36×, 16개는 1.88–2.49× 빨랐습니다. FLEX(DRAM)이 batch 1도 실행하지 못한 설정에서는 FLEX(SSD)보다 5.3–7.8× 빨랐습니다. FPGA를 끈 16개 SSD는 FLEX(SSD)의 0.64–0.94×에 그쳐 SSD 수만 늘리는 것으로는 부족함을 보였습니다. GQA/MoE에서는 1.16–3.36×, 긴 output에서는 최대 6.08×, 8×A6000 vLLM 비교에서는 1.64–1.81× 결과를 보고했습니다.</br></br>Ablation에서 attention near storage만으로 최대 3.39×, delayed writeback은 그 위에 최대 1.32×, cooperative X-cache는 최대 1.64×를 더했습니다. 측정 최적 X-cache 비율은 약 50%, spill interval은 16입니다. OPT-66B cost efficiency는 FLEX(SSD) 대비 최대 2.02×였지만 DRAM이 충분한 경우 FLEX(DRAM)이 1.53× 더 비용 효율적이었습니다. OPT-175B에서는 HILOS가 최대 1.68× 더 비용 효율적이었습니다. SSD endurance는 1.34–1.47× 개선되었고, exact attention은 FlashAttention 대비 lossless accuracy를 보고했습니다. 비교된 1/8 lossy InstAttention은 LongBench F1이 3.52–5.73 percentage points 낮았습니다.nch F1이 3.52–5.73 percentage points 낮았습니다.)
- Lesson:technical review selective memory deduplication for cost efficiency in mobile smart devices ef7d0fd2 + (프로토타입은 기존 접근과 같은 메모리 절감을 제공하면서 계산비용을 크게 줄였고, 확보한 메모리로 앱 실행시간도 개선했다. 공식 초록에는 수치가 없다.)
- Lesson:selective memory deduplication for cost efficiency in mobile smart devices 9f3139a0 + (프로토타입은 기존 접근과 같은 메모리 절감을 제공하면서 계산비용을 크게 줄였고, 확보한 메모리로 앱 실행시간도 개선했다. 공식 초록에는 수치가 없다.)
- Lesson:dwkv prompt seed bug + (한 process 안에서는 모든 seed가 같은 prompt sequence … 한 process 안에서는 모든 seed가 같은 prompt sequence를 재사용했고, 별도 process에서 같은 seed를 실행하면 unseeded shuffle 때문에 서로 다른 prompt workload가 되었다. 따라서 prompt length가 만드는 decode-work variance를 seed가 샘플링하지 못했고, pair-mate도 보장되지 않았다. pre-fix GPU artifacts와 patch cells는 모두 retracted/paper_grade=false로 분류되었다.ls는 모두 retracted/paper_grade=false로 분류되었다.)
- Lesson:technical review speculative multi level access in lsm tree based kv store 733f947b + (현실적 KV workload에서 기존 방식 대비 throughput 최대 85% 증가. 평균 latency 최대 45% 감소.)
- Lesson:speculative multi level access in lsm tree based kv store 72e42f29 + (현실적 KV workload에서 기존 방식 대비 throughput 최대 85% 증가. 평균 latency 최대 45% 감소.)
- Lesson:intel accelerator ecosystem an soc oriented perspective bc8f0d20 + (현재 공개 근거로 확인할 수 있는 것은 제목과 제한된 서지 메타데이터뿐이다. workload, baseline, metric, 정량 결과는 확인되지 않았다.)
- Lesson:what you cant forget exploiting parallelism for zoned namespaces 8d6c7c8e + (현재 공개 근거로 확인할 수 있는 것은 제목과 제한된 서지 메타데이터뿐이다. workload, baseline, metric, 정량 결과는 확인되지 않았다.)
- Lesson:pruneoff offloading lsm read path pruning in disaggregated key value stores f03d7e8e + (현재 확인된 것은 작업 제목뿐입니다. 출판 여부, workload, baseline, metric, 구현과 정량 결과는 확인되지 않았습니다.)
- Lesson:demand based coordinated scheduling for smp vms a57bd76a + (혼합 PARSEC workloads에서 불필요한 synchronization latency와 CPU 소비를 줄여 전체 성능을 개선했으며, 특히 communication-intensive application에서 효과가 컸다. 공식 초록에는 정량값이 없다.)
- Lesson:technical review demand based coordinated scheduling for smp vms 3d4e78ab + (혼합 PARSEC workloads에서 불필요한 synchronization latency와 CPU 소비를 줄여 전체 성능을 개선했으며, 특히 communication-intensive application에서 효과가 컸다. 공식 초록에는 정량값이 없다.)
- Lesson:memory deduplication in mobile systems 063e8b2e + (확인된 사실은 Jinkyu Jeong·Hwanju Kim·Euiseong Seo·Joonwon Lee의 poster가 2012년 7월 서울에서 열린 ApSys 프로그램에 해당한다는 점이다. 메모리 절감량, CPU 비용, latency와 workload는 확인되지 않았다.)
- Lesson:how storage i o affects user perceived latency in mobile apps b59ccb75 + (확인된 사실은 Junghoon Kim·Sangwook Kim·Joonwon Lee·Jinkyu Jeong의 poster가 2015년 4월 Bordeaux에서 열린 EuroSys 2015 프로그램에 포함됐다는 점이다. 기기, 앱, workload, metric과 정량 결과는 확인되지 않았다.)
- Lesson:gpu c88d9a4d + (확인된 사실은 권상윤·안민우·정진규가 이 제목의 논문을 KSC 2022에 발표했다는 서지정보뿐이다. GPU 종류, 커널, baseline, metric, 예측 정확도와 speedup은 공개 근거에서 확인되지 않았다.)
- Lesson:nvme prp zero copy 76cd53aa + (확인된 사실은 김성환·이규선·정진규의 논문이 KCC 2019 학술발표논문집 1432–1434쪽에 수록됐다는 점이다. 장치, I/O 크기, CPU 사용량, latency·throughput 결과는 확인되지 않았다.)
- Lesson:lesson 5fa267f2 + (확인된 사실은 성민철·권세준·정진규의 이 논문이 2015년 한국정보과학회 동계학술발표회에 발표됐고 학부생부문 최우수상을 받았다는 점이다. 실험 조건과 정량 결과는 확인되지 않았다.)
- Lesson:lesson 3f05b8ca + (확인된 사실은 신석하·이규선·정진규가 이 제목의 논문을 KSC 2017에서 발표했다는 점이다. 저장장치, I/O 크기, CPU 구성, baseline, latency·throughput 수치는 확인되지 않았다.)
- Lesson:nvme bb91a49b + (확인된 사실은 우지원·이규선·정진규의 논문이 KCC 2019 학술발표논문집 1464–1466쪽에 수록됐다는 점이다. 장치, workload, baseline, fairness·latency·throughput 결과는 확인되지 않았다.)