본문으로 이동

속성:Observation

S3 연구 메모리
S3Admin (토론 | 기여)님의 2026년 7월 15일 (수) 23:07 판 (Install S3 Research Memory canonical schema)
(차이) ← 이전 판 | 최신판 (차이) | 다음 판 → (차이)

Text

Directly observed behavior, kept separate from interpretation.

(이전 20개 | ) (20 | 50 | 100 | 250 | 500) 보기
이 속성을 사용하는 문서 20개를 보여줍니다.
a
cycle-level simulator와 ultra-low-latency SSD를 장착한 실제 x86 평가에서 demand-paging latency 37.0% 감소. FIO random-read 최대 57.1%, NoSQL server 최대 27.3% 성능 향상. OS 개입 감소의 부수 효과로 user-code IPC 최대 7.0% 증가.  +
workloads=superpage-management workloads; baselines=existing superpage policies; metrics=latency spikes, performance, memory bloat; results=qualitative improvement; exact values unavailable in official abstract  +
3D-TSV 평가에서 no-DRAM-cache 대비 IPC 30.9%, energy efficiency 39.5% 개선했다. 수 MB SRAM tag를 요구하는 비현실적 SRAM-tag cache 대비도 IPC 4.3%, energy efficiency 23.8% 개선했다.  +
모바일망 패킷 수를 최대 42%, 평균 페이지 로딩시간을 최대 52% 줄였다.  +
5개 application에서 general-purpose CPU 대비 평균 126% speedup, inter-neuron-only state-of-the-art accelerator 대비 23% speedup, 해당 accelerator 대비 energy 22% 절감을 보고한다.  +
실행시간 CV의 기하평균을 Linux 대비 53-54% 개선했고, 실행시간을 7-25% 줄였으며, inter-NUMA migration을 21-53% 줄였다. 비교 기준과 서버에 따라 값은 달라진다.  +
공식 초록은 최신 공정 I/O 스케줄러 통합 시 overflow 이상 없이 공정성과 안정 실행을 유지했다고 보고한다. 공개 초록에는 성능/오버헤드 수치가 없다.  +
VMA 재사용으로 Linpack 19%, MatMul 11% latency 단축. 평균 메모리 오버헤드는 baseline 대비 11%. 메모리 중심 함수 snapshot은 약 0.3 ms로 Groundhog의 16~59 ms보다 짧고, restore 비용은 Groundhog의 10.7% 수준. 공격 예제에서 파일 및 background-task residue가 남지 않음을 확인.  +
workloads=100 Gb/s FPGA cluster; CPU vector-matrix multiply; FPGA DLR inference; baselines=software MPI; software RDMA collectives; metrics=collective performance; application performance; results=Significant/competitive gains reported; exact aggregate not abstract-verified.  +
workloads=billion-scale ANN datasets; baselines=in-memory Vamana and DiskANN; metrics=query latency and accuracy; results=1.14–2.02x in-memory Vamana latency; 35% of DiskANN latency; no accuracy loss  +
workloads=microbenchmarks; LevelDB; baselines=state-of-the-art low-latency schedulers; metrics=throughput at equal tail-latency SLO; results=Up to 52% and 83% higher throughput.  +
workloads=RocksDB 기반 YCSB Load, W50, W5, W0에서 uniform/Zipfian key 분포; 100M KV pair를 적재하고 300M operation 실행; baselines=static-compaction RocksDB; metrics=throughput, total write amount, write-stall time; results=Load에서 DOPA-DB throughput은 RocksDB보다 88.1% 높고 total write는 평균 44.7% 낮으며 stall time은 평균 69% 낮다. W50에서는 throughput이 더 낮았고, Load를 제외한 phase의 total write는 RocksDB의 4.39–8.63배였다.  +
workloads=KV-separated LSM workloads on SmartSSD; baselines=existing KV-separated systems; metrics=throughput; tail latency; space overhead; results=1.28–3.3x throughput; 37–66% lower tail latency; 15–85% lower space overhead  +
workloads=CTC micro/workloads, DLRM, graph applications; baselines=synchronous GPU I/O and BaM; metrics=performance, API overhead, register use; results=1.88x; 1.75x vs BaM; 3.12x/2.85x lower overhead; 1.32x fewer registers  +
FIO, Filebench, db_bench 평가에서 static grouping 대비 성능 최대 71.2% 향상. write amplification factor 최대 29.8% 감소.  +
workloads=400 real jobs and 706 diagnosed issues; BERT and Swin case studies; baselines=original job implementations; metrics=GPU utilization, cause frequency, speedup; results=46.03% data; 45.18% model; 84.99% small-fixable; 7.52x/3.95x speedups  +
migration 중 수 초 동안 전력이 높은 상태를 유지하거나 증가할 수 있음을 보였고, 제안한 두 방법은 migration 시작 직후 전력을 제한했다.  +
workloads=8 datastores; 2 microservice benchmarks; baselines=uncoordinated services; metrics=inconsistencies; latency; throughput; results=Prevents cross-service inconsistencies with <2% performance impact.  +
Running prototype과 realistic workloads에서 paging traffic, user experience, energy consumption을 개선했다고 보고하지만 공개 초록에는 수치가 없다.  +
CE 환경에서 application을 효과적으로 보호했고 대부분 workload에서 overhead가 합리적이며, 비보호 application에 대한 간섭도 작았다.  +