속성:Reusable lesson
외관
비슷한 문제를 만났을 때 다시 쓸 수 있는 내용을 적습니다.
t
technical review asynchronous i o stack a low latency kernel i o stack for ultra low latency ssd 3852c43e +
장치 자체보다 소프트웨어 경로가 비슷한 규모의 지연을 차지하면, 작업을 축소하는 것뿐 아니라 장치 처리와 겹치도록 critical path를 재구성해야 한다. +
device/subsystem snapshot은 메모리 이미지뿐 아니라 부작용과 접근 제약이 있는 하드웨어 레지스터를 의미별로 분류해 복원해야 한다. +
technical review beyond static policies dynamic prac for balanced and efficient rowhammer mitiga 185f5688 +
논문 공개 전에는 Rowhammer/PRAC 연구 인덱스 항목으로만 사용하고 설계 교훈은 원문 공개 후 보강한다. +
CPU에서 실행된 샘플만 보면 잠금·I/O·스케줄링 대기 병목을 놓치므로 blocked-state 근거를 실행 샘플과 함께 해석해야 한다. +
technical review cache scheme of shared buffer mappings for energy efficiency of mobile devices f1dee859 +
Data 자체뿐 아니라 비싼 address-translation 또는 mapping 결과도 identity와 lifetime이 안전하다면 재사용할 수 있다. +
real-time support를 항상 최대 강도로 켜기보다 runtime necessity에 따라 선택적으로 적용하면 latency-throughput trade-off를 완화할 수 있다. +
QoS 우선순위가 다른 VM 사이에서 reclaim 대상을 선택하고, kill 대신 압축을 degradation 단계로 사용할 수 있다. +
사후 compaction 대신 object 또는 page lifetime을 배치 시점에 이용하면 자연스러운 bulk death가 contiguous free region을 만들 수 있다. +
향후 실행할 이미지가 미리 알려지는 serverless 특성을 이용하면 page cache 중복을 요청 시점 이전부터 제거할 수 있다. +
장치의 scheduling primitive를 host weighted virtual time과 결합하면 host staging/arbitration을 없애면서 공정성을 근사할 수 있다. +
빨리 회수해야 하는 borrowed memory에는 재구성 가능한 clean cache data를 우선 배치해야 한다. +
무조건 gang/coscheduling하기보다 IPI 같은 실제 synchronization event를 coordination trigger로 사용하면 utilization 손실을 줄일 수 있다. +
임베디드 profiling에서는 무거운 분석·GUI를 remote host로 옮기고 target에는 lightweight probes만 두는 구조가 유효하다. +
technical review dflop a data driven framework for multimodal llm training pipeline optimization 9bf046db +
MLLM은 모델 크기만이 아니라 샘플별 모달리티 길이 분포까지 병렬화 탐색·마이크로배치 스케줄링의 입력으로 삼아야 한다. +
DRAM-less FTL에서는 전역 유효 페이지 메타데이터를 별도로 저장하기보다 이미 존재하는 L2P 세그먼트와 함께 압축·지역화하면 조회 I/O를 줄일 수 있다. +
보안상 데이터 lifetime 종료를 OS의 늦은 zeroing이 아니라 메모리 장치의 접근 제어와 물리적 decay에 연결할 수 있다. +
polling task는 잠들지 않는다는 이유만으로 계산 task와 동일하게 배치하면 sibling hardware thread의 실행 자원과 메모리 계층을 방해할 수 있으므로 배치 시 자원 특성을 고려해야 한다. +
Page table과 TLB가 이미 관리하는 identity와 cache metadata를 결합하면 별도 history table의 비용과 thrashing을 줄일 수 있다. +
technical review efficient function call tracing with link time binary rewriting for ce devices 0c5c62cb +
소스 접근이 제한된 제품 소프트웨어에서는 relocation/link 정보를 남긴 시점의 정적 재작성이 dynamic instrumentation의 비용을 피할 수 있다. +
hybrid polling의 sleep은 완료시간 하나가 아니라 device time과 queue delay를 분리해 추정하고, polling 자체가 손해인 장기 요청은 interrupt로 보내야 한다. +