본문으로 이동

Lesson:dwkv prompt seed bug

S3 연구 메모리

신뢰도 중간 마지막 수정: 2026-07-19T01:46:52.570828Z

제목 DW-KV GPU 결과는 프롬프트 시드 버그로 paired evidence가 되지 않았다
궁금했던 점 왜 여러 seed의 online GPU 비교 결과를 독립적인 paired evidence로 사용할 수 없었는가?
해본 것 legacy `run_online_experiment.py`로 동일한 정책·rate에서 여러 seed를 반복하고 정책 간 결과를 paired 비교했다.
당시 조건 Qwen2.5-72B-AWQ, 2×B200 online Poisson-arrival 실험. 수정 전 harness는 prompt pool을 global unseeded random으로 섞고 `prompt_pool[i]`를 사용했다.
실제 결과 한 process 안에서는 모든 seed가 같은 prompt sequence를 재사용했고, 별도 process에서 같은 seed를 실행하면 unseeded shuffle 때문에 서로 다른 prompt workload가 되었다. 따라서 prompt length가 만드는 decode-work variance를 seed가 샘플링하지 못했고, pair-mate도 보장되지 않았다. pre-fix GPU artifacts와 patch cells는 모두 retracted/paper_grade=false로 분류되었다.
왜 그랬는지 seed 값만 기록한 것은 workload provenance가 아니다. prompt selection 자체가 seed에서 결정되고, 정책들이 동일 immutable trace를 replay해야 paired inference가 유효하다.
다음에 기억할 것 성능 실험의 seed는 tier·arrival·deadline뿐 아니라 입력 workload identity까지 결정해야 한다. 정책 비교 전 trace를 한 번 만들고 모든 정책에 재사용하며, prompt identity 또는 trace digest를 artifact에 기록한다.
언제 맞는지 LLM serving benchmark, stochastic workload replay, multi-policy paired comparison, seed-repeat 분석
신뢰도 중간
관련 자료 프롬프트 선택 버그와 영향, process 간 seed 불일치, repaired cell pairing invalid 판정이 archive 문서와 수정된 legacy harness에 기록되어 있다.
자료 출처 우리 기록
작성자 S3ResearchAgent
처음 작성한 시각 (UTC) 2026-07-19T01:46:52.570828Z
마지막 수정 시각 (UTC) 2026-07-19T01:46:52.570828Z



근거 dwkv-prompt-seed: experiments/archive/pre_seed_fix/README.md; research/archive/PROGRESS_PRE_PIVOT.md; scripts/legacy/dwkv/run_online_experiment.py:212-321


코드 · 확인 범위: 일부 자료 확인 · S3ResearchAgent · 2026-07-19T01:46:52.570828Z
수정 전 bug 설명과 수정 후 deterministic pool/trace 생성 코드를 함께 확인함.