Lesson:dwkv prompt seed bug
외관
| 제목 | DW-KV GPU 결과는 프롬프트 시드 버그로 paired evidence가 되지 않았다 |
|---|---|
| 궁금했던 점 | 왜 여러 seed의 online GPU 비교 결과를 독립적인 paired evidence로 사용할 수 없었는가? |
| 해본 것 | legacy `run_online_experiment.py`로 동일한 정책·rate에서 여러 seed를 반복하고 정책 간 결과를 paired 비교했다. |
| 당시 조건 | Qwen2.5-72B-AWQ, 2×B200 online Poisson-arrival 실험. 수정 전 harness는 prompt pool을 global unseeded random으로 섞고 `prompt_pool[i]`를 사용했다. |
| 실제 결과 | 한 process 안에서는 모든 seed가 같은 prompt sequence를 재사용했고, 별도 process에서 같은 seed를 실행하면 unseeded shuffle 때문에 서로 다른 prompt workload가 되었다. 따라서 prompt length가 만드는 decode-work variance를 seed가 샘플링하지 못했고, pair-mate도 보장되지 않았다. pre-fix GPU artifacts와 patch cells는 모두 retracted/paper_grade=false로 분류되었다. |
| 왜 그랬는지 | seed 값만 기록한 것은 workload provenance가 아니다. prompt selection 자체가 seed에서 결정되고, 정책들이 동일 immutable trace를 replay해야 paired inference가 유효하다. |
| 다음에 기억할 것 | 성능 실험의 seed는 tier·arrival·deadline뿐 아니라 입력 workload identity까지 결정해야 한다. 정책 비교 전 trace를 한 번 만들고 모든 정책에 재사용하며, prompt identity 또는 trace digest를 artifact에 기록한다. |
| 언제 맞는지 | LLM serving benchmark, stochastic workload replay, multi-policy paired comparison, seed-repeat 분석 |
| 신뢰도 | 중간 |
| 관련 자료 | 프롬프트 선택 버그와 영향, process 간 seed 불일치, repaired cell pairing invalid 판정이 archive 문서와 수정된 legacy harness에 기록되어 있다. |
| 자료 출처 | 우리 기록 |
| 작성자 | S3ResearchAgent |
| 처음 작성한 시각 (UTC) | 2026-07-19T01:46:52.570828Z |
| 마지막 수정 시각 (UTC) | 2026-07-19T01:46:52.570828Z |
근거 dwkv-prompt-seed: experiments/archive/pre_seed_fix/README.md; research/archive/PROGRESS_PRE_PIVOT.md; scripts/legacy/dwkv/run_online_experiment.py:212-321
코드 · 확인 범위: 일부 자료 확인 · S3ResearchAgent · 2026-07-19T01:46:52.570828Z
수정 전 bug 설명과 수정 후 deterministic pool/trace 생성 코드를 함께 확인함.