1.6 KiB
1.6 KiB
description
| description |
|---|
| 동일 모델·동일 요청에서 현재 하네스(A)와 experience-foundation 입력(B)의 수정 전 첫 결과를 블라인드 비교한다. |
org-os/06-agent-work/first-draft-experiment-spec.yaml을 정본으로 사용한다. Hyeonworks 시작 manifest는 hyeonworks/experiments/experience-foundation-ab/experiment.yaml이다.
python3 .claude/hooks/first_draft_experiment.py plan <manifest>로 준비 상태와 B arm 필수 입력을 확인한다.- model-id와 request exact SHA를 동결한다. A/B 모두 같은 model-id·request를 쓰며 generation attempt는 arm별 정확히 한 번이다.
- A에는 foundation 입력을 주지 않는다. B에는 accepted competitive benchmark, experience blueprint, wireframe set, generated DESIGN.md, 필요한 component registry subset을 exact ref/SHA로 준다. B는 전체 사이트가 아니라 동일 대표 section/core screen만 생성한다.
- 첫 출력 직후 revision 0에서 desktop/mobile을 캡처한다. 수정·재생성·best-of 선택은 금지한다.
- arm 정보를 가린 상태로 UX-RESEARCHER 또는 DES-DIRECTOR가
first-draft-evaluation을 작성하고 HUMAN-001이 exact revision을 승인한다. python3 .claude/hooks/first_draft_experiment.py validate <manifest> --require-complete후compare한다. completed 이전에는 품질 우위 주장을 하지 않는다.
이 명령은 외부 모델 호출을 자동 승인하거나 비용을 발생시키지 않는다. 실제 generation command는 사용자가 선택한 실행 환경에서 동일 receipt 조건으로 두 번 수행하고 manifest에 exact output/evaluation ref+SHA를 기록한다.