Files
company-haness/.claude/commands/first-draft-experiment.md
T

1.6 KiB

description
description
동일 모델·동일 요청에서 현재 하네스(A)와 experience-foundation 입력(B)의 수정 전 첫 결과를 블라인드 비교한다.

org-os/06-agent-work/first-draft-experiment-spec.yaml을 정본으로 사용한다. Hyeonworks 시작 manifest는 hyeonworks/experiments/experience-foundation-ab/experiment.yaml이다.

  1. python3 .claude/hooks/first_draft_experiment.py plan <manifest>로 준비 상태와 B arm 필수 입력을 확인한다.
  2. model-id와 request exact SHA를 동결한다. A/B 모두 같은 model-id·request를 쓰며 generation attempt는 arm별 정확히 한 번이다.
  3. A에는 foundation 입력을 주지 않는다. B에는 accepted competitive benchmark, experience blueprint, wireframe set, generated DESIGN.md, 필요한 component registry subset을 exact ref/SHA로 준다. B는 전체 사이트가 아니라 동일 대표 section/core screen만 생성한다.
  4. 첫 출력 직후 revision 0에서 desktop/mobile을 캡처한다. 수정·재생성·best-of 선택은 금지한다.
  5. arm 정보를 가린 상태로 UX-RESEARCHER 또는 DES-DIRECTOR가 first-draft-evaluation을 작성하고 HUMAN-001이 exact revision을 승인한다.
  6. python3 .claude/hooks/first_draft_experiment.py validate <manifest> --require-completecompare한다. completed 이전에는 품질 우위 주장을 하지 않는다.

이 명령은 외부 모델 호출을 자동 승인하거나 비용을 발생시키지 않는다. 실제 generation command는 사용자가 선택한 실행 환경에서 동일 receipt 조건으로 두 번 수행하고 manifest에 exact output/evaluation ref+SHA를 기록한다.