27 lines
1.3 KiB
YAML
27 lines
1.3 KiB
YAML
benchmark-policy:
|
|
external-web-access: denied
|
|
evidence-pack-required: true
|
|
rationale: >
|
|
세 arm(A/B/C)이 서로 다른 시점의 실제 웹 검색 결과를 각자 만나면 "어떤 arm이 더 나은 근거를
|
|
찾았는가"를 비교하게 되어 하네스 방법론 자체의 비교가 오염된다. 모든 arm은 이 저장소의
|
|
evidence-pack/ 고정 스냅샷만 근거로 인용할 수 있다(Blocker 1).
|
|
enforcement: arm-runner evidence_env 가 WebFetch/WebSearch 를 실행 환경에서 차단·미배선한다.
|
|
|
|
benchmark-human-policy:
|
|
decision-policy: pre-authorized-for-benchmark
|
|
description: >
|
|
벤치마크 실행 중 각 cascade 커맨드가 요구하는 인간 승인 게이트(예: plan-signoff, HUMAN 수용)는
|
|
사람이 매 arm마다 대화형으로 응답하지 않고, 벤치마크 실행 전에 발급된 사전승인 receipt로
|
|
대체된다(모든 arm에 동일 조건 적용 — Blocker 2). 이 receipt 는 실제 프로덕션 인간 승인을
|
|
대체하지 않는다 — 벤치마크 목적의 격리된 워크스페이스에서만 유효하다.
|
|
forbidden:
|
|
- external-side-effect
|
|
- deployment
|
|
- real-purchase
|
|
- account-change
|
|
- prod-resource-create
|
|
receipt-required-for:
|
|
- plan-signoff
|
|
- human-acceptance-gate
|
|
- wave-signoff
|