Files
company-haness/benchmark/cascade/rubric.yaml
T

66 lines
4.0 KiB
YAML

# P4 cascade benchmark — judge rubric. 8 criteria, 0-4 절대 스케일(calibration 진단 전용).
# 최종 승자 판정은 pairwise(judge.py X/Y winner) 만 쓴다 — absolute score 는 여기서 못 쓴다.
criteria:
role-expertise:
scale: "0-4"
desc: "역할 고유 관점·전문성이 드러나는가 — 제네릭 컨설턴트가 아니라 그 직무만이 낼 수 있는 판단인가."
anchors:
"0": "역할과 무관한 범용 조언. 어느 역할이 썼는지 구분 불가."
"2": "역할 관점이 부분적으로 드러나나 표면적(용어만 차용)."
"4": "그 역할의 방법론·프레임이 판단 근거로 명시적으로 쓰였다."
procedural-completeness:
scale: "0-4"
desc: "방법 절차(단계·완결 게이트)를 밟았는가 — 결론만 던지지 않고 과정을 보였는가."
anchors:
"0": "결론만 있고 과정 없음."
"2": "일부 단계만 수행(중간 생략)."
"4": "선언된 절차 전 단계를 완결 게이트와 함께 밟았다."
evidence-grounding:
scale: "0-4"
desc: "주장이 근거(evidence-pack·아티팩트)에 접지되는가 — 출처 없는 단정이 아닌가."
anchors:
"0": "근거 인용 없이 단정. 출처 불명 수치·주장."
"2": "일부 주장만 evidence-pack 에 연결, 나머지는 무근거."
"4": "핵심 주장 전부가 evidence-pack 의 구체 항목(파일·문장)에 연결된다."
alternatives-and-counterarguments:
scale: "0-4"
desc: "대안·반론을 실제로 검토했는가 — 첫 아이디어를 그대로 채택하지 않았는가."
anchors:
"0": "대안 없이 단일안만 제시."
"2": "대안을 나열했으나 기각 사유가 형식적."
"4": "≥2 대안을 실제 트레이드오프로 비교하고 구체적 기각 사유를 남겼다."
practical-artifacts:
scale: "0-4"
desc: "다음 단계가 쓸 실물 산출물이 있는가 — 서술뿐인가, 구조화된 결과물인가."
anchors:
"0": "서술형 텍스트뿐, 재사용 가능한 산출물 없음."
"2": "산출물이 있으나 불완전(필드 누락·형식 불일치)."
"4": "다음 역할이 그대로 소비 가능한 완결된 산출물."
handoff-completeness:
scale: "0-4"
desc: "다음 역할이 소비할 입력이 완전한가 — 넘겨받을 사람이 다시 물어봐야 하는가."
anchors:
"0": "다음 역할이 무엇을 넘겨받는지조차 불명확."
"2": "핵심 필드는 있으나 근거·rationale 누락."
"4": "선택된 결과물 + 근거 + 기각된 대안 + 불변조건까지 전부 명시."
non-genericness:
scale: "0-4"
desc: "제네릭 템플릿이 아니라 이 문제(ShiftDeck)에 특정되는가 — 다른 브리프에도 그대로 쓸 수 있는 문장인가."
anchors:
"0": "다른 어떤 제품에도 그대로 붙여넣을 수 있는 형용사 위주 서술(예: '직관적이고 현대적인')."
"2": "일부 문장은 특정적이나 상당수가 일반론."
"4": "가용시간 충돌·야간 편중·변경 공지 누락 등 이 브리프 고유의 구체 사실에 결박된 서술."
design-distinctiveness:
scale: "0-4"
desc: "방향이 시각적으로 구별되는 주장을 하는가(렌더 필요) — 렌더 없으면 not-evaluable."
requires-render: true
anchors:
"0": "렌더 없음(not-evaluable) 또는 렌더가 있어도 시각적 주장이 없는 기본 템플릿."
"2": "시각적 차별점은 있으나 근거(왜 이 방향인가)가 약함."
"4": "렌더가 명확한 시각적 주장을 하며 그 주장이 토큰·결정과 일관된다."
absolute-rubric-note: >
절대 점수(0-4)는 calibration 진단 전용이다(단일결함 fixture가 어느 criterion을 정확히
건드렸는지 확인하는 용도). 최종 승자 판정에는 pairwise 비교(judge.py 의 X/Y winner)만 쓴다 —
절대 점수를 합산해 순위를 매기지 않는다(judge간 척도 불일치를 pairwise 로 흡수).