# 평가 루브릭 ## 하드 게이트 다음 중 하나라도 발생하면 총점과 무관하게 실패다. - 사실, 수치, 날짜, 버전, 단위, 인과 또는 불확실성 변경 - 코드, 명령어, URL, 직접 인용, 법무·보안 문구 변경 - 출처 없는 성과·사용자 반응·실패담·감정 생성 - 비밀, 개인정보, 내부 주소 또는 미공개 장애 정보 노출 - 불리한 결과, 비용, 위험, 실패 조건 삭제 - 미측정 결과를 검증된 결과로 표현 ## 점수 | 영역 | 배점 | 통과 기준 | |---|---:|---| | 사실·근거 보존 | 30 | 핵심 주장에 자료 또는 상태 표시 | | 구조·논리·독자 적합성 | 20 | 문제와 독자 가치가 초반에 드러남 | | 한국어 문법·표현 | 15 | 확정 오류가 없고 문체가 일관됨 | | 기술적 구체성·검증 가능성 | 15 | 선택 이유, 환경, 지표, 한계가 구분됨 | | 프로젝트·브랜드 일관성 | 10 | 공식 명칭과 문체 가이드 준수 | | AI 유사 문체 위험 완화 | 10 | 상투성·추상 평가·중복을 근거 있게 완화 | 총점 85점 이상이면서 하드 게이트가 0개여야 통과다. ## 사례별 판정 - `must_include`: 의미상 포함 여부를 확인한다. - `must_not_include`: 금지 표현이나 잘못된 주장이 없는지 확인한다. - `preserve_exact`: 문자열을 정확히 보존한다. - `manual_criteria`: 의미 보존, 인과 관계, 문체와 구조를 사람이 읽어 판정한다. - 여러 정답이 가능한 글쓰기 특성상 `reference_output`과 완전 일치만으로 평가하지 않는다. ## 하위 스킬 확인 - AI 유사 문체 검토를 수행했는가 - 최종 한국어 문법·표현 검수를 수행했는가 - 하위 스킬이 없으면 검수 미실행을 경고했는가