# 평가 기준 ## 평가 원칙 스타일 재작성은 정답 문장이 하나가 아니므로 문자열 완전 일치만으로 평가하지 않는다. **행동 선택, 의미 보존, 직접성 개선, 장르 적합성, 보호 구간, 근거 없는 창작 방지**를 분리해 평가한다. ## 출시 기준 | 평가 축 | 기준 | 측정 방식 | |---|---:|---| | 중대 의미 변형 | 0건 | 부정·조건·시제·양태·주체·수치 비교 | | 근거 없는 사실·경험 추가 | 0건 | 원문과 수정문의 명제 비교 | | 보호 구간 보존 | 100% | 코드·URL·명령어·직접 인용 스냅샷 | | 기술 용어 일관성 | 100% | 지정 용어 및 식별자 비교 | | 장르 보존 | 95% 이상 | 문서 유형별 전문가 또는 사용자 판정 | | 고신뢰 패턴 정밀도 | 95% 이상 | A 등급 수정 중 유효한 수정 비율 | | 정상 표현 오교정 | 5% 이하 | `keep` 사례에서 불필요한 수정 비율 | | 양태 보존 | 100% | 가능·의무·권고·추정 강도 비교 | | 직접성 개선 선호도 | 80% 이상 | 수정 대상 사례의 익명 쌍대 비교 | | AI 저자 단정 | 0건 | 출력에서 작성 주체·확률 주장 여부 | | 탐지기 우회 보장 | 0건 | 점수·우회 성공 주장 여부 | | 회귀 통과율 | 100% | `tests/cases.json` 전체 행동 계약 | ## 테스트 방법 1. 스킬 없이 각 입력을 새 문맥에서 실행해 기준 실패를 기록한다. 2. 같은 입력을 스킬과 함께 실행한다. 3. `expected_action`이 맞는지 확인한다. 4. `reference_text`는 가능한 한 좋은 예시로만 사용하고, 다른 표현도 `required_properties`와 `forbidden_changes`로 평가한다. 5. 새로운 오교정은 `keep` 또는 `regression` 사례로 추가한다. 6. 한 표현을 고치는 양성 테스트와 같은 표현을 유지하는 음성 테스트를 쌍으로 관리한다. ## 테스트 기록 형식 ```yaml case_id: G-001 actual_action: rewrite|keep|suggest|review semantic_preservation: pass|fail modality_preservation: pass|fail protected_span_preservation: pass|fail genre_preservation: pass|fail unsupported_addition: none|present pattern_ids: - AIK-HEDGE-001 notes: "..." ``` ## 중대 실패 다음 중 하나라도 발생하면 전체 결과를 실패로 처리한다. - 원문에 없는 경험·감정·근거·수치를 추가함 - 가능성을 확정으로, 권고를 의무로 강화함 - 코드·URL·경로·명령어·직접 인용을 변경함 - 기술 용어를 문체 다양화를 이유로 바꿈 - 격식 문서의 필수 구조를 AI 문체로 오인해 제거함 - `해당`, `이를 통해`, 피동문, 목록을 일괄 치환함 - AI 작성 여부나 탐지 확률을 단정함 - AI 탐지기 통과를 보장함 ## 문체 개선 판정 수정 대상 사례에서는 다음 질문으로 쌍대 비교한다. - 주체와 동작이 더 빨리 드러나는가? - 같은 정보를 더 적은 우회 표현으로 전달하는가? - 문장 삭제·통합 후에도 논리 관계가 유지되는가? - 일반 효용 대신 원문에 있는 구체적 내용이 앞에 오는가? - 작성자의 실제 관점과 장르가 유지되는가? 단순히 짧아졌다는 이유만으로 개선으로 판정하지 않는다.