.agents/skills의 technical-document-author, revising-korean-technical-prose, writing-natural-korean을 korean-technical-blog-skills-bundle-v1의 세 스킬로 교체한다. - writing-korean-technical-blogs: 문제·제약·선택·구현·결과·한계 구조화 - reducing-ai-like-korean-writing: 상투성·추상화·반복 제거 - editing-korean-grammar-and-expression: 맞춤법·띄어쓰기·호응 검수 상류를 수정하지 않고 복사했다. diff -r 0건, MANIFEST.sha256 검증 통과, 번들 validate_skill.py 3/3 PASS. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2.8 KiB
2.8 KiB
평가 기준
평가 원칙
교정 결과는 문자열 완전 일치만으로 평가하지 않는다. 탐지, 수정, 설명, 보존, 보류를 분리해 평가한다. 정밀도를 재현율보다 우선하며, 중대한 의미 변형과 보호 구간 손상은 한 건도 허용하지 않는다.
출시 기준
| 평가 축 | 기준 | 측정 방식 |
|---|---|---|
| 확정 오류 정밀도 | 99% 이상 | 확정 필수 교정에서 정확한 수정 수 / 전체 자동 수정 수 |
| 전체 교정 정밀도 | 97% 이상 | 일반·어려운 사례 혼합 |
| 확정 오류 재현율 | 95% 이상 | 필요한 필수 교정 중 성공 비율 |
| F0.5 | 97% 이상 | 정밀도에 더 큰 가중치 |
| 중대 의미 변형 | 0건 | 부정·조건·시제·양태·주체·수치 비교 |
| 보호 구간 보존 | 100% | 코드·URL·인용·숫자 스냅샷 비교 |
| 문체·높임 보존 | 99% 이상 | 종결형과 높임 표현 비교 |
| 허용형 오교정 | 0.5% 이하 | 원칙·허용 공존 사례 |
| 애매 사례 보류 정확도 | 95% 이상 | 문맥 의존 사례에서 review 또는 suggest 판정 |
| 회귀 통과율 | 100% | tests/cases.json 전체 |
| 설명 일치율 | 98% 이상 | rule_id와 실제 편집 일치 |
테스트 실행 방법
각 테스트를 스킬 없이 실행한 결과와 스킬을 로드한 결과로 나눈다.
- 새 대화 또는 격리된 에이전트에서 스킬 없이 입력한다.
expected_text,expected_action,rule_id와 비교한다.- 같은 입력을 스킬과 함께 실행한다.
- 새 오교정이 생기면 해당 사례를 회귀 세트에 추가한다.
- 올바른 입력을 유지하는 음성 테스트를 양성 테스트와 같은 비중으로 관리한다.
판정 항목
테스트마다 다음을 기록한다.
case_id: G-001
actual_text: "..."
actual_action: correct|keep|suggest|review
actual_rule_id: "..."
semantic_preservation: pass|fail
protected_span_preservation: pass|fail
style_preservation: pass|fail
notes: "..."
중대 실패
다음 중 하나라도 발생하면 전체 결과를 실패로 처리한다.
- 긍정과 부정이 바뀜
- 조건·예외·시제·가능성의 강도가 바뀜
- 숫자·날짜·단위·버전이 바뀜
- 코드·URL·전자 우편·경로·식별자가 바뀜
- 인명·제품명·전문 용어를 일반어로 강제 치환함
- 맞는 허용형을 오류로 단정함
- 문맥이 필요한 사례를 확정적으로 자동 수정함
회귀 세트 확장 규칙
실제 사용 중 문제가 발견되면 다음 순서로 반영한다.
- 문제 입력과 잘못된 출력을 고정한다.
- 기대 행동을
correct,keep,suggest,review중 하나로 명시한다. - 스킬 수정 전 실패를 확인한다.
- 최소한의 규칙만 보강한다.
- 전체 테스트를 다시 실행한다.