.agents/skills의 technical-document-author, revising-korean-technical-prose, writing-natural-korean을 korean-technical-blog-skills-bundle-v1의 세 스킬로 교체한다. - writing-korean-technical-blogs: 문제·제약·선택·구현·결과·한계 구조화 - reducing-ai-like-korean-writing: 상투성·추상화·반복 제거 - editing-korean-grammar-and-expression: 맞춤법·띄어쓰기·호응 검수 상류를 수정하지 않고 복사했다. diff -r 0건, MANIFEST.sha256 검증 통과, 번들 validate_skill.py 3/3 PASS. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
72 lines
3.2 KiB
Markdown
72 lines
3.2 KiB
Markdown
# 평가 기준
|
|
|
|
## 평가 원칙
|
|
|
|
스타일 재작성은 정답 문장이 하나가 아니므로 문자열 완전 일치만으로 평가하지 않는다. **행동 선택, 의미 보존, 직접성 개선, 장르 적합성, 보호 구간, 근거 없는 창작 방지**를 분리해 평가한다.
|
|
|
|
## 출시 기준
|
|
|
|
| 평가 축 | 기준 | 측정 방식 |
|
|
|---|---:|---|
|
|
| 중대 의미 변형 | 0건 | 부정·조건·시제·양태·주체·수치 비교 |
|
|
| 근거 없는 사실·경험 추가 | 0건 | 원문과 수정문의 명제 비교 |
|
|
| 보호 구간 보존 | 100% | 코드·URL·명령어·직접 인용 스냅샷 |
|
|
| 기술 용어 일관성 | 100% | 지정 용어 및 식별자 비교 |
|
|
| 장르 보존 | 95% 이상 | 문서 유형별 전문가 또는 사용자 판정 |
|
|
| 고신뢰 패턴 정밀도 | 95% 이상 | A 등급 수정 중 유효한 수정 비율 |
|
|
| 정상 표현 오교정 | 5% 이하 | `keep` 사례에서 불필요한 수정 비율 |
|
|
| 양태 보존 | 100% | 가능·의무·권고·추정 강도 비교 |
|
|
| 직접성 개선 선호도 | 80% 이상 | 수정 대상 사례의 익명 쌍대 비교 |
|
|
| AI 저자 단정 | 0건 | 출력에서 작성 주체·확률 주장 여부 |
|
|
| 탐지기 우회 보장 | 0건 | 점수·우회 성공 주장 여부 |
|
|
| 회귀 통과율 | 100% | `tests/cases.json` 전체 행동 계약 |
|
|
|
|
## 테스트 방법
|
|
|
|
1. 스킬 없이 각 입력을 새 문맥에서 실행해 기준 실패를 기록한다.
|
|
2. 같은 입력을 스킬과 함께 실행한다.
|
|
3. `expected_action`이 맞는지 확인한다.
|
|
4. `reference_text`는 가능한 한 좋은 예시로만 사용하고, 다른 표현도 `required_properties`와 `forbidden_changes`로 평가한다.
|
|
5. 새로운 오교정은 `keep` 또는 `regression` 사례로 추가한다.
|
|
6. 한 표현을 고치는 양성 테스트와 같은 표현을 유지하는 음성 테스트를 쌍으로 관리한다.
|
|
|
|
## 테스트 기록 형식
|
|
|
|
```yaml
|
|
case_id: G-001
|
|
actual_action: rewrite|keep|suggest|review
|
|
semantic_preservation: pass|fail
|
|
modality_preservation: pass|fail
|
|
protected_span_preservation: pass|fail
|
|
genre_preservation: pass|fail
|
|
unsupported_addition: none|present
|
|
pattern_ids:
|
|
- AIK-HEDGE-001
|
|
notes: "..."
|
|
```
|
|
|
|
## 중대 실패
|
|
|
|
다음 중 하나라도 발생하면 전체 결과를 실패로 처리한다.
|
|
|
|
- 원문에 없는 경험·감정·근거·수치를 추가함
|
|
- 가능성을 확정으로, 권고를 의무로 강화함
|
|
- 코드·URL·경로·명령어·직접 인용을 변경함
|
|
- 기술 용어를 문체 다양화를 이유로 바꿈
|
|
- 격식 문서의 필수 구조를 AI 문체로 오인해 제거함
|
|
- `해당`, `이를 통해`, 피동문, 목록을 일괄 치환함
|
|
- AI 작성 여부나 탐지 확률을 단정함
|
|
- AI 탐지기 통과를 보장함
|
|
|
|
## 문체 개선 판정
|
|
|
|
수정 대상 사례에서는 다음 질문으로 쌍대 비교한다.
|
|
|
|
- 주체와 동작이 더 빨리 드러나는가?
|
|
- 같은 정보를 더 적은 우회 표현으로 전달하는가?
|
|
- 문장 삭제·통합 후에도 논리 관계가 유지되는가?
|
|
- 일반 효용 대신 원문에 있는 구체적 내용이 앞에 오는가?
|
|
- 작성자의 실제 관점과 장르가 유지되는가?
|
|
|
|
단순히 짧아졌다는 이유만으로 개선으로 판정하지 않는다.
|