.agents/skills의 technical-document-author, revising-korean-technical-prose, writing-natural-korean을 korean-technical-blog-skills-bundle-v1의 세 스킬로 교체한다. - writing-korean-technical-blogs: 문제·제약·선택·구현·결과·한계 구조화 - reducing-ai-like-korean-writing: 상투성·추상화·반복 제거 - editing-korean-grammar-and-expression: 맞춤법·띄어쓰기·호응 검수 상류를 수정하지 않고 복사했다. diff -r 0건, MANIFEST.sha256 검증 통과, 번들 validate_skill.py 3/3 PASS. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
29 lines
1.9 KiB
Markdown
29 lines
1.9 KiB
Markdown
# RED 단계 기준선 기록
|
|
|
|
## 상태
|
|
|
|
이 패키지를 생성한 채팅 환경에는 독립 에이전트를 반복 호출하는 기능이 없어, `writing-skills`가 요구하는 **스킬 미적용/적용 A/B 행동 테스트는 실행하지 못했다**. 아래 항목은 업로드된 연구의 실패 사례와 기존 글쓰기 결과에서 추출한 기준선 가설이며, 실측 결과가 아니다.
|
|
|
|
## 스킬 없이 나타날 가능성이 큰 실패
|
|
|
|
1. 상투적 도입과 의례적 결론을 유지한다.
|
|
2. `효율적`, `혁신적`, `성능 개선`을 수치나 작동 방식 없이 사용한다.
|
|
3. 자료에 없는 수치·경험·감정을 만들어 글을 구체화한다.
|
|
4. 장점만 남기고 대안·비용·불리한 결과를 삭제한다.
|
|
5. 코드, 명령어, 단위, 직접 인용과 법무 문구를 문체 통일 과정에서 변경한다.
|
|
6. 모든 기술 글에 같은 목차와 문장 틀을 강제한다.
|
|
7. 미측정 결과를 성공으로 마무리한다.
|
|
8. 개인의 실수를 장애 원인의 전부로 표현한다.
|
|
9. 유명 기업 기술 블로그의 말투를 표면적으로 모방한다.
|
|
10. 하위 한국어·AI 문체 스킬을 호출하지 않고 완료를 선언한다.
|
|
|
|
## 실제 RED 실행 방법
|
|
|
|
1. `tests/pressure-scenarios.md`의 각 시나리오를 새로운 대화에서 스킬 없이 5회 이상 실행한다.
|
|
2. 결과에서 사실 창작, 보호 구간 변경, 구조 누락, 합리화 문구를 원문 그대로 기록한다.
|
|
3. 같은 입력을 이 스킬과 두 하위 스킬을 활성화한 상태에서 다시 5회 이상 실행한다.
|
|
4. `tests/evaluation-rubric.md`로 점수와 하드 게이트를 비교한다.
|
|
5. 새 합리화가 발견되면 최소 규칙과 회귀 사례만 추가한다.
|
|
|
|
현재 패키지는 구조·테스트 데이터·정적 검증까지 완료할 수 있지만, 실제 에이전트 행동이 개선됐다는 주장은 A/B 테스트 전에는 할 수 없다.
|