미추적 파일과 미커밋 수정을 전부 담아 pre-harness-removal 태그의 복구 범위를 확보한다. .agents/skills/writing-natural-korean 9개와 korean-technical-blog-skills-bundle-v1 61개가 여기 포함된다. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
1.9 KiB
1.9 KiB
RED 단계 기준선 기록
상태
이 패키지를 생성한 채팅 환경에는 독립 에이전트를 반복 호출하는 기능이 없어, writing-skills가 요구하는 스킬 미적용/적용 A/B 행동 테스트는 실행하지 못했다. 아래 항목은 업로드된 연구의 실패 사례와 기존 글쓰기 결과에서 추출한 기준선 가설이며, 실측 결과가 아니다.
스킬 없이 나타날 가능성이 큰 실패
- 상투적 도입과 의례적 결론을 유지한다.
효율적,혁신적,성능 개선을 수치나 작동 방식 없이 사용한다.- 자료에 없는 수치·경험·감정을 만들어 글을 구체화한다.
- 장점만 남기고 대안·비용·불리한 결과를 삭제한다.
- 코드, 명령어, 단위, 직접 인용과 법무 문구를 문체 통일 과정에서 변경한다.
- 모든 기술 글에 같은 목차와 문장 틀을 강제한다.
- 미측정 결과를 성공으로 마무리한다.
- 개인의 실수를 장애 원인의 전부로 표현한다.
- 유명 기업 기술 블로그의 말투를 표면적으로 모방한다.
- 하위 한국어·AI 문체 스킬을 호출하지 않고 완료를 선언한다.
실제 RED 실행 방법
tests/pressure-scenarios.md의 각 시나리오를 새로운 대화에서 스킬 없이 5회 이상 실행한다.- 결과에서 사실 창작, 보호 구간 변경, 구조 누락, 합리화 문구를 원문 그대로 기록한다.
- 같은 입력을 이 스킬과 두 하위 스킬을 활성화한 상태에서 다시 5회 이상 실행한다.
tests/evaluation-rubric.md로 점수와 하드 게이트를 비교한다.- 새 합리화가 발견되면 최소 규칙과 회귀 사례만 추가한다.
현재 패키지는 구조·테스트 데이터·정적 검증까지 완료할 수 있지만, 실제 에이전트 행동이 개선됐다는 주장은 A/B 테스트 전에는 할 수 없다.