Files
document-haness/korean-technical-blog-skills-bundle-v1/writing-korean-technical-blogs/tests/baseline-observations.md
T
DongHyeonkaandClaude Opus 5 1099834617 chore: snapshot working tree before harness removal
미추적 파일과 미커밋 수정을 전부 담아 pre-harness-removal 태그의 복구
범위를 확보한다. .agents/skills/writing-natural-korean 9개와
korean-technical-blog-skills-bundle-v1 61개가 여기 포함된다.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-07 14:19:24 +09:00

1.9 KiB

RED 단계 기준선 기록

상태

이 패키지를 생성한 채팅 환경에는 독립 에이전트를 반복 호출하는 기능이 없어, writing-skills가 요구하는 스킬 미적용/적용 A/B 행동 테스트는 실행하지 못했다. 아래 항목은 업로드된 연구의 실패 사례와 기존 글쓰기 결과에서 추출한 기준선 가설이며, 실측 결과가 아니다.

스킬 없이 나타날 가능성이 큰 실패

  1. 상투적 도입과 의례적 결론을 유지한다.
  2. 효율적, 혁신적, 성능 개선을 수치나 작동 방식 없이 사용한다.
  3. 자료에 없는 수치·경험·감정을 만들어 글을 구체화한다.
  4. 장점만 남기고 대안·비용·불리한 결과를 삭제한다.
  5. 코드, 명령어, 단위, 직접 인용과 법무 문구를 문체 통일 과정에서 변경한다.
  6. 모든 기술 글에 같은 목차와 문장 틀을 강제한다.
  7. 미측정 결과를 성공으로 마무리한다.
  8. 개인의 실수를 장애 원인의 전부로 표현한다.
  9. 유명 기업 기술 블로그의 말투를 표면적으로 모방한다.
  10. 하위 한국어·AI 문체 스킬을 호출하지 않고 완료를 선언한다.

실제 RED 실행 방법

  1. tests/pressure-scenarios.md의 각 시나리오를 새로운 대화에서 스킬 없이 5회 이상 실행한다.
  2. 결과에서 사실 창작, 보호 구간 변경, 구조 누락, 합리화 문구를 원문 그대로 기록한다.
  3. 같은 입력을 이 스킬과 두 하위 스킬을 활성화한 상태에서 다시 5회 이상 실행한다.
  4. tests/evaluation-rubric.md로 점수와 하드 게이트를 비교한다.
  5. 새 합리화가 발견되면 최소 규칙과 회귀 사례만 추가한다.

현재 패키지는 구조·테스트 데이터·정적 검증까지 완료할 수 있지만, 실제 에이전트 행동이 개선됐다는 주장은 A/B 테스트 전에는 할 수 없다.