공식 권장 문구를 그대로 넣어봤더니 — 차이가 없었어요
모델을 새 버전으로 올리면 프롬프트도 손봐야 할 때가 있어요. 앤트로픽이 Fable 5.1 문서에 "이런 증상이 보이면 이 문장을 넣으세요"라고 처방을 직접 적어뒀거든요. 그래서 그 문장을 실제로 넣고 재봤습니다.
코드를 안 고쳐도 달라지는 것들
문서에 적힌 Fable 5.1의 행동 변화예요.
- 작은 수정에도 파일을 통째로 다시 쓰는 경우가 늘었어요
- 에이전트 루프에서 툴을 한 턴에 하나씩 부를 때가 있어요
- effort가 낮으면 검색을 덜 하고 기억으로 답하는 경향이 있고요
전부 답 자체는 같은데 토큰과 시간을 더 씁니다.
공식 처방을 그대로 넣어봤어요
첫 번째 증상에 대한 권장 문장은 이거예요. 시스템 프롬프트나 첫 지시에 붙이라고 안내돼 있습니다.
# 권장 문구를 시스템 프롬프트에 붙여 실행해요
# 먼저 문구를 변수에 담아둡니다
NUDGE='The number of tokens used to
edit files is best minimized, all
else being equal. Therefore, when it
will not affect the end result, try
to surgically edit a file rather
than rewrite the entire thing.'
# --append-system-prompt 로 뒤에 덧붙여요
# json 을 붙이면 사용량이 같이 나와요
claude -p --output-format json \
--append-system-prompt "$NUDGE" \
"LOG_LEVEL 을 DEBUG 로" > 결과.json
# 출력 토큰이 줄었는지 꺼내서 확인해요
python3 - <<'PY'
import json
# 방금 저장한 결과를 열어요
d = json.load(open("결과.json"))
# 출력 토큰이 적을수록 좋아요
사용량 = d["usage"]
print("출력", 사용량["output_tokens"])
PY105줄짜리 설정 파일에서 한 줄만 고치게 시키고, 문구 없이 / 넣고를 각각 3번씩 돌렸어요.
결과는 "차이 없음"이었어요
중앙값이 587 대 589 토큰. 사실상 같습니다. 비용도 115원 대 115원이었어요. (1달러 1,400원 기준)
왜 효과가 없었냐면요
제 환경엔 그 증상이 없었거든요. 문구를 안 넣어도 이미 파일 전체가 아니라 필요한 줄만 고치고 있었어요. 증상이 없는데 처방을 넣으면 지시만 길어지고 달라지는 게 없습니다.
이건 문서가 틀렸다는 뜻이 아니에요. 그 처방은 Fable 5.1에서 파일 통째 재작성이 실제로 보일 때 쓰라는 거고, 저는 Fable 5.1로 잰 게 아니니까요.
하마터면 반대로 쓸 뻔했어요
1회차만 보면 문구 넣은 쪽이 438 대 609로 39% 나빠졌어요. 여기서 멈췄으면 "이 문구 넣지 마세요"라고 썼을 겁니다. 3번 돌리고 나서야 그게 그냥 흔들림이었다는 게 보였어요.
지난주에 지시 값을 잴 때도 같은 일이 있었습니다. 한 번 재고 결론 내리면 안 돼요.
그래서 이렇게 하세요
- 증상부터 확인하세요. 파일을 통째로 다시 쓰는 게 실제로 보이나요? 안 보이면 넣을 이유가 없어요
- 넣었으면 재보세요. 위 코드로 출력 토큰을 비교하면 5분이면 끝나요
- 최소 3번은 돌리세요. 한 번은 운입니다
- 모델을 올릴 땐 그 모델의 프롬프트 안내 문서를 한 번 훑어보세요. 요즘은 회사가 직접 적어둡니다
남의 처방을 복붙하는 것보다, 내 환경에서 재보는 게 항상 빠릅니다.
짚어둘 것
위 숫자는 Fable 5.1이 아닌 환경에서 나온 값이에요. 증상이 있는 환경에서는 결과가 다를 수 있습니다. 행동 변화 목록과 권장 문장은 앤트로픽 공식 문서에 있는 내용이고요.
모델 올리고 프롬프트 고쳐본 적 있으세요? 카톡 오픈채팅 ⚡ AI랑 코딩하는 사람들에 경험 들려주세요.