목요일 미니 프로젝트: 어떤 모델이 나한테 맞는지 재보는 40여 줄 스크립트
어제 Opus 5.5 기사를 올리고 이런 질문을 받았어요. "직접 어떻게 재봐요?"
이번 주 실험에 쓴 방법을 복사해서 바로 쓸 수 있는 스크립트로 정리했어요. 같은 일을 모델마다 시키고, 값·주고받은 횟수·걸린 시간을 찍어줘요.
이렇게 생겼어요
# 같은 일을 모델마다 시켜 비교해요
import json, shutil, subprocess
import tempfile, time
TASK = "할 일을 여기에 적어요"
MODELS = [
"claude-opus-5-5",
"claude-opus-5",
]
RUNS = 2
RATE = 1400
SKIP = shutil.ignore_patterns(
"node_modules", ".venv")
def run(model):
# 복사본에서 돌려 원본은 그대로
dst = tempfile.mkdtemp() + "/p"
shutil.copytree(".", dst,
ignore=SKIP)
t0 = time.time()
out = subprocess.run(
["claude", "-p", TASK,
"--model", model,
"--permission-mode",
"acceptEdits",
"--output-format", "json"],
cwd=dst, capture_output=True,
stdin=subprocess.DEVNULL,
text=True)
r = json.loads(out.stdout)
secs = time.time() - t0
won = r["total_cost_usd"] * RATE
turns = r["num_turns"]
return won, turns, secs, dst
for m in MODELS:
for i in range(RUNS):
won, turns, secs, d = run(m)
print(f"{m} {i+1}회")
print(f" {won:,.0f}원어치")
print(f" {turns}번 주고받음")
print(f" {secs:.0f}초")
print(f" 결과: {d}")프로젝트 폴더에 compare.py로 저장하고, 위쪽 세 줄만 바꾸면 돼요.
TASK— 시킬 일MODELS— 비교할 모델RUNS— 모델마다 몇 번 돌릴지
핵심은 복사본이에요
같은 일을 두 모델에 시키려면 출발점이 같아야 해요. 첫 번째 모델이 코드를 고쳐버리면, 두 번째 모델은 이미 고쳐진 코드를 받거든요.
그래서 스크립트는 매번 프로젝트를 임시 폴더에 복사해서 그 안에서 시켜요. 원본은 그대로 남고, 고친 결과는 복사본에 남아요. 출력 맨 끝 결과: 경로를 열어보면 모델이 뭘 고쳤는지 볼 수 있어요.
돌려봤어요
작은 장바구니 코드에 "쿠폰 코드를 대소문자 구분 없이 처리하게 고쳐줘"를 넣고 돌렸어요.
python3 compare.py나온 그대로예요.
claude-opus-5-5 1회
142원어치
4번 주고받음
14초
결과: /tmp/tmpptjp546i/p
claude-opus-5-5 2회
134원어치
4번 주고받음
11초
결과: /tmp/tmpnt8mdedb/p
claude-opus-5 1회
295원어치
6번 주고받음
35초
결과: /tmp/tmprm4yw2zg/p
claude-opus-5 2회
223원어치
4번 주고받음
19초
결과: /tmp/tmp5ciox930/p네 번 모두 제대로 고쳤어요. 복사본을 하나씩 열어 "ten", "Five"를 넣어보고 확인했어요. 방향도 어제 기사와 같았어요. Opus 5.5가 값도 시간도 절반 안팎이에요.
쓸 때 알아둘 것
- 구독이면 금액은 환산값이에요. 쓴 토큰을 API 정가로 곱한 값이라 청구되진 않고, 대신 플랜 한도에서 빠져요. 작은 일로 재보세요
- 파일 수정은 묻지 않고 하지만, 명령 실행(테스트 등)은 막혀 있어요. 테스트까지 시키려면
--allowedTools옵션을 추가하세요 - 복사본은 임시 폴더에 쌓여요. 결과 확인이 끝나면 지워주세요
- 이 스크립트는 값만 재요. 결과가 맞는지는 따로 봐야 해요. 점수로 재는 법과 같이 쓰면 "싸고 맞는가"까지 볼 수 있어요
- 같은 일도 돌릴 때마다 값이 달라져요.
RUNS는 2 이상으로 두세요
짚어둘 것
출력은 제가 직접 돌린 그대로예요. 네 번 합쳐 API 정가로 794원어치, 스크립트를 고치기 전에 한 번 더 돌린 것까지 합치면 1,618원어치예요. 계정 로그인 방식이라 실제로 청구된 금액은 아니에요.
과제가 쉬워서 모델 실력 차이는 이걸로 알 수 없어요. 여러분 프로젝트의 진짜 일로 돌려봐야 의미가 있어요.
돌려보고 결과 공유해 주실 분 계세요? 카톡 오픈채팅 ⚡ AI랑 코딩하는 사람들에서 이야기 나눠요.