VibeDaily
← 목록
툴소개쇼케이스

목요일 미니 프로젝트: 어떤 모델이 나한테 맞는지 재보는 40여 줄 스크립트

2026.09.24👁 1

어제 Opus 5.5 기사를 올리고 이런 질문을 받았어요. "직접 어떻게 재봐요?"

이번 주 실험에 쓴 방법을 복사해서 바로 쓸 수 있는 스크립트로 정리했어요. 같은 일을 모델마다 시키고, 값·주고받은 횟수·걸린 시간을 찍어줘요.

이렇게 생겼어요

# 같은 일을 모델마다 시켜 비교해요
import json, shutil, subprocess
import tempfile, time
 
TASK = "할 일을 여기에 적어요"
MODELS = [
    "claude-opus-5-5",
    "claude-opus-5",
]
RUNS = 2
RATE = 1400
SKIP = shutil.ignore_patterns(
    "node_modules", ".venv")
 
def run(model):
    # 복사본에서 돌려 원본은 그대로
    dst = tempfile.mkdtemp() + "/p"
    shutil.copytree(".", dst,
                    ignore=SKIP)
    t0 = time.time()
    out = subprocess.run(
        ["claude", "-p", TASK,
         "--model", model,
         "--permission-mode",
         "acceptEdits",
         "--output-format", "json"],
        cwd=dst, capture_output=True,
        stdin=subprocess.DEVNULL,
        text=True)
    r = json.loads(out.stdout)
    secs = time.time() - t0
    won = r["total_cost_usd"] * RATE
    turns = r["num_turns"]
    return won, turns, secs, dst
 
for m in MODELS:
    for i in range(RUNS):
        won, turns, secs, d = run(m)
        print(f"{m} {i+1}회")
        print(f"  {won:,.0f}원어치")
        print(f"  {turns}번 주고받음")
        print(f"  {secs:.0f}초")
        print(f"  결과: {d}")

프로젝트 폴더에 compare.py로 저장하고, 위쪽 세 줄만 바꾸면 돼요.

  • TASK — 시킬 일
  • MODELS — 비교할 모델
  • RUNS — 모델마다 몇 번 돌릴지

핵심은 복사본이에요

같은 일을 두 모델에 시키려면 출발점이 같아야 해요. 첫 번째 모델이 코드를 고쳐버리면, 두 번째 모델은 이미 고쳐진 코드를 받거든요.

그래서 스크립트는 매번 프로젝트를 임시 폴더에 복사해서 그 안에서 시켜요. 원본은 그대로 남고, 고친 결과는 복사본에 남아요. 출력 맨 끝 결과: 경로를 열어보면 모델이 뭘 고쳤는지 볼 수 있어요.

돌려봤어요

작은 장바구니 코드에 "쿠폰 코드를 대소문자 구분 없이 처리하게 고쳐줘"를 넣고 돌렸어요.

python3 compare.py

나온 그대로예요.

claude-opus-5-5 1회
  142원어치
  4번 주고받음
  14초
  결과: /tmp/tmpptjp546i/p
claude-opus-5-5 2회
  134원어치
  4번 주고받음
  11초
  결과: /tmp/tmpnt8mdedb/p
claude-opus-5 1회
  295원어치
  6번 주고받음
  35초
  결과: /tmp/tmprm4yw2zg/p
claude-opus-5 2회
  223원어치
  4번 주고받음
  19초
  결과: /tmp/tmp5ciox930/p

네 번 모두 제대로 고쳤어요. 복사본을 하나씩 열어 "ten", "Five"를 넣어보고 확인했어요. 방향도 어제 기사와 같았어요. Opus 5.5가 값도 시간도 절반 안팎이에요.

쓸 때 알아둘 것

  • 구독이면 금액은 환산값이에요. 쓴 토큰을 API 정가로 곱한 값이라 청구되진 않고, 대신 플랜 한도에서 빠져요. 작은 일로 재보세요
  • 파일 수정은 묻지 않고 하지만, 명령 실행(테스트 등)은 막혀 있어요. 테스트까지 시키려면 --allowedTools 옵션을 추가하세요
  • 복사본은 임시 폴더에 쌓여요. 결과 확인이 끝나면 지워주세요
  • 이 스크립트는 값만 재요. 결과가 맞는지는 따로 봐야 해요. 점수로 재는 법과 같이 쓰면 "싸고 맞는가"까지 볼 수 있어요
  • 같은 일도 돌릴 때마다 값이 달라져요. RUNS는 2 이상으로 두세요

짚어둘 것

출력은 제가 직접 돌린 그대로예요. 네 번 합쳐 API 정가로 794원어치, 스크립트를 고치기 전에 한 번 더 돌린 것까지 합치면 1,618원어치예요. 계정 로그인 방식이라 실제로 청구된 금액은 아니에요.

과제가 쉬워서 모델 실력 차이는 이걸로 알 수 없어요. 여러분 프로젝트의 진짜 일로 돌려봐야 의미가 있어요.

돌려보고 결과 공유해 주실 분 계세요? 카톡 오픈채팅 ⚡ AI랑 코딩하는 사람들에서 이야기 나눠요.

오늘 글, 도움이 되셨나요?