VibeDaily
← 목록
툴소개AI뉴스

Opus 5.5 나왔어요 — Opus 5보다 싸고 Fable급이라는데, 직접 재봤어요

2026.09.23👁 1🔗 원문 보기

9월 22일(미국 시간), 앤트로픽이 Claude Opus 5.5를 냈어요. 발표를 한 줄로 줄이면 이래요 — Fable 5.1급 성능을 Opus 5보다 40% 싸게.

말은 좋은데 진짜인지 궁금하잖아요. 그래서 발표 숫자를 정리하고, 같은 과제를 직접 돌려봤어요.

값부터 — 정가가 내려갔어요

100만 토큰당 정가예요. 캐시는 한 번 읽은 내용을 다시 읽을 때 값이에요.

Opus 5.5 Opus 5 Fable 5.1
입력 5,600원 7,000원 1만 4천원
출력 2만 8천원 3만 5천원 7만원
캐시 280원 700원 350원

1달러 1,400원 기준이에요. 달러 정가는 입력·출력·캐시 순으로 Opus 5.5 $4·$20·$0.20, Opus 5 $5·$25·$0.50, Fable 5.1 $10·$50·$0.25예요.

Opus 5보다 입력·출력이 20% 싸고, 캐시 읽기는 60% 싸요. Fable 5.1과 비교하면 입력·출력이 절반도 안 돼요. 한 번에 넣을 수 있는 양(컨텍스트)은 100만 토큰으로 같아요.

발표 점수 — 앤트로픽이 직접 잰 값이에요

앤트로픽이 낸 표에서 Opus 5.5는 비교한 벤치마크 9개 전부에서 Fable 5.1과 Opus 5를 앞섰어요. 터미널에서 실제 작업을 시키는 Terminal-Bench 4.0에선 66.4%로, 경쟁사 GPT-6 Astra(57.9%)보다도 높게 나왔고요.

Terminal-Bench 4.0 앤트로픽 발표 점수. Opus 5.5 66.4%, GPT-6 Astra 57.9%, Fable 5.1 55.8%, Opus 5 52.3%, GPT-5.6 Sol 37.3%

다만 이 점수는 걸러서 봐야 해요.

  • 회사가 직접 잰 점수예요. 제3자가 검증한 게 아니에요
  • 조건이 달라요. Opus 5.5는 가장 센 설정(xhigh), Astra는 한 단계 아래(high)로 쟀어요
  • 공개 리더보드 값과도 달라요. 주간 정리에서 본 공개 리더보드는 Astra 58.2%, Fable 5.1 57.9%였어요
  • 전부 이긴 것도 아니에요. 같은 표에서 AutomationBench(40.0% 대 41.4%)와 Terminal-Bench-Science(58.7% 대 64.6%)는 Astra가 앞섰어요

직접 재봤어요

작은 코딩 과제 하나를 모델마다 세 번씩, 순서를 번갈아 가며 시켰어요. 끝나면 제가 따로 만든 채점표(5문항)로 결과를 검사했고요.

아홉 번 모두 5점 만점이었어요. 쉬운 과제라 실력 차이는 안 났어요. 대신 값과 시간이 크게 갈렸어요.

한 번 값(API 정가 환산) 주고받은 횟수 걸린 시간
Opus 5.5 184–210원 5–6번 23–27초
Opus 5 431–754원 9–10번 37–43초
Fable 5.1 521–1,248원 6–8번 36–45초

세 무리가 겹치지 않아요. Opus 5.5에서 가장 비싸게 든 회차(210원)가 Opus 5에서 가장 싸게 든 회차(431원)의 절반도 안 돼요.

같은 코딩 과제를 모델마다 세 번씩 시킨 비용. Opus 5 754·431·465원, Opus 5.5 210·184·192원, Fable 5.1 1,248·521·596원

정가 차이는 20%뿐인데 값이 절반 넘게 줄어든 건 덜 돌아서예요. Opus 5가 파일을 열고 확인하며 9–10번 주고받을 때, Opus 5.5는 5–6번에 끝냈어요. 앤트로픽이 "같은 일을 더 적은 걸음으로 끝낸다"고 한 부분이 이 과제에선 그대로 나왔어요.

제가 계산해보면, 캐시를 새로 쓰느라 비싸진 1회차를 빼고 2·3회차끼리 비교했을 때 평균 188원 대 448원으로 약 58% 적게 나왔어요. 앤트로픽이 말한 40%보다 크게 나왔지만, 쉬운 과제 하나에 세 번씩이라 일반화하긴 일러요.

그리고 effort(생각을 얼마나 깊게 할지)는 따로 정하지 않고 기본값 그대로 뒀어요. API 기준으로 Opus 5.5의 기본 effort는 Opus 5보다 한 단계 낮은 medium이라, 그 차이도 값에 섞여 있을 수 있어요.

쓰기 전에 알아둘 것

  • 생각(thinking)을 끌 수 없어요. 대신 effort로 조절해요. 어려운 작업이면 한 단계 올려주세요
  • API로 쓰시는 분은 특정 도구를 강제로 부르는 설정(tool_choice any/tool)이 막혔어요. 쓰던 코드가 있으면 확인하세요
  • 기본 모델: 보도에 따르면 구독 플랜에서 Opus를 고르면 이제 5.5가 잡혀요. 다만 제 환경에선 모델을 안 정하면 여전히 Sonnet 5가 잡혔어요. /model로 지금 뭘 쓰는지 한 번 보세요

직접 비교해보고 싶으면 모델만 바꿔서 같은 일을 시켜보세요. 구독(Pro·Max)으로 쓰시면 대화창에서 이렇게 하면 돼요.

  1. /model에서 Opus 5.5를 고르고 일을 시켜요
  2. 끝나면 /usage를 쳐서 세션 칸의 토큰 수와 금액을 적어둬요
  3. 코드를 시키기 전 상태로 되돌리고(git stash 등) /clear로 세션 합계를 0으로 돌려요
  4. /model에서 Opus 5를 고르고 같은 문장으로 다시 시킨 뒤 /usage를 봐요

구독이라면 여기 나오는 금액은 청구되는 돈이 아니에요. 쓴 토큰을 API 정가로 곱한 추정치예요. 그래도 같은 잣대로 계산하니 모델끼리 비교하는 용도로는 충분해요. 구독에서 실제로 줄어드는 건 /usage의 플랜 사용량 막대인데, 모델마다 한도에서 얼마씩 빠지는지는 공개돼 있지 않아요.

터미널 한 줄로 하려면 이렇게요.

# 모델을 골라서 한 번 시키기
claude -p "할 일" \
  --model claude-opus-5-5 \
  --output-format json

결과에 나오는 total_cost_usd가 같은 환산값이에요. 작은 일로 재보세요. 구독이면 이 실험도 한도에서 빠져요. 점수로 재는 법과 같이 쓰면 "싸졌는데 결과도 같나"까지 볼 수 있어요.

짚어둘 것

요금·출시일·벤치마크는 앤트로픽 공식 발표 기준이에요. 벤치마크는 전부 회사가 직접 잰 값이고, 제3자 검증은 아직이에요.

비용·시간·횟수는 제가 직접 돌린 값이에요. 금액은 쓴 토큰을 API 정가로 환산한 값이에요(아홉 번 합쳐 4,601원어치). 제 환경은 API 키가 아니라 계정 로그인 방식이라, 실제로 이만큼 청구된 건 아니에요. 쉬운 과제 하나라서 "어려운 일에서도 Fable급인가"는 이 실험으로 알 수 없어요.

58%는 제가 계산한 값이에요. 앤트로픽이 발표한 숫자가 아니에요.

Opus 5.5로 바꿔보신 분 계세요? 체감이 어땠는지 카톡 오픈채팅 ⚡ AI랑 코딩하는 사람들에서 이야기 나눠요.

오늘 글, 도움이 되셨나요?