VibeDaily
← 목록
툴소개AI뉴스

정가는 똑같은데 캐시 값만 4배 — GPT-6 Astra와 Fable 5.1

2026.09.11👁 5🔗 원문 보기

9월 3일 GPT-6 Astra가 나왔어요. 값이 전작 GPT-5.6 Sol의 2.5배입니다. 100만 토큰당 입력이 4달러(약 5,600원)에서 10달러(약 1만 4천원)로, 출력이 20달러(약 2만 8천원)에서 50달러(약 7만원)로 올랐어요.

입력 / 출력이 뭔가요? 입력은 제가 AI에 보낸 것이에요. 질문 한 줄만이 아니라 읽어보라고 넘긴 코드와 지금까지의 대화가 매번 통째로 들어갑니다. 출력은 AI가 써준 답이고요. 출력이 5배 비싼 건 읽는 것보다 쓰는 게 계산이 훨씬 많이 들어서예요. 답을 한 글자씩 만들면서 그때마다 계산을 새로 돌리거든요.

그런데 그 10달러 / 50달러, 어디서 본 숫자죠. Claude Fable 5.1과 똑같습니다.

네 칸 중 세 칸이 같아요

요금표는 네 칸으로 되어 있어요.

100만 토큰당 GPT-6 Astra Fable 5.1
새 입력 10달러 10달러
캐시 생성 12.5달러 12.5달러
캐시 읽기 1달러 0.25달러
출력 50달러 50달러

세 칸이 같고 캐시 읽기만 4배 벌어져요. 1달러(약 1,400원)와 0.25달러(약 350원)입니다.

하필 그 칸이 제일 큰 칸이에요

캐시 읽기는 AI가 이미 본 코드를 다시 꺼내 볼 때 내는 값이에요. 대화가 길어질수록 여기가 불어납니다.

지난주에 사용량을 재봤을 때 Claude Code에서 전체 점검 한 번이 캐시 읽기 20만 토큰에 출력 2천 토큰이었어요. 캐시 읽기가 출력의 100배입니다.

정가 세 칸이 같아도, 제일 큰 칸이 4배면 청구서가 갈릴 수밖에 없어요.

제 청구서를 뜯어봤어요

여기서 분명히 해둘게요. 저는 Astra를 호출해보지 않았습니다. 그러니 "Astra로 돌리면 얼마"는 제가 모르는 값이라 적지 않을게요.

대신 제가 아는 것을 보여드릴게요. Claude Code에서 잰 사용량에 Claude 요금표를 적용한, 제 실제 작업 한 번입니다.

# 제가 Claude Code에서 잰 사용량이에요
사용량 = {
    "새 입력": 10,
    "캐시 생성": 10998,
    "캐시 읽기": 201877,
    "출력": 2088,
}
 
# Fable 5.1 요금
# 100만 토큰당 달러예요
단가 = {
    "새 입력": 10.00,
    "캐시 생성": 12.50,
    "캐시 읽기": 0.25,
    "출력": 50.00,
}
 
몫 = {}
for 이름, 토큰 in 사용량.items():
    원 = 토큰 * 단가[이름]
    몫[이름] = 원 / 1_000_000 * 1400
 
합 = sum(몫.values())
for 이름, 원 in 몫.items():
    비중 = 원 / 합 * 100
    앞 = f"{이름} {원:.0f}원"
    print(f"{앞} ({비중:.0f}%)")
print(f"합계 {합:.0f}원")

돌려보면 이렇게 나옵니다.

새 입력 0원 (0%)
캐시 생성 192원 (47%)
캐시 읽기 71원 (17%)
출력 146원 (36%)
합계 409원

409원이 캐시 생성 192원, 출력 146원, 캐시 읽기 71원으로 나뉘는 가로 막대

캐시 읽기가 71원, 요금의 17%예요. 그리고 바로 이 칸의 단가가 두 회사에서 4배 차이 납니다.

그러니 캐시를 많이 물고 도는 작업일수록 요금표 선택이 크게 작용해요. 짧게 끊어 쓰면 이 칸이 작아지니 차이도 줄고요.

얼마나 벌어지는지는 두 도구로 같은 일을 시켜보고 각각 재봐야 알 수 있습니다. 토큰을 얼마나 쓰는지가 도구마다 다르거든요.

27만 토큰을 넘으면 두 배가 돼요

Astra에는 선이 하나 더 있어요. 입력이 272,000토큰을 넘으면 그 요청 전체가 비싼 요금표로 넘어갑니다. 입력 20달러(약 2만 8천원), 캐시 읽기 2달러(약 2,800원), 출력 75달러(약 10만 5천원)로요.

위 전체 점검이 입력 합계 약 21만 토큰이었어요. 선까지 6만 토큰 남습니다. 큰 저장소를 통째로 물리면 넘기기 쉬운 거리예요.

그럼 성능은 어느 쪽이 나을까요

여기서 답이 두 갈래로 갈립니다. 누가 쟀느냐에 따라서요.

두 회사가 각자 낸 점수를 나란히 놓으면 Astra가 앞서요.

시험 GPT-6 Astra Fable 5.1
Terminal-Bench 4.0 57.7% 55.8%
DeepSWE v1.1 74.1% 67.4%

여기서 오해하기 쉬운 게 있어요. 앤트로픽이 "Astra가 우리보다 낫다"고 한 게 아닙니다. 두 회사가 각각 자기 모델 점수만 발표했고, 그걸 제3자 매체가 한 표에 모아놓은 거예요. 앤트로픽이 55.8%를 낼 때 비교 대상은 Astra가 아니라 전작 Fable 5(42.0%)였습니다.

회사마다 시험 돌리는 환경과 시도 방식이 다르니, 이 표는 같은 조건에서 겨룬 결과가 아니에요.

제3자가 같은 조건으로 잰 쪽에서는 뒤집힙니다. 아티피셜애널리시스의 코딩 에이전트 지수는 Fable 5.1이 70, Astra가 67이에요.

그런데 이 70 대 67을 그대로 받아들이면 안 돼요. 서로 다른 도구에서 잰 값이거든요. Fable 5.1은 Claude Code로, Astra는 Codex로 돌렸어요. 차이의 일부는 모델이 아니라 도구 몫입니다. 제미나이 3.8 때도 같은 얘기를 했었죠.

앞의 계산을 흔드는 값이 하나 있어요

같은 집계에서 Astra가 토큰을 훨씬 적게 씁니다. 지수에 올라온 에이전트 중 토큰을 제일 적게 쓴다고 나와요. 그래서 작업 하나를 끝내는 데 드는 돈은 Astra 쪽이 낮게 집계됩니다.

요금표만 놓고 "그래서 Astra가 1.5배 비싸다"고 말할 수 없는 이유가 여기 있어요.

작업당 금액은 출처마다 값이 엇갈려서 여기 적지 않을게요. 방향만 기억하시면 됩니다. 단가는 Astra가 비싸고, 쓰는 양은 Astra가 적어요. 어느 쪽이 덜 나올지는 내 작업이 캐시를 얼마나 물고 도느냐에 달렸습니다.

보안 쪽은 얘기가 좀 달라요

Astra는 OpenAI가 사이버보안 능력에서 "Critical" 단계에 닿았다고 스스로 밝힌 첫 모델이에요. 기업 계정에서는 관리자가 따로 켜야 쓸 수 있고, 취약점 공격 코드를 만들어달라는 요청은 거절합니다.

보안 쪽 일을 하신다면 멀쩡한 작업도 거절에 부딪힐 수 있다는 뜻이에요.

확인된 것과 짚어둘 것

확인된 것 — 9월 3일 공개, 9월 4일 API 공개. 위 요금은 두 회사 공식 요금표에 적힌 값이에요. 원화는 1달러 1,400원 기준입니다.

짚어둘 것 — 409원과 그 구성비는 Claude Code에서 잰 제 작업 한 번의 값이에요. 캐시 비중이 다르면 구성도 달라집니다. Astra로 같은 일을 하면 얼마인지는 이 기사에 없어요. 호출해보지 않았으니 모르는 값이고, 모르는 값은 적지 않았습니다. 궁금하시면 자기 사용량을 직접 재보세요.

ExploitBench 100점과 위 표의 Terminal-Bench·DeepSWE 값은 각 회사가 자기 모델을 자체 평가한 값이에요. 서로를 겨뤄본 게 아니라 각자 낸 점수를 제3자가 모은 겁니다. 코딩 에이전트 지수 70 대 67은 한 곳에서 쟀지만 서로 다른 도구에서 잰 값이고요. 어느 쪽도 그대로 순위로 읽으면 안 됩니다.

Astra로 갈아타 보셨어요? 카톡 오픈채팅 ⚡ AI랑 코딩하는 사람들에 청구서 후기 들려주세요.

참고

오늘 글, 도움이 되셨나요?