제미나이 3.8 플래시, "오퍼스를 이겼다"는 어느 시험 얘기일까요
어제(9월 2일) 구글이 제미나이 3.8 플래시를 냈어요. 넉 달 만에 나온 네 번째 플래시 모델입니다. "오퍼스 5를 이겼다"는 제목이 여기저기 붙었는데, 시험지를 하나씩 펼쳐보면 이야기가 좀 달라요.
벤치마크를 따로 보면요
- DeepSWE v1 (긴 호흡 코딩) — 71.0 대 74.0으로 거의 붙었어요
- OSWorld-2.0 (컴퓨터 조작) — 59.0 대 75.4로 벌어지고요
- Terminal-bench 4.0 (어려운 에이전트) — 19.1 대 51.8로 확 밀립니다
한 줄로 요약하면 코드를 짜는 일은 비슷하게 하는데, 스스로 오래 돌아다니며 처리하는 일은 아직 차이가 크다는 거예요. "이겼다"는 제목은 앞쪽 시험만 보고 붙은 셈이죠.
값은 확실히 쌉니다
실제 요청 하나를 넣어보면 체감이 와요. 코드 5만 토큰을 물리고 1만 토큰을 받는 상황으로 계산해볼게요.
# 같은 작업의 값을 모델별로 비교해봐요
# 입력 5만, 출력 1만 토큰으로 잡습니다
입력, 출력 = 50000, 10000
# 100만 토큰당 요금이에요 (입력, 출력)
요금 = {
"제미나이 3.8": (0.75, 3.75),
"제미나이 내년": (1.50, 7.50),
"Claude Opus 5": (5.00, 25.00),
}
# 달러를 원화로 바꿀 환율이에요
환율 = 1400
# 이름과 요금을 하나씩 꺼내 계산해요
for 이름, (입값, 출값) in 요금.items():
# 토큰을 100만으로 나눠 단가를 곱해요
달러 = 입력 / 1e6 * 입값
달러 += 출력 / 1e6 * 출값
원 = 달러 * 환율
# 원화로도 바꿔서 찍어요
print(f"{이름}")
print(f" {달러:.4f}달러 {원:.0f}원")돌려보면 이렇게 나와요.
제미나이 3.8
0.0750달러 105원
제미나이 내년
0.1500달러 210원
Claude Opus 5
0.5000달러 700원지금은 한 번에 105원이에요. 같은 작업을 오퍼스 5에 시키면 700원이고요.
다만 12월 31일이 끝이에요
지금 요금은 소개 가격입니다. 100만 토큰당 입력 0.75달러 / 출력 3.75달러인데, 2027년 1월 1일부터 정확히 두 배인 1.50달러 / 7.50달러가 돼요.
그록 4.6이 토큰 수에 따라 단가가 뛰는 구조였다면, 이쪽은 날짜로 뛰는 구조예요. 지금 값으로 예산을 잡아두면 연초에 두 배가 됩니다.
확인된 것과 조심할 것
확인된 것 — 9월 2일 공개, 요금 0.75달러 / 3.75달러, 12월 31일 이후 두 배. 위 벤치마크 수치는 구글이 공개한 평가 결과예요.
조심할 것 — 저 숫자들은 모델을 만든 회사가 낸 값이라 제3자 재현이 아직 적어요. Terminal-Bench 2.1 점수만 해도 매체마다 90.8%와 89.4%로 엇갈립니다. 10문제로 잰 80%가 58%가 됐던 지난주 사례처럼, 며칠 지나 재현 결과를 보고 판단해도 늦지 않아요.
그래서 언제 쓰면 좋냐면요
값이 6배 넘게 차이 나니, 양이 많고 판단이 단순한 일부터 옮겨보세요. 파일 수십 개 요약, 로그 훑기, 번역 같은 것들요. 반대로 혼자 오래 돌아야 하는 작업은 위 세 번째 그래프를 다시 보시는 게 좋겠어요.
새 플래시 써보셨어요? 카톡 오픈채팅 ⚡ AI랑 코딩하는 사람들에 후기 들려주세요.