3개월에 7개, 하루 차이로 붙는다 — AI 모델 릴리스 러시
지난 한 달, 좀 어지럽지 않았어요? 금요일에 "그래 이제 이 모델로 정착하자" 마음먹으면, 월요일에 새 게 나와 있어요. 저만 이렇게 느끼나 했는데, 숫자로 봐도 진짜 그래요.
최근 3개월, 주요 모델 릴리스
| 날짜 | 회사 | 모델 |
|---|---|---|
| 4/23 | OpenAI | GPT-5.5 |
| 5/28 | Anthropic | Claude Opus 4.8 |
| 6/9 | Anthropic | Claude Fable 5 |
| 7/8 | xAI | Grok 4.5 |
| 7/9 | OpenAI | GPT-5.6 Sol |
| 7/21 | Gemini 3.6 Flash | |
| 7/24 | Anthropic | Claude Opus 5 |
3개월에 7개면 거의 격주예요. 그중에서도 압권은 Grok 4.5(7/8)와 GPT-5.6 Sol(7/9) — 딱 하루 차이로 나왔어요.
하루 차이는 우연이 아니에요
이게 왜 붙어서 나오냐면, 벤치마크 1등 자리 때문이에요. 한쪽이 "코딩 SOTA 갱신"이라고 발표하면, 상대는 그 헤드라인을 며칠씩 두고 볼 수가 없어요. 이미 준비돼 있던 다음 버전을 바로 다음 날 던져서 뉴스 사이클을 덮어버리는 거죠.
소비자 입장에선 경쟁이 치열해서 좋은 일 같지만, 뒤집어 보면 "누가 며칠 더 1등이냐" 싸움이라 우리 실제 작업이랑은 상관없는 경우도 많아요. 그러니까 릴리스 뉴스는 그 자체로 "지금 갈아타야 한다"는 신호가 아니에요.
매일 코딩하는 사람은 뭘 느끼냐면
솔직히, 피로예요. 새 모델이 뜰 때마다 이 세 가지를 매번 다시 겪거든요.
- 이거 지금 갈아타야 하나?
- 정착시켜둔 프롬프트를 또 손봐야 하나?
- 어제까지 잘 되던 게 왜 이 모델에선 이상하지?
성능이 5% 좋아졌다고 해도, 갈아타는 데 드는 시간이랑 삽질을 감안하면 본전도 못 뽑을 때가 많아요. 그래서 저는 새 모델이 나왔다고 무조건 옮기지 않아요.
갈아탈까 말까 — 저는 이렇게 정해요
벤치 점수 보고 결정하지 말고, 이 세 개만 통과하면 갈아타요.
- 내 실제 작업으로 5분 돌려본다. 남의 벤치 말고, 어제 붙잡고 있던 그 코드로. 눈에 띄게 나을 때만 고민을 시작해요.
- 잘 되던 게 아니라 막혔던 걸로 시험한다. 쉬운 건 어느 모델이든 다 해요. 차이는 어려운 데서 나요. 지난주에 기존 모델이 헤매던 문제를 새 모델한테 그대로 던져보면 실력이 바로 보여요.
- 하루만 써보고 결정한다. 첫인상은 대개 과장돼요. 하루 쓰면 특유의 버릇(쓸데없이 장황하거나, 시키지도 않은 리팩터링을 하거나)이 드러나요.
셋 다 통과하면 갈아타고, 아니면 그냥 쓰던 거 써요. FOMO로 갈아타는 게 제일 손해예요.
갈아타는 덴 숨은 비용이 있어요
모델을 바꾸면 눈에 안 보이는 청구서가 따라와요.
- 프롬프트가 안 맞아요. 모델마다 잘 먹는 지시 스타일이 달라서, 애써 다듬어둔 프롬프트를 다시 튜닝해야 할 때가 있어요.
- 버릇을 다시 파악해야 해요. 어떤 모델은 주석을 과하게 달고, 어떤 모델은 안 물어본 것까지 고쳐놔요.
- 규칙 파일도 점검해야 해요. 기존 모델이 잘 따르던 프로젝트 규칙을, 새 모델은 다르게 해석하기도 하거든요.
그래서 저는 "메인 1개 + 서브 1개"만 유지해요. 나머지는 소식만 챙기고, 손은 안 대요.
가격도 같이 움직여요
릴리스 러시의 진짜 이득은 여기 있어요 — 새 모델이 나오면 기존 모델이 싸져요. 플래그십이 갱신되면 직전 세대는 가격이 내려가거나 무료 티어로 풀리는 일이 잦아요. 최신을 꼭 써야 하는 작업이 아니라면, 한 세대 전 모델을 싸게 쓰는 게 가성비가 제일 좋을 때가 많습니다. (내 사용량이면 얼마 나올지 감이 안 잡히면 비용 계산기에 굴려보세요.)
결국, 안 바뀌는 데 투자하세요
모델은 3개월 뒤면 또 순위가 바뀌어요. 그 사이에 안 바뀌는 건 이거예요.
도구를 손에 익히는 것. Claude Code든 Cursor든, 도구만 익으면 모델은 그때그때 제일 좋은 걸로 갈아끼우면 그만이에요.
# 모델이 워낙 자주 나오니, 도구에서 모델만 바꿔 끼우면 돼요
# 현재 모델 확인 / 다른 모델로 전환
/model
# 하나가 막히면 자동으로 다음 걸 쓰게 하려면
# 설정에서 fallbackModel 을 최대 3개까지 지정할 수 있어요내 평가 세트를 만드는 것. 내 실제 작업에서 뽑은 문제 5개면 충분해요. 새 모델이 나오면 그것만 돌려보면 "나한테" 나은지 5분 만에 판단돼요. 남의 벤치 점수보다 이게 훨씬 정확해요.
기본기. 나온 코드를 읽고 틀린 부분을 잡아내는 눈. 이건 어떤 모델을 쓰든 안 변해요. 오히려 모델이 좋아질수록 더 중요해져요 — 그럴듯하게 틀린 코드를 걸러야 하니까요.
정리
- 3개월에 7개, 격주 페이스. Grok·GPT는 하루 차이 — 대부분 벤치 1등 싸움이에요.
- 벤치 1등 쫓지 말고, 내 작업으로 5분 테스트해서 결정하세요.
- 갈아타는 덴 숨은 비용(프롬프트·버릇·규칙)이 있어요. 메인+서브 2개면 충분합니다.
- 새 게 나오면 기존 게 싸지니 가성비도 챙기고요.
- 도구·내 평가셋·기본기 — 안 바뀌는 데 시간을 쓰세요.
요즘 메인으로 뭐 쓰세요? 최근에 갈아탔다면 "왜" 갈아탔는지도 방에 풀어주세요. 그 이유가 남의 벤치 점수보다 훨씬 도움 돼요 ⚡
참고: 날짜는 공개 릴리스 트래커를 종합한 대략치이며, Anthropic 날짜는 공식 릴리스 노트와 교차 확인했어요.