AI API 한 번에 정리: 모델별 값부터 키 관리까지
요즘 채팅창 대신 API로 AI를 쓰는 분이 늘었어요. 자동화를 돌리거나, 만든 앱에 AI 기능을 붙이거나, 에이전트를 밤새 돌리는 경우예요. 그동안 기사 여러 개에 흩어져 있던 내용을 한 번에 정리했어요.
API는 쓴 만큼 내요
구독은 한 달에 정해진 돈을 내고 한도 안에서 쓰는 방식이에요. API는 쓴 만큼 돈이 나가요(종량제). 한도 대신 청구서가 있는 셈이에요.
- 가볍게 쓰면 구독이 유리해요. 대부분은 구독 한도 근처에도 못 가요
- 내 앱이나 자동화에 AI를 붙이려면 API가 필요해요. 구독으로는 못 해요
- 에이전트를 오래 돌리면 두 쪽 다 계산해봐야 해요
왜 구독은 조이고 API는 싸지는지는 AI 머니 ⑤에 정리했어요.
요금표는 네 칸이에요
값은 100만 토큰당 얼마로 적혀 있어요. 토큰은 AI가 글을 자르는 단위예요.
- 입력: 내가 보낸 것. 질문만이 아니라 넘긴 코드와 지금까지의 대화가 매번 통째로 들어가요
- 출력: AI가 쓴 답. 보통 입력의 5배 값이에요
- 캐시 생성: 다음에 다시 쓰려고 저장해두는 값
- 캐시 읽기: 저장해둔 걸 다시 꺼내 읽는 값. 입력보다 훨씬 싸요
네 칸이 어떻게 청구서를 가르는지는 이 기사에서 뜯어봤어요.
주요 모델 정가
100만 토큰당 값이에요. 비싼 순서로 놓았어요.
| 모델 | 입력 | 출력 |
|---|---|---|
| Claude Fable 5.1 | 14,000원 | 70,000원 |
| GPT-6 Astra | 14,000원 | 70,000원 |
| Claude Opus 5.5 | 5,600원 | 28,000원 |
| Gemini 3.1 Pro | 2,800원 | 16,800원 |
| Claude Sonnet 5.5 | 2,800원 | 14,000원 |
| GPT-6 Sol | 2,800원 | 14,000원 |
| GPT-6.1 Sol | 2,800원 | 14,000원 |
| Grok 4.6 | 2,800원 | 8,400원 |
| Claude Haiku 4.5 | 1,400원 | 7,000원 |
| Gemini 3.8 Flash | 1,050원 | 5,250원 |
| GPT-6 Luna | 140원 | 700원 |
달러로는 Fable 5.1·Astra 10/50달러, Opus 5.5 4/20달러, Gemini 3.1 Pro 2/12달러, Sonnet 5.5·Sol·6.1 Sol 2/10달러, Grok 4.6 2/6달러, Haiku 4.5 1/5달러, Gemini 3.8 Flash 0.75/3.75달러, Luna 0.1/0.5달러예요.
- Gemini 3.8 Flash 값은 12월 31일까지 할인가예요. 내년 1월부터 입력 2,100원·출력 10,500원(1.5/7.5달러)으로 두 배가 돼요
- Gemini 두 모델은 공식 페이지를 제가 직접 열어보지 못해서 제3자 정리 기준이에요
- Grok 4.6은 8월 출시 때 값이에요
- GPT-6.1 Sol은 10월 2일에 추가했어요. 정가는 GPT-6 Sol과 같고 캐시 읽기만 절반이에요 (정리 기사)
정가보다 횟수가 더 커요
정가가 같아도 청구서는 달라요. 어제 잰 값에서 Sonnet 5와 Sonnet 5.5는 정가가 똑같았는데, 같은 과제에 Sonnet 5.5가 약 38% 적게 나왔어요. AI와 주고받은 횟수가 8번에서 5–6번으로 줄어서예요.
주고받을 때마다 앞 내용을 다시 읽어요. 그래서 덜 헤매는 모델이 싸요. 모델을 고를 땐 정가만 보지 말고 같은 일을 직접 시켜서 재보세요. 비교 스크립트를 쓰면 돼요.
값 줄이는 법 네 가지
1. 캐시를 쓰세요. 같은 앞부분(시스템 지시, 긴 문서, 코드)을 반복해서 보내면 두 번째부터는 캐시 읽기 값만 내요. Sonnet 5.5 기준 캐시 읽기는 입력 값의 10분의 1이에요.
어제 실험에서 한 번 돌린 사용량으로 제가 계산해봤어요. 읽은 토큰의 92%가 캐시에서 나왔고, 캐시가 없었다면 약 4.2배가 나왔을 거예요. 캐시가 안 걸리는 가장 흔한 이유는 앞부분에 매번 바뀌는 값(현재 시각 같은 것)을 넣는 거예요.
2. 급하지 않으면 배치로 보내세요. 결과를 바로 안 받아도 되는 일(대량 분류, 요약)은 모아서 보내면 Claude API 기준 값이 절반이에요. 대신 결과가 나중에 와요.
3. 긴 요청의 선을 확인하세요. 몇몇 모델은 요청 하나가 일정 길이를 넘으면 그 요청 전체가 비싼 값으로 바뀌어요.
- Grok 4.6: 20만 토큰 넘으면 두 배 (정리 기사)
- Gemini 3.1 Pro: 20만 토큰 넘으면 입력 두 배, 출력 1.5배
- GPT-6 Astra: 27만 2천 토큰 넘으면 비싼 요금표로
4. 쉬운 일은 싼 모델에 맡기세요. 분류나 짧은 요약은 Haiku나 Luna 같은 모델로도 되는 경우가 많아요. 어려운 판단만 비싼 모델에 넘기면 돼요.
키는 서버에만 두세요
API 키는 내 카드가 연결된 비밀번호예요. 누가 가져가면 그 사람이 쓴 값이 내 청구서로 와요.
- 앱 화면 코드(프론트엔드)에 넣지 마세요. 브라우저에서 누구나 볼 수 있어요. 키는 서버 쪽에서만 쓰세요
- 깃허브에 올리지 마세요.
.env파일에 두고.gitignore에 넣으세요 - 채팅, 메모 앱, 캡처 이미지 등 아무 데나 붙여 넣지 마세요
- 새어나간 것 같으면 바로 키를 지우고 새로 만드세요
화면에 공개해도 되는 키와 절대 안 되는 키의 차이는 DB 기사에서 다뤘어요.
지출 상한부터 걸어두세요
API는 한도가 없어서, 에이전트가 반복에 빠지면 밤새 돈이 나갈 수 있어요. 처음 키를 만들 때 콘솔에서 월 지출 상한부터 정해두세요. 방법은 이 기사에 있어요.
짚어둘 것
- 정가는 각 회사 발표와 저희 지난 기사 기준이에요. Gemini 두 모델은 제3자 정리 기준이라 쓰기 전에 공식 페이지에서 한 번 더 확인하세요
- 캐시 비교는 제 사용량 한 번에 정가를 곱한 계산이에요. 캐시 없는 쪽은 가정값이고, 작업마다 비율은 달라요
- 배치 절반 값은 Claude API 기준이에요. 다른 회사는 할인율이 다를 수 있어요
- 달러는 1달러 1,400원으로 환산했어요
API로 뭘 돌리고 계세요? 카톡 오픈채팅 ⚡ AI랑 코딩하는 사람들에서 청구서 이야기 나눠요.
참고