VibeDaily
← 목록
툴소개AI뉴스

2.4조 파라미터 모델을 공짜로 푼대요 — 근데 벤치마크를 자기가 만들었어요

2026.08.10👁 5🔗 원문 보기

알리바바가 8월 3일 Qwen3.8-Max를 공개했어요. 크기가 어마어마해요 — 2.4조 파라미터에 100만 토큰을 한 번에 읽고, 글·이미지·영상까지 받아요.

그리고 가중치를 공개하겠다고 했어요. 무슨 뜻이냐면, 모델 파일을 받아서 내 컴퓨터나 사내 서버에 직접 올릴 수 있다는 거예요. API로 빌려 쓰는 게 아니라요.

✅ 확인된 것 vs ⏳ 아직인 것

한 줄로 뭉뚱그리면 오해가 생겨서 나눠 적을게요.

  • ✅ Qwen3.8-Max 자체는 나왔어요 (8월 3일, API로 사용 가능)
  • ⏳ 가중치 공개는 "다음 주"라고 예고한 상태예요. 이 글을 쓰는 시점엔 아직 확정 배포로 확인되지 않았어요
  • ✅ 함께 공개 예정인 Qwen3.8-27B는 훨씬 작아서, 개인이 돌려볼 만한 크기예요

2.4조 파라미터짜리를 개인이 돌리는 건 사실상 불가능해요. 서버 여러 대가 필요하거든요. 개인에게 의미 있는 건 27B 쪽이에요.

⚠️ 벤치마크는 조심해서 보세요

여기가 오늘의 핵심이에요. 알리바바가 내세운 숫자 중 상당수가 자기네가 만든 시험이에요.

시험 성격
Terminal Bench 2.1 (86.6점) 외부 공개 벤치마크
OSWorld-Verified, PaperBench 외부 공개 벤치마크
QwenSWEBench, QwenQoderBench 알리바바 자체 제작

이름에 Qwen이 붙은 시험에서 Qwen이 잘하는 건 놀랄 일이 아니에요. 문제를 낸 쪽이 시험도 준비했으니까요. 이건 알리바바만 그런 게 아니라 업계 관행이에요. MS도 Polaris를 자기 기준으로 홍보했죠(관련 기사).

Claude·GPT와 견줄 만하다는 주장은 외부 벤치마크에 한해서는 근거가 있고, 자체 벤치마크 수치는 참고만 하는 게 맞아요.

벤치마크 읽을 때 이것만 확인하세요

발표 자료를 볼 때 세 가지만 짚으면 대부분 걸러져요.

AI 성능 발표 볼 때 체크리스트
# ① 누가 만든 시험인가
시험 이름에 회사 이름이 들어있진 않은지 본다
 
# ② 비교 대상 버전이 최신인가
상대는 구버전, 자기는 최신으로 비교하는 경우가 많다
 
# ③ 누가 측정했는가
회사 자체 측정인지, 제3자 측정인지 확인한다

①번만 봐도 절반은 걸러져요. 이름부터 편향을 드러내는 경우가 의외로 많거든요. 😅

그래서 우리한테 뭐가 달라지냐면

  • 당장은 없어요. 27B 가중치가 실제로 풀리고 나서 써보면 돼요
  • 다만 폐쇄망·사내 서버에서 AI 코딩을 해야 하는 분들에겐 선택지가 하나 늘어요(폐쇄망 정리)
  • 오픈 모델이 계속 나오면 유료 모델 가격도 눌려요. 우리한테 나쁠 게 없죠

여러분은 새 모델 나오면 벤치마크 먼저 보세요, 아니면 그냥 써보시는 편이에요? 노하우 방에서 얘기 나눠요 ⚡

참고

오늘 글, 도움이 되셨나요?