본문으로 건너뛰기

Qwen3.8-Max: 최초의 오픈 웨이트 Max급 모델 (가중치가 실제로 공개된다면)

중급

2026년 8월 3일, 알리바바의 Qwen 팀은 Qwen3.8-Max를 공개했다 — 2.4조 파라미터 Mixture-of-Experts 모델로 95B 활성 파라미터, 1M 토큰 컨텍스트, 그리고 OSWorld-Verified에서 GPT-5.6 Sol Max를 약간 앞서는 벤치마크 수치를 갖췄다. 알리바바는 이 출시를 최초로 오픈 웨이트로 공개될 Qwen "Max"급 모델로 프레이밍했다 — 이전의 Max급 Qwen 모델들이 모두 API 전용이었기 때문에 이는 변화다. 가중치는 2026년 8월 10일 주에 Hugging Face와 ModelScope에서 공개될 것으로 약속되었다.

이 모델에 의존하는 코드를 다시 쓰기 전에 읽어볼 만한 함정이 있다: 출시 시점과 그 이후 며칠 동안 Hugging Face 페이지는 비어 있었다. 이 페이지는 2026년 8월 초 기준 Qwen3.8-Max의 실제 상태 — 아키텍처, 가격, Claude 또는 OpenAI 클라이언트에 드롭인으로 사용할 수 있게 해주는 이중 규격 API, "벤더 보고" 별표가 붙은 벤치마크 표, 그리고 코드를 커밋하기 전에 물어야 할 오래가는 질문들 — 을 살펴본다.

What you'll learn
  • 8월 3일에 실제로 출시된 것과 약속만 된 것을 구분해서 이해하기 — API 접근 vs 오픈 웨이트
  • 2.4T / 95B 활성 MoE 희소성 수학을 올바르게 읽기, 특히 자체 호스팅 배포 비용을 산정하기 전에
  • Qwen3.8-Max가 OpenAI 규격과 Anthropic 규격 API를 모두 노출한다는 점 알기 — 이식성을 바꾸는 드문 속성
  • 출시 벤치마크(OSWorld 86.1, PaperBench 93.0)를 올바른 회의감으로 해석하기 — 벤더 보고, 모델 카드 없음, 아직 제3자 실행 없음
  • '오픈 웨이트 약속 ≠ 오픈 웨이트 출시' 패턴을 인식하고 기다리는 동안 할 일 알기

한 문장 요약

Qwen3.8-Max는 2.4조 파라미터 희소 MoE(토큰당 95B 활성)로 1M 토큰 컨텍스트, 네이티브 텍스트 + 비전 입력, OpenAI 규격과 Anthropic 규격 이중 API를 제공하고, 가격은 백만 입력/출력 토큰당 $2/$6 — 2026년 8월 3일 API 전용으로 발표되었으며, 가중치와 동반 Qwen3.8-27B 모델은 2026년 8월 10일 주에 오픈 공개될 것으로 약속되었다.

헤드라인에서 잘 드러나지 않는 Qwen3.8-Max에 관한 세 가지

1. "오픈 웨이트"는 발표되었지만 아직 출시되지 않았다

알리바바의 출시 커뮤니케이션과 대부분의 보도는 Qwen3.8-Max를 최초의 오픈 웨이트 "Max"급 Qwen으로 묘사했다. 이는 실제 변화다 — Qwen3-Max, Qwen3.5-Max, Qwen3.6-Max, Qwen3.7-Max는 모두 API 전용이었다. 하지만 출시 시점과 첫 주 동안 Hugging Face의 Qwen 조직에는 Qwen3.8-Max 저장소도, Qwen3.8-27B 저장소도, 선언된 라이선스도 없었다. 약속은 "8월 10일 주 가중치"였다; 이를 중심으로 컴플라이언스 사례를 계획하기 전에 확인하라.

출시 첫 시간의 커뮤니티 반응은 벤치마크가 아니라 거의 전적으로 가중치에 관한 것이었다. 사용자들은 아티팩트가 공개되지 않은 상태에서 알리바바의 "오픈 소스" 프레이밍에 반발했다. 내면화할 유용한 구분:

  • "이용 가능한" 모델은 벤더의 조건에 따라 임대하는 서비스다. API가 폐기되면 종속성이 깨진다.
  • "오픈 웨이트" 모델은 다운로드해서 보유하는 아티팩트다. 감사하고, 에어갭 클러스터에서 실행하고, 벤더가 방향을 바꾼 후에도 계속 보유할 수 있다.

이들은 서로 다른 리스크 프로필을 가진 다른 제품이다. 이전 Qwen 오픈 웨이트 공개(Qwen 3.5, Qwen 3.6)는 Apache-2.0으로 출시되었는데, 이는 강력한 패턴이지만 Qwen3.8에 대한 약속은 아니다. 라이선스가 공개되는 날 읽어라; 가정하지 마라.

2. 4% 희소성 비율은 하드웨어의 4%를 의미하지 않는다

Qwen3.8-Max는 Mixture-of-Experts다. 2.4T 총 파라미터 중 토큰당 약 95B만 활성화된다 — 대략 4% 희소성이다. 이것이 토큰당 가격이 경쟁력 있고 지연 시간이 합리적인 이유다: 2.4T가 아니라 약 95B의 순전파 컴퓨트에 비용을 지불하는 것이다.

함정은 가중치 메모리는 그런 식으로 작동하지 않는다는 것이다. 모델을 실행하려면 라우터가 적절한 전문가를 가져올 수 있도록 2.4T 파라미터 전체가 충분히 빠른 곳에 상주해야 한다. fp8에서는 약 2.4 TB의 가중치 메모리다. fp16에서는 약 4.8 TB. 공격적인 MXFP4 또는 유사한 4비트 양자화를 사용해도 1M 토큰 컨텍스트의 KV 캐시를 세기 전에 가중치만으로 ≥1.2 TB를 보고 있게 된다. 이는 다음을 의미한다:

  • 단일 H100(80 GB) — 4비트에서도 전체 모델에 대해 실행 불가능.
  • 8×H100 노드(640 GB) — 전체 2.4T의 4비트에서도 여전히 부족; 큰 지연 비용을 감수하며 무거운 CPU 오프로드로 가능.
  • 다중 노드 추론(16개 이상 H100 또는 이에 상응하는 것) — 실시간 서빙의 현실적인 발자국.

누군가 "95B만 활성화되니까 단일 머신에서 실행할 수 있다"고 인용한다면 — 그들은 잘못된 숫자를 세고 있다. 동반하는 Qwen3.8-27B 밀집 모델이 부분적으로 이러한 이유로 존재한다: 그것이 영웅적 노력 없이 단일 8-GPU 노드에서 실제로 실행할 수 있는 모델이다.

3. 동일한 엔드포인트에서 OpenAI 호환과 Anthropic 호환 API 모두 지원

Qwen3.8-Max의 API는 OpenAI /v1/chat/completions 형태와 Anthropic /v1/messages 형태를 모두 지원한다. 대부분의 벤더는 하나만 제공하고, 일부는 OpenAI-호환 심을 제공한다; Qwen이 일급 Anthropic 규격 지원을 제공하는 것은 진정으로 이례적이며 그 주변에서 계획을 세울 가치가 있다.

실질적 결과: Claude용 Anthropic Python SDK에 대해 작성한 코드 — messages.create(), 도구 블록, 시스템 프롬프트 처리, 스트리밍 포함 — 는 base URL만 교체하면 메시지 형태 재작성 없이 Qwen3.8-Max를 가리킬 수 있다. OpenAI SDK 코드도 마찬가지다. 이는 Claude나 GPT에 대한 A/B 테스트를 일반적인 "도구 스키마 포팅" 작업보다 훨씬 저렴하게 만든다.

Anthropic 호환 API를 통한 Qwen3.8-Max (Python)

from anthropic import Anthropic

client = Anthropic(
  api_key="YOUR_DASHSCOPE_KEY",
  base_url="https://dashscope.aliyuncs.com/api/v1",  # verify current base URL in Qwen docs
)

response = client.messages.create(
  model="qwen3.8-max",
  max_tokens=1024,
  messages=[{"role": "user", "content": "Plan a migration from Postgres 15 to 17 for a 4TB OLTP database."}],
)
print(response.content[0].text)

OpenAI 호환 API를 통한 Qwen3.8-Max (Python)

import openai

client = openai.OpenAI(
  api_key="YOUR_DASHSCOPE_KEY",
  base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
  model="qwen3.8-max",
  messages=[{"role": "user", "content": "Refactor this Python coroutine to use asyncio.TaskGroup."}],
)
print(response.choices[0].message.content)

출시 벤치마크가 말하는 것 — 그리고 별표가 의미하는 것

알리바바의 출시 수치(자체 보고, 출시 시 모델 카드 없음, 재현 가능한 평가 트레이스 없음):

벤치마크Qwen3.8-MaxGPT-5.6 Sol MaxClaude Fable 5Gemini 3.1 Pro
OSWorld-Verified (에이전트형 OS 사용)86.183.285.076.2
PaperBench (연구 종합)93.0
Frontend Code Arena4위

이것들을 누구에게 인용하기 전에 기억할 구체적인 별표:

  • 벤더 보고. 출시 시 모델 카드 없음, 평가 하니스 커밋 없음, 제3자 복제 없음 — 보통 며칠 안에 독립적 점수를 발표하는 Artificial Analysis도 포함해서.
  • OSWorld-Verified는 상위권에서 작은 격차다. Qwen 86.1, Claude Fable 5 85.0, GPT-5.6 Sol Max 83.2는 1–3점 격차다. 많은 에이전트형 벤치마크의 노이즈 밴드 내에 있다. "한 벤치마크에서 프론티어를 1.1점 앞선다"는 "프론티어를 대체한다"가 아니다.
  • PaperBench는 SWE-bench나 GPQA보다 덜 확립되었다. 93.0 헤드라인은 인상적이지만 확정적이 아니라 방향성으로 취급해야 한다.
  • Frontend Code Arena는 Qwen3.8-Max를 4위로 두었다 — 여러 Anthropic 모델과 Fable 5 변형 뒤에. 다른 작업은 다른 훈련 신호에 보상을 준다; 한 벤치마크에서 1위이고 다른 벤치마크에서 4위인 것은 모순이 아니라 정상적인 결과다.

독립적 평가(Artificial Analysis, LMArena, 제3자 학술 실행)를 기다린 후 모델 선택 기본값을 다시 쓰는 것이 신중한 움직임이다.

알아둘 만한 가격 계산

API 가격표:

등급MTok당 가격
입력$2.00
출력$6.00
캐시된 입력$0.25

이는 현재 Anthropic Max 등급 입력 비용의 8배 저렴하고 GPT-5.6 Sol Max 출력 비용의 약 절반이다. $0.25/MTok의 캐시된 입력이 흥미로운 부분이다: 동일한 시스템 프롬프트를 사용하는 반복적인 에이전트형 도구 루프에서 캐시 적중률은 일반적으로 80% 이상으로 실행되므로, 작동 중인 에이전트의 실효 입력 비용은 $2.00이 아니라 $0.35–$0.60/MTok에 더 가깝다.

Kimi K3 경제학과 비교하면 — 캐시 적중 입력이 $0.30/MTok — Qwen3.8-Max는 같은 저-캐시-가격 대역에 있다. 이는 동일한 프롬프트 스캐폴딩이 매 도구 단계마다 다시 전송되는 비용에 민감한 장기 지평 에이전트형 워크로드에 두 모델 모두 실행 가능하게 만든다.

Qwen3.8-Max 시작하기 (오늘, API를 통해)

Guided walkthrough1 of 4
  1. Qwen API는 DashScope(중국 지역)와 Model Studio(국제)를 통해 제공된다. 워크스페이스에서 모델을 활성화하고 API 키를 생성하면 두 곳 모두 qwen3.8-max 모델 ID를 노출한다.

Qwen3.8-Max vs 경쟁하는 모델들

Qwen3.8-MaxKimi K3GLM-5.2Claude Fable 5GPT-5.6 Sol Max
총 파라미터2.4T MoE2.8T MoE753B미공개미공개
토큰당 활성~95B16/896 전문가
컨텍스트 창1M1M1M+400K+
네이티브 비전텍스트 전용
오픈 웨이트발표됨 (8월 10일 주)2026년 7월 27일 출시출시됨아니오아니오
입력 가격 / MTok$2.00 ($0.25 캐시)$3.00 ($0.30 캐시)무료 (자체 호스팅)벤더 등급벤더 등급
출력 가격 / MTok$6.00$15.00무료 (자체 호스팅)벤더 등급벤더 등급
API 규격OpenAI + AnthropicOpenAI 호환다양AnthropicOpenAI

Qwen3.8-Max를 선택하라 다음의 경우: 나중에 자체 호스팅도 가능한 프론티어 등급 API를 원할 때, 예산이 Anthropic/OpenAI Max 등급보다 빠듯할 때, 또는 (Anthropic 규격 지원 덕분에) 최소한의 코드 변경으로 Claude에 대해 A/B 테스트를 원할 때.

Kimi K3를 선택하라 다음의 경우: 오늘 오픈 웨이트가 필요할 때(K3는 2026년 7월 27일 출시됨), 또는 이미 Moonshot 도구 위에 있을 때.

GLM-5.2를 선택하라 다음의 경우: 자체 호스팅이 지금 확고한 요구 사항이고 비전이 중요하지 않을 때.

Claude Fable 5 또는 GPT-5.6 Sol Max에 머물러라 다음의 경우: 가장 깊은 제3자 벤치마크 기록, 공식적인 엔터프라이즈 벤더 약속, 또는 그 모델들이 조정된 특정 도구 사용 / 안전 동작이 필요할 때.

관련: DeepSeek, Qwen 및 오픈 웨이트 물결에서 더 넓은 랜드스케이프 맥락을, 모델 선택하기에서 일반적인 프레임워크를 참조하라.

Qwen3.8-Max에 커밋하기 전 실용적 체크리스트

  1. 가중치가 실제로 공개되었는지 확인하라 Hugging Face나 ModelScope에서, "오픈 웨이트"를 컴플라이언스 문서에 쓰기 전에.
  2. 공개되는 날 라이선스를 읽어라. Apache-2.0은 Qwen 3.5와 3.6의 강력한 패턴이다; 3.8에 대한 보장은 아니다.
  3. 자신의 평가 실행을 해보라. 벤더 OSWorld-Verified 수치는 방향성이다; 그 벤치마크 상위의 1–3점 격차는 노이즈 밴드 내에 있다.
  4. 캐시를 신중하게 비용 모델링하라. $0.25/MTok 캐시된 입력 가격이 경제학이 흥미로워지는 지점이다; 캐시 적중이 없다면 $2/$6 헤드라인이 실효 가격이다.
  5. 자체 호스팅 발자국을 정직하게 계획하라. 4% 활성 파라미터 ≠ 4% GPU 메모리. 2.4T MoE에 대한 전체 가중치 상주는 노트북 프로젝트가 아니라 심각한 배포다.
  6. 어떤 규격에 대해 코딩할지 결정하라. OpenAI 규격과 Anthropic 규격 모두 일급이다 — 기존 코드 경로에 맞는 것을 선택하라, 세 번째 추상화를 발명하지 마라.

퀴즈

Check yourself

0/5
  1. Qwen3.8-Max는 2026년 8월 3일 '오픈 웨이트'로 발표되었다. 출시 시점에 실제로 이용 가능했던 것은?
  2. Qwen3.8-Max는 총 2.4T 파라미터, 토큰당 95B 활성이다. 이는 자체 호스팅 하드웨어에 무엇을 의미하는가?
  3. Qwen3.8-Max의 API가 대부분의 경쟁 모델과 비교해서 특이한 점은?
  4. 알리바바의 출시는 OSWorld-Verified에서 Qwen3.8-Max를 86.1로, GPT-5.6 Sol Max를 83.2로 보였다. 이를 올바르게 읽는 방법은?
  5. Qwen3.8-Max는 백만 입력/출력 토큰당 $2/$6를 나열하고, 캐시된 입력은 $0.25/MTok이다. 크고 안정적인 시스템 프롬프트가 있는 장기 실행 에이전트형 루프의 실질적 실효 입력 비용은?
Enter 또는 스페이스 키를 눌러 카드를 뒤집습니다. 좌우 화살표 키로 카드를 이동할 수 있습니다.용어가 표시되었습니다.
1 / 8

출처 및 추가 자료