Qwen3.8-Max: 최초의 오픈 웨이트 Max급 모델 (가중치가 실제로 공개된다면)
2026년 8월 3일, 알리바바의 Qwen 팀은 Qwen3.8-Max를 공개했다 — 2.4조 파라미터 Mixture-of-Experts 모델로 95B 활성 파라미터, 1M 토큰 컨텍스트, 그리고 OSWorld-Verified에서 GPT-5.6 Sol Max를 약간 앞서는 벤치마크 수치를 갖췄다. 알리바바는 이 출시를 최초로 오픈 웨이트로 공개될 Qwen "Max"급 모델로 프레이밍했다 — 이전의 Max급 Qwen 모델들이 모두 API 전용이었기 때문에 이는 변화다. 가중치는 2026년 8월 10일 주에 Hugging Face와 ModelScope에서 공개될 것으로 약속되었다.
이 모델에 의존하는 코드를 다시 쓰기 전에 읽어볼 만한 함정이 있다: 출시 시점과 그 이후 며칠 동안 Hugging Face 페이지는 비어 있었다. 이 페이지는 2026년 8월 초 기준 Qwen3.8-Max의 실제 상태 — 아키텍처, 가격, Claude 또는 OpenAI 클라이언트에 드롭인으로 사용할 수 있게 해주는 이중 규격 API, "벤더 보고" 별표가 붙은 벤치마크 표, 그리고 코드를 커밋하기 전에 물어야 할 오래가는 질문들 — 을 살펴본다.
- 8월 3일에 실제로 출시된 것과 약속만 된 것을 구분해서 이해하기 — API 접근 vs 오픈 웨이트
- 2.4T / 95B 활성 MoE 희소성 수학을 올바르게 읽기, 특히 자체 호스팅 배포 비용을 산정하기 전에
- Qwen3.8-Max가 OpenAI 규격과 Anthropic 규격 API를 모두 노출한다는 점 알기 — 이식성을 바꾸는 드문 속성
- 출시 벤치마크(OSWorld 86.1, PaperBench 93.0)를 올바른 회의감으로 해석하기 — 벤더 보고, 모델 카드 없음, 아직 제3자 실행 없음
- '오픈 웨이트 약속 ≠ 오픈 웨이트 출시' 패턴을 인식하고 기다리는 동안 할 일 알기
한 문장 요약
Qwen3.8-Max는 2.4조 파라미터 희소 MoE(토큰당 95B 활성)로 1M 토큰 컨텍스트, 네이티브 텍스트 + 비전 입력, OpenAI 규격과 Anthropic 규격 이중 API를 제공하고, 가격은 백만 입력/출력 토큰당 $2/$6 — 2026년 8월 3일 API 전용으로 발표되었으며, 가중치와 동반 Qwen3.8-27B 모델은 2026년 8월 10일 주에 오픈 공개될 것으로 약속되었다.
헤드라인에서 잘 드러나지 않는 Qwen3.8-Max에 관한 세 가지
1. "오픈 웨이트"는 발표되었지만 아직 출시되지 않았다
알리바바의 출시 커뮤니케이션과 대부분의 보도는 Qwen3.8-Max를 최초의 오픈 웨이트 "Max"급 Qwen으로 묘사했다. 이는 실제 변화다 — Qwen3-Max, Qwen3.5-Max, Qwen3.6-Max, Qwen3.7-Max는 모두 API 전용이었다. 하지만 출시 시점과 첫 주 동안 Hugging Face의 Qwen 조직에는 Qwen3.8-Max 저장소도, Qwen3.8-27B 저장소도, 선언된 라이선스도 없었다. 약속은 "8월 10일 주 가중치"였다; 이를 중심으로 컴플라이언스 사례를 계획하기 전에 확인하라.
출시 첫 시간의 커뮤니티 반응은 벤치마크가 아니라 거의 전적으로 가중치에 관한 것이었다. 사용자들은 아티팩트가 공개되지 않은 상태에서 알리바바의 "오픈 소스" 프레이밍에 반발했다. 내면화할 유용한 구분:
- "이용 가능한" 모델은 벤더의 조건에 따라 임대하는 서비스다. API가 폐기되면 종속성이 깨진다.
- "오픈 웨이트" 모델은 다운로드해서 보유하는 아티팩트다. 감사하고, 에어갭 클러스터에서 실행하고, 벤더가 방향을 바꾼 후에도 계속 보유할 수 있다.
이들은 서로 다른 리스크 프로필을 가진 다른 제품이다. 이전 Qwen 오픈 웨이트 공개(Qwen 3.5, Qwen 3.6)는 Apache-2.0으로 출시되었는데, 이는 강력한 패턴이지만 Qwen3.8에 대한 약속은 아니다. 라이선스가 공개되는 날 읽어라; 가정하지 마라.
2. 4% 희소성 비율은 하드웨어의 4%를 의미하지 않는다
Qwen3.8-Max는 Mixture-of-Experts다. 2.4T 총 파라미터 중 토큰당 약 95B만 활성화된다 — 대략 4% 희소성이다. 이것이 토큰당 가격이 경쟁력 있고 지연 시간이 합리적인 이유다: 2.4T가 아니라 약 95B의 순전파 컴퓨트에 비용을 지불하는 것이다.
함정은 가중치 메모리는 그런 식으로 작동하지 않는다는 것이다. 모델을 실행하려면 라우터가 적절한 전문가를 가져올 수 있도록 2.4T 파라미터 전체가 충분히 빠른 곳에 상주해야 한다. fp8에서는 약 2.4 TB의 가중치 메모리다. fp16에서는 약 4.8 TB. 공격적인 MXFP4 또는 유사한 4비트 양자화를 사용해도 1M 토큰 컨텍스트의 KV 캐시를 세기 전에 가중치만으로 ≥1.2 TB를 보고 있게 된다. 이는 다음을 의미한다:
- 단일 H100(80 GB) — 4비트에서도 전체 모델에 대해 실행 불가능.
- 8×H100 노드(640 GB) — 전체 2.4T의 4비트에서도 여전히 부족; 큰 지연 비용을 감수하며 무거운 CPU 오프로드로 가능.
- 다중 노드 추론(16개 이상 H100 또는 이에 상응하는 것) — 실시간 서빙의 현실적인 발자국.
누군가 "95B만 활성화되니까 단일 머신에서 실행할 수 있다"고 인용한다면 — 그들은 잘못된 숫자를 세고 있다. 동반하는 Qwen3.8-27B 밀집 모델이 부분적으로 이러한 이유로 존재한다: 그것이 영웅적 노력 없이 단일 8-GPU 노드에서 실제로 실행할 수 있는 모델이다.
3. 동일한 엔드포인트에서 OpenAI 호환과 Anthropic 호환 API 모두 지원
Qwen3.8-Max의 API는 OpenAI /v1/chat/completions 형태와 Anthropic /v1/messages 형태를 모두 지원한다. 대부분의 벤더는 하나만 제공하고, 일부는 OpenAI-호환 심을 제공한다; Qwen이 일급 Anthropic 규격 지원을 제공하는 것은 진정으로 이례적이며 그 주변에서 계획을 세울 가치가 있다.
실질적 결과: Claude용 Anthropic Python SDK에 대해 작성한 코드 — messages.create(), 도구 블록, 시스템 프롬프트 처리, 스트리밍 포함 — 는 base URL만 교체하면 메시지 형태 재작성 없이 Qwen3.8-Max를 가리킬 수 있다. OpenAI SDK 코드도 마찬가지다. 이는 Claude나 GPT에 대한 A/B 테스트를 일반적인 "도구 스키마 포팅" 작업보다 훨씬 저렴하게 만든다.
Anthropic 호환 API를 통한 Qwen3.8-Max (Python)
from anthropic import Anthropic
client = Anthropic(
api_key="YOUR_DASHSCOPE_KEY",
base_url="https://dashscope.aliyuncs.com/api/v1", # verify current base URL in Qwen docs
)
response = client.messages.create(
model="qwen3.8-max",
max_tokens=1024,
messages=[{"role": "user", "content": "Plan a migration from Postgres 15 to 17 for a 4TB OLTP database."}],
)
print(response.content[0].text)OpenAI 호환 API를 통한 Qwen3.8-Max (Python)
import openai
client = openai.OpenAI(
api_key="YOUR_DASHSCOPE_KEY",
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Refactor this Python coroutine to use asyncio.TaskGroup."}],
)
print(response.choices[0].message.content)출시 벤치마크가 말하는 것 — 그리고 별표가 의미하는 것
알리바바의 출시 수치(자체 보고, 출시 시 모델 카드 없음, 재현 가능한 평가 트레이스 없음):
| 벤치마크 | Qwen3.8-Max | GPT-5.6 Sol Max | Claude Fable 5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| OSWorld-Verified (에이전트형 OS 사용) | 86.1 | 83.2 | 85.0 | 76.2 |
| PaperBench (연구 종합) | 93.0 | — | — | — |
| Frontend Code Arena | 4위 | — | — | — |
이것들을 누구에게 인용하기 전에 기억할 구체적인 별표:
- 벤더 보고. 출시 시 모델 카드 없음, 평가 하니스 커밋 없음, 제3자 복제 없음 — 보통 며칠 안에 독립적 점수를 발표하는 Artificial Analysis도 포함해서.
- OSWorld-Verified는 상위권에서 작은 격차다. Qwen 86.1, Claude Fable 5 85.0, GPT-5.6 Sol Max 83.2는 1–3점 격차다. 많은 에이전트형 벤치마크의 노이즈 밴드 내에 있다. "한 벤치마크에서 프론티어를 1.1점 앞선다"는 "프론티어를 대체한다"가 아니다.
- PaperBench는 SWE-bench나 GPQA보다 덜 확립되었다. 93.0 헤드라인은 인상적이지만 확정적이 아니라 방향성으로 취급해야 한다.
- Frontend Code Arena는 Qwen3.8-Max를 4위로 두었다 — 여러 Anthropic 모델과 Fable 5 변형 뒤에. 다른 작업은 다른 훈련 신호에 보상을 준다; 한 벤치마크에서 1위이고 다른 벤치마크에서 4위인 것은 모순이 아니라 정상적인 결과다.
독립적 평가(Artificial Analysis, LMArena, 제3자 학술 실행)를 기다린 후 모델 선택 기본값을 다시 쓰는 것이 신중한 움직임이다.
알아둘 만한 가격 계산
API 가격표:
| 등급 | MTok당 가격 |
|---|---|
| 입력 | $2.00 |
| 출력 | $6.00 |
| 캐시된 입력 | $0.25 |
이는 현재 Anthropic Max 등급 입력 비용의 8배 저렴하고 GPT-5.6 Sol Max 출력 비용의 약 절반이다. $0.25/MTok의 캐시된 입력이 흥미로운 부분이다: 동일한 시스템 프롬프트를 사용하는 반복적인 에이전트형 도구 루프에서 캐시 적중률은 일반적으로 80% 이상으로 실행되므로, 작동 중인 에이전트의 실효 입력 비용은 $2.00이 아니라 $0.35–$0.60/MTok에 더 가깝다.
Kimi K3 경제학과 비교하면 — 캐시 적중 입력이 $0.30/MTok — Qwen3.8-Max는 같은 저-캐시-가격 대역에 있다. 이는 동일한 프롬프트 스캐폴딩이 매 도구 단계마다 다시 전송되는 비용에 민감한 장기 지평 에이전트형 워크로드에 두 모델 모두 실행 가능하게 만든다.
Qwen3.8-Max 시작하기 (오늘, API를 통해)
- Qwen API는 DashScope(중국 지역)와 Model Studio(국제)를 통해 제공된다. 워크스페이스에서 모델을 활성화하고 API 키를 생성하면 두 곳 모두 qwen3.8-max 모델 ID를 노출한다.
- OpenAI 규격: openai SDK와 함께 base URL https://dashscope-intl.aliyuncs.com/compatible-mode/v1. Anthropic 규격: Model Studio에서 문서화된 Qwen의 Anthropic 호환 엔드포인트 사용. 기존 코드베이스에 맞는 것을 선택하라 — 메시지 형태를 다시 쓸 필요는 없다.
- 기존 도구 스키마로 Qwen3.8-Max를 통해 짧은 에이전트형 작업을 실행하라. 현재 기본값과 비교하여 비용, 지연 시간, 도구 선택 품질을 비교하라. 벤더 벤치마크는 방향성이다; 자신의 워크로드가 실제 진실이다.
- Qwen3.8-Max 및 Qwen3.8-27B 저장소는 2026년 8월 10일 주에 예상되었다. 공개되는 날 라이선스를 읽어라 — 이전 Qwen에서의 강력한 Apache-2.0 패턴은 이 공개에 대한 약속이 아니다.
Qwen3.8-Max vs 경쟁하는 모델들
| Qwen3.8-Max | Kimi K3 | GLM-5.2 | Claude Fable 5 | GPT-5.6 Sol Max | |
|---|---|---|---|---|---|
| 총 파라미터 | 2.4T MoE | 2.8T MoE | 753B | 미공개 | 미공개 |
| 토큰당 활성 | ~95B | 16/896 전문가 | — | — | — |
| 컨텍스트 창 | 1M | 1M | — | 1M+ | 400K+ |
| 네이티브 비전 | 예 | 예 | 텍스트 전용 | 예 | 예 |
| 오픈 웨이트 | 발표됨 (8월 10일 주) | 2026년 7월 27일 출시 | 출시됨 | 아니오 | 아니오 |
| 입력 가격 / MTok | $2.00 ($0.25 캐시) | $3.00 ($0.30 캐시) | 무료 (자체 호스팅) | 벤더 등급 | 벤더 등급 |
| 출력 가격 / MTok | $6.00 | $15.00 | 무료 (자체 호스팅) | 벤더 등급 | 벤더 등급 |
| API 규격 | OpenAI + Anthropic | OpenAI 호환 | 다양 | Anthropic | OpenAI |
Qwen3.8-Max를 선택하라 다음의 경우: 나중에 자체 호스팅도 가능한 프론티어 등급 API를 원할 때, 예산이 Anthropic/OpenAI Max 등급보다 빠듯할 때, 또는 (Anthropic 규격 지원 덕분에) 최소한의 코드 변경으로 Claude에 대해 A/B 테스트를 원할 때.
Kimi K3를 선택하라 다음의 경우: 오늘 오픈 웨이트가 필요할 때(K3는 2026년 7월 27일 출시됨), 또는 이미 Moonshot 도구 위에 있을 때.
GLM-5.2를 선택하라 다음의 경우: 자체 호스팅이 지금 확고한 요구 사항이고 비전이 중요하지 않을 때.
Claude Fable 5 또는 GPT-5.6 Sol Max에 머물러라 다음의 경우: 가장 깊은 제3자 벤치마크 기록, 공식적인 엔터프라이즈 벤더 약속, 또는 그 모델들이 조정된 특정 도구 사용 / 안전 동작이 필요할 때.
관련: DeepSeek, Qwen 및 오픈 웨이트 물결에서 더 넓은 랜드스케이프 맥락을, 모델 선택하기에서 일반적인 프레임워크를 참조하라.
Qwen3.8-Max에 커밋하기 전 실용적 체크리스트
- 가중치가 실제로 공개되었는지 확인하라 Hugging Face나 ModelScope에서, "오픈 웨이트"를 컴플라이언스 문서에 쓰기 전에.
- 공개되는 날 라이선스를 읽어라. Apache-2.0은 Qwen 3.5와 3.6의 강력한 패턴이다; 3.8에 대한 보장은 아니다.
- 자신의 평가 실행을 해보라. 벤더 OSWorld-Verified 수치는 방향성이다; 그 벤치마크 상위의 1–3점 격차는 노이즈 밴드 내에 있다.
- 캐시를 신중하게 비용 모델링하라. $0.25/MTok 캐시된 입력 가격이 경제학이 흥미로워지는 지점이다; 캐시 적중이 없다면 $2/$6 헤드라인이 실효 가격이다.
- 자체 호스팅 발자국을 정직하게 계획하라. 4% 활성 파라미터 ≠ 4% GPU 메모리. 2.4T MoE에 대한 전체 가중치 상주는 노트북 프로젝트가 아니라 심각한 배포다.
- 어떤 규격에 대해 코딩할지 결정하라. OpenAI 규격과 Anthropic 규격 모두 일급이다 — 기존 코드 경로에 맞는 것을 선택하라, 세 번째 추상화를 발명하지 마라.
퀴즈
Check yourself
0/5출처 및 추가 자료
- Qwen3.8-Max: Features, Benchmarks, and Pricing — DataCamp — 출시 요약, 아키텍처, 가격 개요
- Qwen 3.8-Max: Release Date, Specs, and How to Access It (2026) — Yotta Labs — API 호환성과 등급별 가격 분석
- Qwen3.8 Open Weights: Check This Before Downloading — Digital Applied — 하드웨어 사이징 고려 사항 및 라이선스 리스크 분석
- Alibaba's New AI Was Called Open-Source. Its Model Page Is Empty. — Cherry Creek News — "발표 ≠ 출시" 현실 점검
- Hugging Face의 Qwen 팀 — 실제 가중치 공개와 라이선스를 여기서 확인하라
- 관련: DeepSeek, Qwen 및 오픈 웨이트 물결 — 오픈 웨이트 랜드스케이프와 3.8 이전 Qwen 계열의 오래가는 개요
- 관련: Kimi K3: 세계 최대의 오픈 웨이트 모델 — 현재 출시된 2.8T 오픈 웨이트 경쟁자
- 관련: GLM-5.2: 오픈 웨이트 프론티어 — 또 다른 오픈 웨이트 옵션, 텍스트 전용이지만 오늘 출시됨
- 관련: 모델 선택하기 — 오픈 웨이트 vs 폐쇄형 프론티어 트레이드오프의 결정 프레임워크
- 관련: 공급자별 AI 비용 — 프론티어의 가격 비교