Qwen3.8-Max : Le premier modèle open-weight de classe Max (quand les poids sortent)
Le 3 août 2026, l'équipe Qwen d'Alibaba a annoncé Qwen3.8-Max — un Mixture-of-Experts à 2,4 billions de paramètres avec 95B paramètres actifs, un contexte de 1M tokens, et des chiffres de benchmark qui le placent légèrement en avance sur GPT-5.6 Sol Max sur OSWorld-Verified. Alibaba a présenté le lancement comme le premier modèle Qwen de classe « Max » qui sera open-weight — un changement, parce que les Qwens de classe Max précédents étaient API-only. Les poids étaient promis pour la semaine du 10 août 2026 sur Hugging Face et ModelScope.
Il y a un piège qui vaut la peine d'être lu avant de réécrire quoi que ce soit qui en dépende : au lancement et pour les jours suivants, la page Hugging Face était vide. Cette page parcourt l'état réel de Qwen3.8-Max début août 2026 — l'architecture, la tarification, l'API à double spec qui en fait un remplacement direct pour les clients Claude ou OpenAI, le tableau de benchmark avec un astérisque « rapporté par le vendeur », et les questions durables à poser avant de vous engager avec du code.
- Comprendre ce qui a été livré le 3 août vs ce qui n'a été que promis — accès API vs poids open
- Lire correctement les maths de sparsité du MoE 2,4T / 95B actif, surtout avant de chiffrer un déploiement self-hosté
- Savoir que Qwen3.8-Max expose à la fois des APIs OpenAI-spec ET Anthropic-spec — une propriété rare qui change la portabilité
- Interpréter les benchmarks de lancement (OSWorld 86,1, PaperBench 93,0) avec le bon scepticisme — rapporté par le vendeur, pas de model card, pas encore de runs tiers
- Reconnaître le patron « open-weight promis ≠ open-weight livré » et quoi faire pendant que vous attendez
La version en une phrase
Qwen3.8-Max est un MoE sparse à 2,4 billions de paramètres (95B actifs par token) avec un contexte 1M tokens, entrée native texte + vision, doubles APIs OpenAI-spec et Anthropic-spec, tarifé à $2/$6 par million de tokens entrée/sortie — annoncé le 3 août 2026 comme API-only, avec les poids et un compagnon Qwen3.8-27B promis pour une sortie open la semaine du 10 août 2026.
Trois choses sur Qwen3.8-Max qui ne sont pas évidentes depuis les titres
1. « Open-weight » a été annoncé, pas encore livré
Les communications de lancement d'Alibaba et la plupart des couvertures ont décrit Qwen3.8-Max comme le premier Qwen open-weight de classe « Max ». C'est un vrai changement — Qwen3-Max, Qwen3.5-Max, Qwen3.6-Max, et Qwen3.7-Max étaient tous API-only. Mais au lancement, et pendant la première semaine, l'organisation Qwen sur Hugging Face n'avait pas de repo Qwen3.8-Max, pas de repo Qwen3.8-27B, et pas de licence déclarée. L'engagement était « poids la semaine du 10 août » ; vérifiez avant de bâtir un dossier de conformité autour.
La réaction communautaire dans la première heure du lancement portait presque entièrement sur les poids, pas les benchmarks. Les utilisateurs ont contesté le cadrage « open-source » d'Alibaba tant que les artefacts n'étaient pas publics. La distinction utile à intérioriser :
- Un modèle « disponible » est un service que vous louez selon les termes du vendeur. Si l'API est dépréciée, votre dépendance casse.
- Un modèle « open-weight » est un artefact que vous téléchargez et détenez. Vous pouvez l'auditer, le faire tourner dans un cluster air-gapped, le garder après que le vendeur pivote.
Ce sont des produits différents avec des profils de risque différents. Les sorties open-weight Qwen précédentes (Qwen 3.5, Qwen 3.6) sont sorties sous Apache-2.0, ce qui est un patron fort mais pas un engagement pour Qwen3.8. Lisez la licence le jour où elle atterrit ; ne présumez pas.
2. Le ratio de sparsité de 4 % ne signifie pas 4 % du hardware
Qwen3.8-Max est un Mixture-of-Experts. Sur les 2,4T paramètres totaux, seuls ~95B s'activent par token — environ 4 % de sparsité. C'est pourquoi le prix par token peut être compétitif et la latence raisonnable : vous payez pour ~95B de calcul de forward-pass, pas 2,4T.
Le piège est que la mémoire des poids ne fonctionne pas comme ça. Pour faire tourner le modèle, vous avez besoin d'avoir tous les 2,4T paramètres résidents quelque part de suffisamment rapide pour que le routeur tire les bons experts. En fp8, c'est environ 2,4 To de mémoire de poids. En fp16, ~4,8 To. Même avec une quantization MXFP4 agressive ou similaire 4-bit, vous êtes à ≥1,2 To juste pour les poids, avant de compter le cache KV pour un contexte 1M tokens. Cela signifie :
- H100 unique (80 Go) — non viable pour le modèle complet, même en 4-bit.
- Nœud 8×H100 (640 Go) — encore court en 4-bit pour le 2,4T complet ; possible avec un lourd offload CPU, à un grand coût de latence.
- Inférence multi-nœud (16+ H100 ou comparable) — l'empreinte réaliste pour du service en temps réel.
Si quelqu'un vous cite « vous pouvez faire tourner ça sur une seule machine parce que ce n'est que 95B actifs » — il compte le mauvais nombre. Le modèle dense compagnon Qwen3.8-27B existe en partie pour cette raison : c'est celui que vous pourrez réellement faire tourner sur un nœud 8-GPU unique sans exploits.
3. À la fois une API compatible OpenAI et compatible Anthropic — depuis le même endpoint
L'API de Qwen3.8-Max supporte à la fois la forme OpenAI /v1/chat/completions et la forme Anthropic /v1/messages. La plupart des vendeurs livrent une seule ; quelques-uns livrent un shim OpenAI-compat ; Qwen livrant un support Anthropic-spec de première classe est vraiment inhabituel et vaut la peine d'être planifié.
Conséquence pratique : du code que vous avez écrit contre le SDK Python Anthropic pour Claude — y compris messages.create(), blocs d'outils, gestion de prompt système, et streaming — peut pointer sur Qwen3.8-Max avec juste un échange de base-URL et pas de réécritures de forme de message. Idem pour le code SDK OpenAI. Cela rend le test A/B contre Claude ou GPT beaucoup moins cher que le grind habituel « portez vos schémas d'outils ».
Qwen3.8-Max via API compatible Anthropic (Python)
from anthropic import Anthropic
client = Anthropic(
api_key="YOUR_DASHSCOPE_KEY",
base_url="https://dashscope.aliyuncs.com/api/v1", # verify current base URL in Qwen docs
)
response = client.messages.create(
model="qwen3.8-max",
max_tokens=1024,
messages=[{"role": "user", "content": "Plan a migration from Postgres 15 to 17 for a 4TB OLTP database."}],
)
print(response.content[0].text)Qwen3.8-Max via API compatible OpenAI (Python)
import openai
client = openai.OpenAI(
api_key="YOUR_DASHSCOPE_KEY",
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Refactor this Python coroutine to use asyncio.TaskGroup."}],
)
print(response.choices[0].message.content)Ce que disent les benchmarks de lancement — et ce que signifient les astérisques
Les chiffres de lancement d'Alibaba (auto-rapportés, pas de model card, pas de traces d'éval reproductibles au lancement) :
| Benchmark | Qwen3.8-Max | GPT-5.6 Sol Max | Claude Fable 5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| OSWorld-Verified (utilisation OS agentique) | 86,1 | 83,2 | 85,0 | 76,2 |
| PaperBench (synthèse de recherche) | 93,0 | — | — | — |
| Frontend Code Arena | 4e place | — | — | — |
Les astérisques spécifiques à retenir avant de citer ceci à quiconque :
- Rapporté par le vendeur. Pas de model card, pas de commit de harness d'éval, pas de réplication tierce au lancement — y compris d'Artificial Analysis, qui publie normalement des scores indépendants dans les jours qui suivent.
- OSWorld-Verified est un petit delta en haut. Qwen 86,1, Claude Fable 5 85,0, GPT-5.6 Sol Max 83,2 est un écart de 1–3 points. Dans la bande de bruit de nombreux benchmarks agentiques. « Bat la frontière de 1,1 point sur un benchmark » n'est pas « déplace la frontière ».
- PaperBench est moins établi que SWE-bench ou GPQA. Un titre à 93,0 est impressionnant mais vous devriez le traiter comme directionnel, pas définitif.
- Frontend Code Arena a placé Qwen3.8-Max quatrième — derrière plusieurs modèles Anthropic et une variante Fable 5. Différentes tâches récompensent différents signaux d'entraînement ; un #1 sur un benchmark et un #4 sur un autre est un résultat normal, pas une contradiction.
Attendre les évals indépendantes (Artificial Analysis, LMArena, runs académiques tiers) avant de réécrire votre défaut de sélection de modèle est le mouvement sobre.
Maths de tarification qui valent la peine d'être connues
Le tableau de tarification API :
| Palier | Prix par MTok |
|---|---|
| Entrée | $2,00 |
| Sortie | $6,00 |
| Entrée cachée | $0,25 |
C'est 8× moins cher en coût d'entrée que le palier Max Anthropic actuel et environ la moitié du coût de sortie de GPT-5.6 Sol Max. L'entrée cachée à $0,25/MTok est l'intéressante : sur des boucles d'outils agentiques répétées avec le même prompt système, les taux de succès de cache tournent typiquement au-dessus de 80 %, donc le coût d'entrée effectif pour un agent en fonctionnement est plutôt de $0,35–$0,60/MTok, pas $2,00.
Comparé à l'économie de Kimi K3 — où l'entrée cache-hit est $0,30/MTok — Qwen3.8-Max est dans la même bande basse de prix cache. Cela rend les deux viables pour des charges agentiques long-horizon sensibles au coût où le même échafaudage de prompt est renvoyé à chaque étape d'outil.
Se lancer avec Qwen3.8-Max (aujourd'hui, via API)
- L'API Qwen est servie via DashScope (région Chine) et Model Studio (international). Les deux exposent l'ID de modèle qwen3.8-max une fois que vous avez activé le modèle dans votre workspace et généré une clé API.
- OpenAI-spec : base URL https://dashscope-intl.aliyuncs.com/compatible-mode/v1 avec le SDK openai. Anthropic-spec : utilisez l'endpoint compatible Anthropic de Qwen documenté dans Model Studio. Choisissez celui qui correspond à votre base de code existante — vous n'avez pas à réécrire les formes de message.
- Faites tourner une courte tâche agentique par Qwen3.8-Max avec vos schémas d'outils existants. Comparez coût, latence, et qualité de sélection d'outils contre votre défaut actuel. Les benchmarks du vendeur sont directionnels ; votre propre charge est la vérité terrain.
- Les repos Qwen3.8-Max et Qwen3.8-27B étaient attendus la semaine du 10 août 2026. Lisez la licence le jour où elle atterrit — un patron Apache-2.0 fort des Qwens précédents n'est pas un engagement pour cette sortie.
Qwen3.8-Max vs les modèles avec lesquels il concourt
| Qwen3.8-Max | Kimi K3 | GLM-5.2 | Claude Fable 5 | GPT-5.6 Sol Max | |
|---|---|---|---|---|---|
| Params total | 2,4T MoE | 2,8T MoE | 753B | non divulgué | non divulgué |
| Actif par token | ~95B | 16/896 experts | — | — | — |
| Fenêtre de contexte | 1M | 1M | — | 1M+ | 400K+ |
| Vision native | Oui | Oui | Texte seulement | Oui | Oui |
| Poids open | Annoncés (semaine du 10 août) | Livrés le 27 juillet 2026 | Livrés | Non | Non |
| Prix entrée / MTok | $2,00 ($0,25 cachée) | $3,00 ($0,30 cachée) | Gratuit (self-host) | Palier vendeur | Palier vendeur |
| Prix sortie / MTok | $6,00 | $15,00 | Gratuit (self-host) | Palier vendeur | Palier vendeur |
| Spec API | OpenAI + Anthropic | OpenAI-compat | Varie | Anthropic | OpenAI |
Attrapez Qwen3.8-Max quand : vous voulez une API de palier frontière que vous pouvez aussi self-hoster plus tard, votre budget est plus serré que le palier Max Anthropic/OpenAI, ou vous voulez tester A/B contre Claude avec des changements de code minimaux (grâce au support Anthropic-spec).
Attrapez Kimi K3 quand : vous avez besoin de poids open aujourd'hui (K3 est sorti le 27 juillet 2026), ou vous êtes déjà sur les outils Moonshot.
Attrapez GLM-5.2 quand : le self-hosting est une exigence dure maintenant et la vision n'est pas critique.
Restez sur Claude Fable 5 ou GPT-5.6 Sol Max quand : vous avez besoin du dossier de benchmark tiers le plus profond, d'engagements vendeur entreprise formels, ou du comportement spécifique d'utilisation d'outils / sécurité pour lequel ces modèles sont ajustés.
Voir aussi : DeepSeek, Qwen & la vague open-weight pour le contexte plus large du paysage, et Choisir un modèle pour le cadre général.
Checklist pratique avant de vous engager avec Qwen3.8-Max
- Confirmez que les poids sont réellement publiés sur Hugging Face ou ModelScope avant d'écrire « open-weight » dans un document de conformité.
- Lisez la licence le jour où elle atterrit. Apache-2.0 est le patron fort de Qwen 3.5 et 3.6 ; pas une garantie pour 3.8.
- Faites votre propre run d'éval. Les chiffres OSWorld-Verified du vendeur sont directionnels ; l'écart de 1–3 points en haut de ce benchmark est dans la bande de bruit.
- Modélisez le cache soigneusement en coût. Le prix d'entrée cachée à $0,25/MTok est là où l'économie devient intéressante ; sans succès de cache le titre $2/$6 est le prix effectif.
- Planifiez honnêtement l'empreinte de self-hosting. 4 % paramètres actifs ≠ 4 % mémoire GPU. La résidence poids-complets pour un MoE 2,4T est un déploiement sérieux, pas un projet portable.
- Décidez contre quelle spec vous coderez. OpenAI-spec et Anthropic-spec sont toutes deux de première classe — choisissez celle qui correspond à votre chemin de code existant, n'inventez pas une troisième abstraction.
Quiz
Check yourself
0/5Sources et lectures complémentaires
- Qwen3.8-Max: Features, Benchmarks, and Pricing — DataCamp — résumé de lancement, architecture, et aperçu de tarification
- Qwen 3.8-Max: Release Date, Specs, and How to Access It (2026) — Yotta Labs — compatibilité API et décomposition de prix par palier
- Qwen3.8 Open Weights: Check This Before Downloading — Digital Applied — considérations de dimensionnement hardware et analyse de risque de licence
- Alibaba's New AI Was Called Open-Source. Its Model Page Is Empty. — Cherry Creek News — le rappel à la réalité « annoncé ≠ livré »
- Équipe Qwen sur Hugging Face — vérifiez ici pour la publication réelle des poids et la licence
- Lié : DeepSeek, Qwen & la vague open-weight — aperçu durable du paysage open-weight et de la famille Qwen avant 3.8
- Lié : Kimi K3 : Le plus grand modèle open-weight du monde — le concurrent open-weight 2,8T actuellement livré
- Lié : GLM-5.2 : Frontière open-weight — une autre option open-weight, texte seulement mais livrée aujourd'hui
- Lié : Choisir un modèle — cadre de décision pour les compromis open-weight vs frontière fermée
- Lié : Ce que coûte l'IA à travers les fournisseurs — comparaison de tarification à la frontière