Aller au contenu principal

Qwen3.8-Max : Le premier modèle open-weight de classe Max (quand les poids sortent)

Intermédiaire

Le 3 août 2026, l'équipe Qwen d'Alibaba a annoncé Qwen3.8-Max — un Mixture-of-Experts à 2,4 billions de paramètres avec 95B paramètres actifs, un contexte de 1M tokens, et des chiffres de benchmark qui le placent légèrement en avance sur GPT-5.6 Sol Max sur OSWorld-Verified. Alibaba a présenté le lancement comme le premier modèle Qwen de classe « Max » qui sera open-weight — un changement, parce que les Qwens de classe Max précédents étaient API-only. Les poids étaient promis pour la semaine du 10 août 2026 sur Hugging Face et ModelScope.

Il y a un piège qui vaut la peine d'être lu avant de réécrire quoi que ce soit qui en dépende : au lancement et pour les jours suivants, la page Hugging Face était vide. Cette page parcourt l'état réel de Qwen3.8-Max début août 2026 — l'architecture, la tarification, l'API à double spec qui en fait un remplacement direct pour les clients Claude ou OpenAI, le tableau de benchmark avec un astérisque « rapporté par le vendeur », et les questions durables à poser avant de vous engager avec du code.

What you'll learn
  • Comprendre ce qui a été livré le 3 août vs ce qui n'a été que promis — accès API vs poids open
  • Lire correctement les maths de sparsité du MoE 2,4T / 95B actif, surtout avant de chiffrer un déploiement self-hosté
  • Savoir que Qwen3.8-Max expose à la fois des APIs OpenAI-spec ET Anthropic-spec — une propriété rare qui change la portabilité
  • Interpréter les benchmarks de lancement (OSWorld 86,1, PaperBench 93,0) avec le bon scepticisme — rapporté par le vendeur, pas de model card, pas encore de runs tiers
  • Reconnaître le patron « open-weight promis ≠ open-weight livré » et quoi faire pendant que vous attendez

La version en une phrase

Qwen3.8-Max est un MoE sparse à 2,4 billions de paramètres (95B actifs par token) avec un contexte 1M tokens, entrée native texte + vision, doubles APIs OpenAI-spec et Anthropic-spec, tarifé à $2/$6 par million de tokens entrée/sortie — annoncé le 3 août 2026 comme API-only, avec les poids et un compagnon Qwen3.8-27B promis pour une sortie open la semaine du 10 août 2026.

Trois choses sur Qwen3.8-Max qui ne sont pas évidentes depuis les titres

1. « Open-weight » a été annoncé, pas encore livré

Les communications de lancement d'Alibaba et la plupart des couvertures ont décrit Qwen3.8-Max comme le premier Qwen open-weight de classe « Max ». C'est un vrai changement — Qwen3-Max, Qwen3.5-Max, Qwen3.6-Max, et Qwen3.7-Max étaient tous API-only. Mais au lancement, et pendant la première semaine, l'organisation Qwen sur Hugging Face n'avait pas de repo Qwen3.8-Max, pas de repo Qwen3.8-27B, et pas de licence déclarée. L'engagement était « poids la semaine du 10 août » ; vérifiez avant de bâtir un dossier de conformité autour.

La réaction communautaire dans la première heure du lancement portait presque entièrement sur les poids, pas les benchmarks. Les utilisateurs ont contesté le cadrage « open-source » d'Alibaba tant que les artefacts n'étaient pas publics. La distinction utile à intérioriser :

  • Un modèle « disponible » est un service que vous louez selon les termes du vendeur. Si l'API est dépréciée, votre dépendance casse.
  • Un modèle « open-weight » est un artefact que vous téléchargez et détenez. Vous pouvez l'auditer, le faire tourner dans un cluster air-gapped, le garder après que le vendeur pivote.

Ce sont des produits différents avec des profils de risque différents. Les sorties open-weight Qwen précédentes (Qwen 3.5, Qwen 3.6) sont sorties sous Apache-2.0, ce qui est un patron fort mais pas un engagement pour Qwen3.8. Lisez la licence le jour où elle atterrit ; ne présumez pas.

2. Le ratio de sparsité de 4 % ne signifie pas 4 % du hardware

Qwen3.8-Max est un Mixture-of-Experts. Sur les 2,4T paramètres totaux, seuls ~95B s'activent par token — environ 4 % de sparsité. C'est pourquoi le prix par token peut être compétitif et la latence raisonnable : vous payez pour ~95B de calcul de forward-pass, pas 2,4T.

Le piège est que la mémoire des poids ne fonctionne pas comme ça. Pour faire tourner le modèle, vous avez besoin d'avoir tous les 2,4T paramètres résidents quelque part de suffisamment rapide pour que le routeur tire les bons experts. En fp8, c'est environ 2,4 To de mémoire de poids. En fp16, ~4,8 To. Même avec une quantization MXFP4 agressive ou similaire 4-bit, vous êtes à ≥1,2 To juste pour les poids, avant de compter le cache KV pour un contexte 1M tokens. Cela signifie :

  • H100 unique (80 Go) — non viable pour le modèle complet, même en 4-bit.
  • Nœud 8×H100 (640 Go) — encore court en 4-bit pour le 2,4T complet ; possible avec un lourd offload CPU, à un grand coût de latence.
  • Inférence multi-nœud (16+ H100 ou comparable) — l'empreinte réaliste pour du service en temps réel.

Si quelqu'un vous cite « vous pouvez faire tourner ça sur une seule machine parce que ce n'est que 95B actifs » — il compte le mauvais nombre. Le modèle dense compagnon Qwen3.8-27B existe en partie pour cette raison : c'est celui que vous pourrez réellement faire tourner sur un nœud 8-GPU unique sans exploits.

3. À la fois une API compatible OpenAI et compatible Anthropic — depuis le même endpoint

L'API de Qwen3.8-Max supporte à la fois la forme OpenAI /v1/chat/completions et la forme Anthropic /v1/messages. La plupart des vendeurs livrent une seule ; quelques-uns livrent un shim OpenAI-compat ; Qwen livrant un support Anthropic-spec de première classe est vraiment inhabituel et vaut la peine d'être planifié.

Conséquence pratique : du code que vous avez écrit contre le SDK Python Anthropic pour Claude — y compris messages.create(), blocs d'outils, gestion de prompt système, et streaming — peut pointer sur Qwen3.8-Max avec juste un échange de base-URL et pas de réécritures de forme de message. Idem pour le code SDK OpenAI. Cela rend le test A/B contre Claude ou GPT beaucoup moins cher que le grind habituel « portez vos schémas d'outils ».

Qwen3.8-Max via API compatible Anthropic (Python)

from anthropic import Anthropic

client = Anthropic(
  api_key="YOUR_DASHSCOPE_KEY",
  base_url="https://dashscope.aliyuncs.com/api/v1",  # verify current base URL in Qwen docs
)

response = client.messages.create(
  model="qwen3.8-max",
  max_tokens=1024,
  messages=[{"role": "user", "content": "Plan a migration from Postgres 15 to 17 for a 4TB OLTP database."}],
)
print(response.content[0].text)

Qwen3.8-Max via API compatible OpenAI (Python)

import openai

client = openai.OpenAI(
  api_key="YOUR_DASHSCOPE_KEY",
  base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
  model="qwen3.8-max",
  messages=[{"role": "user", "content": "Refactor this Python coroutine to use asyncio.TaskGroup."}],
)
print(response.choices[0].message.content)

Ce que disent les benchmarks de lancement — et ce que signifient les astérisques

Les chiffres de lancement d'Alibaba (auto-rapportés, pas de model card, pas de traces d'éval reproductibles au lancement) :

BenchmarkQwen3.8-MaxGPT-5.6 Sol MaxClaude Fable 5Gemini 3.1 Pro
OSWorld-Verified (utilisation OS agentique)86,183,285,076,2
PaperBench (synthèse de recherche)93,0
Frontend Code Arena4e place

Les astérisques spécifiques à retenir avant de citer ceci à quiconque :

  • Rapporté par le vendeur. Pas de model card, pas de commit de harness d'éval, pas de réplication tierce au lancement — y compris d'Artificial Analysis, qui publie normalement des scores indépendants dans les jours qui suivent.
  • OSWorld-Verified est un petit delta en haut. Qwen 86,1, Claude Fable 5 85,0, GPT-5.6 Sol Max 83,2 est un écart de 1–3 points. Dans la bande de bruit de nombreux benchmarks agentiques. « Bat la frontière de 1,1 point sur un benchmark » n'est pas « déplace la frontière ».
  • PaperBench est moins établi que SWE-bench ou GPQA. Un titre à 93,0 est impressionnant mais vous devriez le traiter comme directionnel, pas définitif.
  • Frontend Code Arena a placé Qwen3.8-Max quatrième — derrière plusieurs modèles Anthropic et une variante Fable 5. Différentes tâches récompensent différents signaux d'entraînement ; un #1 sur un benchmark et un #4 sur un autre est un résultat normal, pas une contradiction.

Attendre les évals indépendantes (Artificial Analysis, LMArena, runs académiques tiers) avant de réécrire votre défaut de sélection de modèle est le mouvement sobre.

Maths de tarification qui valent la peine d'être connues

Le tableau de tarification API :

PalierPrix par MTok
Entrée$2,00
Sortie$6,00
Entrée cachée$0,25

C'est 8× moins cher en coût d'entrée que le palier Max Anthropic actuel et environ la moitié du coût de sortie de GPT-5.6 Sol Max. L'entrée cachée à $0,25/MTok est l'intéressante : sur des boucles d'outils agentiques répétées avec le même prompt système, les taux de succès de cache tournent typiquement au-dessus de 80 %, donc le coût d'entrée effectif pour un agent en fonctionnement est plutôt de $0,35–$0,60/MTok, pas $2,00.

Comparé à l'économie de Kimi K3 — où l'entrée cache-hit est $0,30/MTok — Qwen3.8-Max est dans la même bande basse de prix cache. Cela rend les deux viables pour des charges agentiques long-horizon sensibles au coût où le même échafaudage de prompt est renvoyé à chaque étape d'outil.

Se lancer avec Qwen3.8-Max (aujourd'hui, via API)

Guided walkthrough1 of 4
  1. L'API Qwen est servie via DashScope (région Chine) et Model Studio (international). Les deux exposent l'ID de modèle qwen3.8-max une fois que vous avez activé le modèle dans votre workspace et généré une clé API.

Qwen3.8-Max vs les modèles avec lesquels il concourt

Qwen3.8-MaxKimi K3GLM-5.2Claude Fable 5GPT-5.6 Sol Max
Params total2,4T MoE2,8T MoE753Bnon divulguénon divulgué
Actif par token~95B16/896 experts
Fenêtre de contexte1M1M1M+400K+
Vision nativeOuiOuiTexte seulementOuiOui
Poids openAnnoncés (semaine du 10 août)Livrés le 27 juillet 2026LivrésNonNon
Prix entrée / MTok$2,00 ($0,25 cachée)$3,00 ($0,30 cachée)Gratuit (self-host)Palier vendeurPalier vendeur
Prix sortie / MTok$6,00$15,00Gratuit (self-host)Palier vendeurPalier vendeur
Spec APIOpenAI + AnthropicOpenAI-compatVarieAnthropicOpenAI

Attrapez Qwen3.8-Max quand : vous voulez une API de palier frontière que vous pouvez aussi self-hoster plus tard, votre budget est plus serré que le palier Max Anthropic/OpenAI, ou vous voulez tester A/B contre Claude avec des changements de code minimaux (grâce au support Anthropic-spec).

Attrapez Kimi K3 quand : vous avez besoin de poids open aujourd'hui (K3 est sorti le 27 juillet 2026), ou vous êtes déjà sur les outils Moonshot.

Attrapez GLM-5.2 quand : le self-hosting est une exigence dure maintenant et la vision n'est pas critique.

Restez sur Claude Fable 5 ou GPT-5.6 Sol Max quand : vous avez besoin du dossier de benchmark tiers le plus profond, d'engagements vendeur entreprise formels, ou du comportement spécifique d'utilisation d'outils / sécurité pour lequel ces modèles sont ajustés.

Voir aussi : DeepSeek, Qwen & la vague open-weight pour le contexte plus large du paysage, et Choisir un modèle pour le cadre général.

Checklist pratique avant de vous engager avec Qwen3.8-Max

  1. Confirmez que les poids sont réellement publiés sur Hugging Face ou ModelScope avant d'écrire « open-weight » dans un document de conformité.
  2. Lisez la licence le jour où elle atterrit. Apache-2.0 est le patron fort de Qwen 3.5 et 3.6 ; pas une garantie pour 3.8.
  3. Faites votre propre run d'éval. Les chiffres OSWorld-Verified du vendeur sont directionnels ; l'écart de 1–3 points en haut de ce benchmark est dans la bande de bruit.
  4. Modélisez le cache soigneusement en coût. Le prix d'entrée cachée à $0,25/MTok est là où l'économie devient intéressante ; sans succès de cache le titre $2/$6 est le prix effectif.
  5. Planifiez honnêtement l'empreinte de self-hosting. 4 % paramètres actifs ≠ 4 % mémoire GPU. La résidence poids-complets pour un MoE 2,4T est un déploiement sérieux, pas un projet portable.
  6. Décidez contre quelle spec vous coderez. OpenAI-spec et Anthropic-spec sont toutes deux de première classe — choisissez celle qui correspond à votre chemin de code existant, n'inventez pas une troisième abstraction.

Quiz

Check yourself

0/5
  1. Qwen3.8-Max a été annoncé le 3 août 2026 comme « open-weight ». Qu'est-ce qui était réellement disponible au lancement ?
  2. Qwen3.8-Max est 2,4T paramètres total avec 95B actifs par token. Qu'est-ce que cela implique pour le hardware de self-hosting ?
  3. Qu'y a-t-il d'inhabituel dans l'API de Qwen3.8-Max comparée à la plupart des modèles concurrents ?
  4. Le lancement d'Alibaba a montré Qwen3.8-Max à 86,1 sur OSWorld-Verified vs GPT-5.6 Sol Max à 83,2. Quelle est la bonne façon de lire ça ?
  5. Qwen3.8-Max liste $2/$6 par million de tokens entrée/sortie, avec entrée cachée à $0,25/MTok. Pour une boucle agentique longue avec un grand prompt système stable, quel est le coût d'entrée effectif pratique ?
Appuyez sur Entrée ou Espace pour retourner la carte. Utilisez les flèches gauche et droite pour naviguer entre les cartes.Terme affiché.
1 / 8

Sources et lectures complémentaires