Qwen3.8-Max: il primo modello Max open-weight (quando i pesi arrivano davvero)
Il 3 agosto 2026 il team Qwen di Alibaba ha annunciato Qwen3.8-Max — un modello Mixture-of-Experts da 2,4 trilioni di parametri con 95B attivi, contesto da 1M token e benchmark che lo mettono leggermente davanti a GPT-5.6 Sol Max su OSWorld-Verified. Alibaba ha presentato il lancio come il primo Qwen di classe "Max" che sarà open-weight — un cambio di rotta, dato che i Max precedenti erano solo API. I pesi erano promessi per la settimana del 10 agosto 2026 su Hugging Face e ModelScope.
C'è un dettaglio che vale la pena leggere prima di riscrivere qualcosa che ne dipenda: al lancio e nei giorni successivi, la pagina Hugging Face era vuota. Questa pagina ricostruisce lo stato reale di Qwen3.8-Max a inizio agosto 2026 — architettura, prezzi, API dual-spec che lo rendono drop-in per client Claude o OpenAI, tabella benchmark con l'asterisco "dato dal vendor" e le domande durature da porsi prima di scriverci sopra del codice.
- Capire cosa è stato consegnato il 3 agosto vs cosa era solo promesso — accesso API vs pesi open
- Leggere correttamente la matematica di sparsità 2.4T / 95B attivi, soprattutto prima di stimare un deployment self-hosted
- Sapere che Qwen3.8-Max espone sia API in specifica OpenAI SIA in specifica Anthropic — una proprietà rara che cambia la portabilità
- Interpretare i benchmark di lancio (OSWorld 86.1, PaperBench 93.0) con lo scetticismo giusto — dati dal vendor, senza model card, senza run di terze parti
- Riconoscere il pattern 'open-weight promesso ≠ open-weight consegnato' e cosa fare mentre si aspetta
La versione in una frase
Qwen3.8-Max è un MoE sparso da 2,4 trilioni di parametri (95B attivi per token) con contesto da 1M token, input nativo testo + visione, doppia API in specifica OpenAI e Anthropic, prezzo di $2/$6 per milione di token input/output — annunciato il 3 agosto 2026 come API-only, con pesi e un modello compagno Qwen3.8-27B promessi per il rilascio open nella settimana del 10 agosto 2026.
Tre cose su Qwen3.8-Max che non sono ovvie dai titoli
1. "Open-weight" è stato annunciato, non ancora consegnato
Le comunicazioni di lancio di Alibaba e la maggior parte della copertura hanno descritto Qwen3.8-Max come il primo Qwen "Max" open-weight. È un cambiamento reale — Qwen3-Max, Qwen3.5-Max, Qwen3.6-Max e Qwen3.7-Max erano tutti API-only. Ma al lancio, e per tutta la prima settimana, l'organizzazione Qwen su Hugging Face non aveva alcun repository Qwen3.8-Max, nessun repository Qwen3.8-27B e nessuna licenza dichiarata. L'impegno era "pesi la settimana del 10 agosto"; verifica prima di costruirci sopra un caso di compliance.
La reazione della community nella prima ora dopo il lancio ha riguardato quasi solo i pesi, non i benchmark. Gli utenti hanno contestato il framing "open-source" di Alibaba mentre gli artefatti non erano pubblici. La distinzione utile da interiorizzare:
- Un modello "disponibile" è un servizio che affitti alle condizioni del vendor. Se l'API viene deprecata, la tua dipendenza si rompe.
- Un modello "open-weight" è un artefatto che scarichi e tieni. Puoi auditarlo, farlo girare in un cluster air-gapped, tenerlo dopo che il vendor cambia rotta.
Sono due prodotti diversi con profili di rischio diversi. I precedenti rilasci open-weight di Qwen (Qwen 3.5, Qwen 3.6) sono usciti sotto Apache-2.0, che è un pattern forte ma non un impegno per Qwen3.8. Leggi la licenza il giorno in cui arriva; non darla per scontata.
2. Il rapporto di sparsità del 4% non significa il 4% dell'hardware
Qwen3.8-Max è un Mixture-of-Experts. Dei 2,4T parametri totali, solo ~95B si attivano per token — circa il 4% di sparsità. Ecco perché il prezzo per token può essere competitivo e la latenza ragionevole: paghi ~95B di forward-pass compute, non 2,4T.
Il trucco è che la memoria dei pesi non funziona così. Per far girare il modello devi avere tutti i 2,4T parametri residenti da qualche parte abbastanza veloce perché il router tiri fuori gli esperti giusti. In fp8 sono circa 2,4 TB di memoria pesi. In fp16, ~4,8 TB. Anche con quantizzazione aggressiva MXFP4 o simile a 4 bit, parli di ≥1,2 TB solo per i pesi, prima di contare la KV cache per un contesto da 1M token. Questo significa:
- Singola H100 (80 GB) — non praticabile per il modello intero, nemmeno a 4 bit.
- Nodo 8×H100 (640 GB) — ancora insufficiente a 4 bit per l'intero 2,4T; possibile con pesante offload su CPU, a grosso costo di latenza.
- Inferenza multi-nodo (16+ H100 o equivalente) — l'ingombro realistico per servire in real-time.
Se qualcuno ti dice "puoi farlo girare su una singola macchina perché sono solo 95B attivi" — sta contando il numero sbagliato. Il modello dense compagno Qwen3.8-27B esiste in parte per questo motivo: è quello che potrai davvero far girare su un singolo nodo a 8 GPU senza acrobazie.
3. Un'API compatibile OpenAI E una compatibile Anthropic — dallo stesso endpoint
L'API di Qwen3.8-Max supporta sia la forma OpenAI /v1/chat/completions sia la forma Anthropic /v1/messages. La maggior parte dei vendor ne spedisce una; qualcuno spedisce uno shim OpenAI-compat; Qwen che spedisce supporto Anthropic-spec di prima classe è genuinamente inusuale e va tenuto presente.
Conseguenza pratica: il codice che hai scritto contro l'SDK Python Anthropic per Claude — inclusi messages.create(), blocchi tool, gestione system prompt e streaming — può puntare a Qwen3.8-Max con solo uno swap di base-URL e nessuna riscrittura di message-shape. Stessa cosa per il codice con l'SDK OpenAI. Questo rende l'A/B testing contro Claude o GPT molto più economico della solita fatica "porta i tuoi tool schema".
Qwen3.8-Max via API compatibile Anthropic (Python)
from anthropic import Anthropic
client = Anthropic(
api_key="YOUR_DASHSCOPE_KEY",
base_url="https://dashscope.aliyuncs.com/api/v1", # verify current base URL in Qwen docs
)
response = client.messages.create(
model="qwen3.8-max",
max_tokens=1024,
messages=[{"role": "user", "content": "Plan a migration from Postgres 15 to 17 for a 4TB OLTP database."}],
)
print(response.content[0].text)Qwen3.8-Max via API compatibile OpenAI (Python)
import openai
client = openai.OpenAI(
api_key="YOUR_DASHSCOPE_KEY",
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Refactor this Python coroutine to use asyncio.TaskGroup."}],
)
print(response.choices[0].message.content)Cosa dicono i benchmark di lancio — e cosa significano gli asterischi
I numeri di lancio di Alibaba (auto-riportati, senza model card, senza tracce di eval riproducibili al lancio):
| Benchmark | Qwen3.8-Max | GPT-5.6 Sol Max | Claude Fable 5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| OSWorld-Verified (uso agentico dell'OS) | 86.1 | 83.2 | 85.0 | 76.2 |
| PaperBench (sintesi ricerca) | 93.0 | — | — | — |
| Frontend Code Arena | 4° posto | — | — | — |
Gli asterischi specifici da ricordare prima di citarli a chiunque:
- Dati dal vendor. Nessuna model card, nessun commit dell'eval harness, nessuna replica di terze parti al lancio — inclusa Artificial Analysis, che di solito pubblica punteggi indipendenti nel giro di giorni.
- OSWorld-Verified è un delta piccolo in cima. Qwen 86.1, Claude Fable 5 85.0, GPT-5.6 Sol Max 83.2 è uno spread di 1–3 punti. Dentro la banda di rumore di molti benchmark agentici. "Batte la frontiera di 1.1 punti su un benchmark" non è "sposta la frontiera".
- PaperBench è meno consolidato di SWE-bench o GPQA. Un titolo 93.0 è impressionante ma trattalo come direzionale, non definitivo.
- Frontend Code Arena ha messo Qwen3.8-Max quarto — dietro a diversi modelli Anthropic e una variante di Fable 5. Task diversi premiano segnali di training diversi; un #1 su un benchmark e un #4 su un altro è un esito normale, non una contraddizione.
Aspettare eval indipendenti (Artificial Analysis, LMArena, run accademici di terze parti) prima di riscrivere il tuo default di scelta modello è la mossa sobria.
Matematica sui prezzi che vale la pena conoscere
La tabella prezzi API:
| Tier | Prezzo per MTok |
|---|---|
| Input | $2.00 |
| Output | $6.00 |
| Input cached | $0.25 |
È 8× più economico sull'input rispetto all'attuale tier Anthropic Max e circa la metà dell'output di GPT-5.6 Sol Max. L'input cached a $0.25/MTok è quello interessante: su loop agentici ripetuti con lo stesso system prompt, i cache hit rate tipicamente stanno sopra l'80%, quindi il costo input effettivo per un agente reale è più vicino a $0.35–$0.60/MTok che a $2.00.
Rispetto all'economia di Kimi K3 — dove l'input cache-hit è $0.30/MTok — Qwen3.8-Max sta nella stessa fascia di prezzo cache-basso. Questo li rende entrambi praticabili per workload agentici long-horizon cost-sensitive dove lo stesso scaffolding di prompt viene rispedito a ogni step tool.
Come iniziare con Qwen3.8-Max (oggi, via API)
- L'API Qwen è servita tramite DashScope (regione Cina) e Model Studio (internazionale). Entrambi espongono il model ID qwen3.8-max una volta abilitato il modello nel tuo workspace e generata una API key.
- OpenAI-spec: base URL https://dashscope-intl.aliyuncs.com/compatible-mode/v1 con l'SDK openai. Anthropic-spec: usa l'endpoint Anthropic-compatibile di Qwen documentato in Model Studio. Scegli quello che combacia con il tuo codice esistente — non devi riscrivere le message shape.
- Fai girare un task agentico breve attraverso Qwen3.8-Max con i tuoi schemi tool esistenti. Confronta costo, latenza e qualità della selezione tool contro il tuo default attuale. I benchmark vendor sono direzionali; il tuo workload è la verità sul campo.
- I repository Qwen3.8-Max e Qwen3.8-27B erano attesi per la settimana del 10 agosto 2026. Leggi la licenza il giorno in cui arriva — un pattern forte Apache-2.0 dai Qwen precedenti non è un impegno per questo rilascio.
Qwen3.8-Max vs i modelli con cui compete
| Qwen3.8-Max | Kimi K3 | GLM-5.2 | Claude Fable 5 | GPT-5.6 Sol Max | |
|---|---|---|---|---|---|
| Parametri totali | 2.4T MoE | 2.8T MoE | 753B | non dichiarati | non dichiarati |
| Attivi per token | ~95B | 16/896 esperti | — | — | — |
| Finestra di contesto | 1M | 1M | — | 1M+ | 400K+ |
| Vision nativa | Sì | Sì | Solo testo | Sì | Sì |
| Pesi open | Annunciati (settimana del 10 ago) | Consegnati 27 luglio 2026 | Consegnati | No | No |
| Prezzo input / MTok | $2.00 ($0.25 cached) | $3.00 ($0.30 cached) | Gratis (self-host) | Tier vendor | Tier vendor |
| Prezzo output / MTok | $6.00 | $15.00 | Gratis (self-host) | Tier vendor | Tier vendor |
| Spec API | OpenAI + Anthropic | OpenAI-compat | Varia | Anthropic | OpenAI |
Vai su Qwen3.8-Max quando: vuoi un'API di frontiera che potrai anche self-hostare in seguito, il tuo budget è più stretto del tier Max di Anthropic/OpenAI, o vuoi fare A/B test contro Claude con modifiche minime al codice (grazie al supporto Anthropic-spec).
Vai su Kimi K3 quando: ti servono pesi open oggi (K3 è uscito il 27 luglio 2026), o sei già sul tooling Moonshot.
Vai su GLM-5.2 quando: il self-hosting è un requisito duro adesso e la vision non è critica.
Rimani su Claude Fable 5 o GPT-5.6 Sol Max quando: ti serve il record di benchmark di terze parti più profondo, impegni enterprise formali del vendor, o lo specifico comportamento di tool-use / safety per cui quei modelli sono tunati.
Vedi anche: DeepSeek, Qwen e l'onda open-weight per il contesto più ampio del panorama, e Scegliere un modello per il framework generale.
Checklist pratica prima di impegnarti su Qwen3.8-Max
- Conferma che i pesi siano davvero pubblicati su Hugging Face o ModelScope prima di scrivere "open-weight" in un documento di compliance.
- Leggi la licenza il giorno in cui arriva. Apache-2.0 è il pattern forte da Qwen 3.5 e 3.6; non una garanzia per 3.8.
- Fai il tuo run di eval. I numeri OSWorld-Verified del vendor sono direzionali; lo spread di 1–3 punti in cima a quel benchmark è dentro la banda di rumore.
- Modella il costo della cache con cura. Il prezzo $0.25/MTok di input cached è dove l'economia diventa interessante; senza cache hit il titolo $2/$6 è il prezzo effettivo.
- Pianifica l'ingombro di self-hosting onestamente. 4% di parametri attivi ≠ 4% di memoria GPU. La residenza dei pesi interi per un MoE da 2,4T è un deployment serio, non un progetto da laptop.
- Decidi contro quale spec scriverai codice. OpenAI-spec e Anthropic-spec sono entrambe di prima classe — scegli quella che combacia con il tuo code path esistente, non inventare una terza astrazione.
Quiz
Check yourself
0/5Fonti e ulteriori letture
- Qwen3.8-Max: Features, Benchmarks, and Pricing — DataCamp — riassunto di lancio, architettura e panoramica pricing
- Qwen 3.8-Max: Release Date, Specs, and How to Access It (2026) — Yotta Labs — compatibilità API e breakdown per tier di prezzo
- Qwen3.8 Open Weights: Check This Before Downloading — Digital Applied — considerazioni di sizing hardware e analisi rischi licenza
- Alibaba's New AI Was Called Open-Source. Its Model Page Is Empty. — Cherry Creek News — reality check "annunciato ≠ consegnato"
- Team Qwen su Hugging Face — controlla qui per la pubblicazione effettiva dei pesi e la licenza
- Correlato: DeepSeek, Qwen e l'onda open-weight — panoramica durevole del panorama open-weight e della famiglia Qwen prima della 3.8
- Correlato: Kimi K3: il modello open-weight più grande al mondo — il concorrente open-weight da 2.8T attualmente in produzione
- Correlato: GLM-5.2: frontiera open-weight — altra opzione open-weight, solo testo ma in produzione oggi
- Correlato: Scegliere un modello — framework decisionale per il trade-off open-weight vs frontiera chiusa
- Correlato: Quanto costa l'AI tra i vari provider — confronto pricing alla frontiera