Passa al contenuto principale

Qwen3.8-Max: il primo modello Max open-weight (quando i pesi arrivano davvero)

Intermedio

Il 3 agosto 2026 il team Qwen di Alibaba ha annunciato Qwen3.8-Max — un modello Mixture-of-Experts da 2,4 trilioni di parametri con 95B attivi, contesto da 1M token e benchmark che lo mettono leggermente davanti a GPT-5.6 Sol Max su OSWorld-Verified. Alibaba ha presentato il lancio come il primo Qwen di classe "Max" che sarà open-weight — un cambio di rotta, dato che i Max precedenti erano solo API. I pesi erano promessi per la settimana del 10 agosto 2026 su Hugging Face e ModelScope.

C'è un dettaglio che vale la pena leggere prima di riscrivere qualcosa che ne dipenda: al lancio e nei giorni successivi, la pagina Hugging Face era vuota. Questa pagina ricostruisce lo stato reale di Qwen3.8-Max a inizio agosto 2026 — architettura, prezzi, API dual-spec che lo rendono drop-in per client Claude o OpenAI, tabella benchmark con l'asterisco "dato dal vendor" e le domande durature da porsi prima di scriverci sopra del codice.

What you'll learn
  • Capire cosa è stato consegnato il 3 agosto vs cosa era solo promesso — accesso API vs pesi open
  • Leggere correttamente la matematica di sparsità 2.4T / 95B attivi, soprattutto prima di stimare un deployment self-hosted
  • Sapere che Qwen3.8-Max espone sia API in specifica OpenAI SIA in specifica Anthropic — una proprietà rara che cambia la portabilità
  • Interpretare i benchmark di lancio (OSWorld 86.1, PaperBench 93.0) con lo scetticismo giusto — dati dal vendor, senza model card, senza run di terze parti
  • Riconoscere il pattern 'open-weight promesso ≠ open-weight consegnato' e cosa fare mentre si aspetta

La versione in una frase

Qwen3.8-Max è un MoE sparso da 2,4 trilioni di parametri (95B attivi per token) con contesto da 1M token, input nativo testo + visione, doppia API in specifica OpenAI e Anthropic, prezzo di $2/$6 per milione di token input/output — annunciato il 3 agosto 2026 come API-only, con pesi e un modello compagno Qwen3.8-27B promessi per il rilascio open nella settimana del 10 agosto 2026.

Tre cose su Qwen3.8-Max che non sono ovvie dai titoli

1. "Open-weight" è stato annunciato, non ancora consegnato

Le comunicazioni di lancio di Alibaba e la maggior parte della copertura hanno descritto Qwen3.8-Max come il primo Qwen "Max" open-weight. È un cambiamento reale — Qwen3-Max, Qwen3.5-Max, Qwen3.6-Max e Qwen3.7-Max erano tutti API-only. Ma al lancio, e per tutta la prima settimana, l'organizzazione Qwen su Hugging Face non aveva alcun repository Qwen3.8-Max, nessun repository Qwen3.8-27B e nessuna licenza dichiarata. L'impegno era "pesi la settimana del 10 agosto"; verifica prima di costruirci sopra un caso di compliance.

La reazione della community nella prima ora dopo il lancio ha riguardato quasi solo i pesi, non i benchmark. Gli utenti hanno contestato il framing "open-source" di Alibaba mentre gli artefatti non erano pubblici. La distinzione utile da interiorizzare:

  • Un modello "disponibile" è un servizio che affitti alle condizioni del vendor. Se l'API viene deprecata, la tua dipendenza si rompe.
  • Un modello "open-weight" è un artefatto che scarichi e tieni. Puoi auditarlo, farlo girare in un cluster air-gapped, tenerlo dopo che il vendor cambia rotta.

Sono due prodotti diversi con profili di rischio diversi. I precedenti rilasci open-weight di Qwen (Qwen 3.5, Qwen 3.6) sono usciti sotto Apache-2.0, che è un pattern forte ma non un impegno per Qwen3.8. Leggi la licenza il giorno in cui arriva; non darla per scontata.

2. Il rapporto di sparsità del 4% non significa il 4% dell'hardware

Qwen3.8-Max è un Mixture-of-Experts. Dei 2,4T parametri totali, solo ~95B si attivano per token — circa il 4% di sparsità. Ecco perché il prezzo per token può essere competitivo e la latenza ragionevole: paghi ~95B di forward-pass compute, non 2,4T.

Il trucco è che la memoria dei pesi non funziona così. Per far girare il modello devi avere tutti i 2,4T parametri residenti da qualche parte abbastanza veloce perché il router tiri fuori gli esperti giusti. In fp8 sono circa 2,4 TB di memoria pesi. In fp16, ~4,8 TB. Anche con quantizzazione aggressiva MXFP4 o simile a 4 bit, parli di ≥1,2 TB solo per i pesi, prima di contare la KV cache per un contesto da 1M token. Questo significa:

  • Singola H100 (80 GB) — non praticabile per il modello intero, nemmeno a 4 bit.
  • Nodo 8×H100 (640 GB) — ancora insufficiente a 4 bit per l'intero 2,4T; possibile con pesante offload su CPU, a grosso costo di latenza.
  • Inferenza multi-nodo (16+ H100 o equivalente) — l'ingombro realistico per servire in real-time.

Se qualcuno ti dice "puoi farlo girare su una singola macchina perché sono solo 95B attivi" — sta contando il numero sbagliato. Il modello dense compagno Qwen3.8-27B esiste in parte per questo motivo: è quello che potrai davvero far girare su un singolo nodo a 8 GPU senza acrobazie.

3. Un'API compatibile OpenAI E una compatibile Anthropic — dallo stesso endpoint

L'API di Qwen3.8-Max supporta sia la forma OpenAI /v1/chat/completions sia la forma Anthropic /v1/messages. La maggior parte dei vendor ne spedisce una; qualcuno spedisce uno shim OpenAI-compat; Qwen che spedisce supporto Anthropic-spec di prima classe è genuinamente inusuale e va tenuto presente.

Conseguenza pratica: il codice che hai scritto contro l'SDK Python Anthropic per Claude — inclusi messages.create(), blocchi tool, gestione system prompt e streaming — può puntare a Qwen3.8-Max con solo uno swap di base-URL e nessuna riscrittura di message-shape. Stessa cosa per il codice con l'SDK OpenAI. Questo rende l'A/B testing contro Claude o GPT molto più economico della solita fatica "porta i tuoi tool schema".

Qwen3.8-Max via API compatibile Anthropic (Python)

from anthropic import Anthropic

client = Anthropic(
  api_key="YOUR_DASHSCOPE_KEY",
  base_url="https://dashscope.aliyuncs.com/api/v1",  # verify current base URL in Qwen docs
)

response = client.messages.create(
  model="qwen3.8-max",
  max_tokens=1024,
  messages=[{"role": "user", "content": "Plan a migration from Postgres 15 to 17 for a 4TB OLTP database."}],
)
print(response.content[0].text)

Qwen3.8-Max via API compatibile OpenAI (Python)

import openai

client = openai.OpenAI(
  api_key="YOUR_DASHSCOPE_KEY",
  base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
  model="qwen3.8-max",
  messages=[{"role": "user", "content": "Refactor this Python coroutine to use asyncio.TaskGroup."}],
)
print(response.choices[0].message.content)

Cosa dicono i benchmark di lancio — e cosa significano gli asterischi

I numeri di lancio di Alibaba (auto-riportati, senza model card, senza tracce di eval riproducibili al lancio):

BenchmarkQwen3.8-MaxGPT-5.6 Sol MaxClaude Fable 5Gemini 3.1 Pro
OSWorld-Verified (uso agentico dell'OS)86.183.285.076.2
PaperBench (sintesi ricerca)93.0
Frontend Code Arena4° posto

Gli asterischi specifici da ricordare prima di citarli a chiunque:

  • Dati dal vendor. Nessuna model card, nessun commit dell'eval harness, nessuna replica di terze parti al lancio — inclusa Artificial Analysis, che di solito pubblica punteggi indipendenti nel giro di giorni.
  • OSWorld-Verified è un delta piccolo in cima. Qwen 86.1, Claude Fable 5 85.0, GPT-5.6 Sol Max 83.2 è uno spread di 1–3 punti. Dentro la banda di rumore di molti benchmark agentici. "Batte la frontiera di 1.1 punti su un benchmark" non è "sposta la frontiera".
  • PaperBench è meno consolidato di SWE-bench o GPQA. Un titolo 93.0 è impressionante ma trattalo come direzionale, non definitivo.
  • Frontend Code Arena ha messo Qwen3.8-Max quarto — dietro a diversi modelli Anthropic e una variante di Fable 5. Task diversi premiano segnali di training diversi; un #1 su un benchmark e un #4 su un altro è un esito normale, non una contraddizione.

Aspettare eval indipendenti (Artificial Analysis, LMArena, run accademici di terze parti) prima di riscrivere il tuo default di scelta modello è la mossa sobria.

Matematica sui prezzi che vale la pena conoscere

La tabella prezzi API:

TierPrezzo per MTok
Input$2.00
Output$6.00
Input cached$0.25

È 8× più economico sull'input rispetto all'attuale tier Anthropic Max e circa la metà dell'output di GPT-5.6 Sol Max. L'input cached a $0.25/MTok è quello interessante: su loop agentici ripetuti con lo stesso system prompt, i cache hit rate tipicamente stanno sopra l'80%, quindi il costo input effettivo per un agente reale è più vicino a $0.35–$0.60/MTok che a $2.00.

Rispetto all'economia di Kimi K3 — dove l'input cache-hit è $0.30/MTok — Qwen3.8-Max sta nella stessa fascia di prezzo cache-basso. Questo li rende entrambi praticabili per workload agentici long-horizon cost-sensitive dove lo stesso scaffolding di prompt viene rispedito a ogni step tool.

Come iniziare con Qwen3.8-Max (oggi, via API)

Guided walkthrough1 of 4
  1. L'API Qwen è servita tramite DashScope (regione Cina) e Model Studio (internazionale). Entrambi espongono il model ID qwen3.8-max una volta abilitato il modello nel tuo workspace e generata una API key.

Qwen3.8-Max vs i modelli con cui compete

Qwen3.8-MaxKimi K3GLM-5.2Claude Fable 5GPT-5.6 Sol Max
Parametri totali2.4T MoE2.8T MoE753Bnon dichiaratinon dichiarati
Attivi per token~95B16/896 esperti
Finestra di contesto1M1M1M+400K+
Vision nativaSolo testo
Pesi openAnnunciati (settimana del 10 ago)Consegnati 27 luglio 2026ConsegnatiNoNo
Prezzo input / MTok$2.00 ($0.25 cached)$3.00 ($0.30 cached)Gratis (self-host)Tier vendorTier vendor
Prezzo output / MTok$6.00$15.00Gratis (self-host)Tier vendorTier vendor
Spec APIOpenAI + AnthropicOpenAI-compatVariaAnthropicOpenAI

Vai su Qwen3.8-Max quando: vuoi un'API di frontiera che potrai anche self-hostare in seguito, il tuo budget è più stretto del tier Max di Anthropic/OpenAI, o vuoi fare A/B test contro Claude con modifiche minime al codice (grazie al supporto Anthropic-spec).

Vai su Kimi K3 quando: ti servono pesi open oggi (K3 è uscito il 27 luglio 2026), o sei già sul tooling Moonshot.

Vai su GLM-5.2 quando: il self-hosting è un requisito duro adesso e la vision non è critica.

Rimani su Claude Fable 5 o GPT-5.6 Sol Max quando: ti serve il record di benchmark di terze parti più profondo, impegni enterprise formali del vendor, o lo specifico comportamento di tool-use / safety per cui quei modelli sono tunati.

Vedi anche: DeepSeek, Qwen e l'onda open-weight per il contesto più ampio del panorama, e Scegliere un modello per il framework generale.

Checklist pratica prima di impegnarti su Qwen3.8-Max

  1. Conferma che i pesi siano davvero pubblicati su Hugging Face o ModelScope prima di scrivere "open-weight" in un documento di compliance.
  2. Leggi la licenza il giorno in cui arriva. Apache-2.0 è il pattern forte da Qwen 3.5 e 3.6; non una garanzia per 3.8.
  3. Fai il tuo run di eval. I numeri OSWorld-Verified del vendor sono direzionali; lo spread di 1–3 punti in cima a quel benchmark è dentro la banda di rumore.
  4. Modella il costo della cache con cura. Il prezzo $0.25/MTok di input cached è dove l'economia diventa interessante; senza cache hit il titolo $2/$6 è il prezzo effettivo.
  5. Pianifica l'ingombro di self-hosting onestamente. 4% di parametri attivi ≠ 4% di memoria GPU. La residenza dei pesi interi per un MoE da 2,4T è un deployment serio, non un progetto da laptop.
  6. Decidi contro quale spec scriverai codice. OpenAI-spec e Anthropic-spec sono entrambe di prima classe — scegli quella che combacia con il tuo code path esistente, non inventare una terza astrazione.

Quiz

Check yourself

0/5
  1. Qwen3.8-Max è stato annunciato il 3 agosto 2026 come 'open-weight'. Cos'era davvero disponibile al lancio?
  2. Qwen3.8-Max ha 2.4T parametri totali con 95B attivi per token. Cosa implica per l'hardware di self-hosting?
  3. Cosa c'è di inusuale nell'API di Qwen3.8-Max rispetto a molti modelli concorrenti?
  4. Al lancio Alibaba ha mostrato Qwen3.8-Max a 86.1 su OSWorld-Verified vs GPT-5.6 Sol Max a 83.2. Come va letto?
  5. Qwen3.8-Max elenca $2/$6 per milione di token input/output, con input cached a $0.25/MTok. Per un loop agentico long-running con un system prompt grande e stabile, qual è il costo input effettivo pratico?
Premi Invio o Spazio per girare la carta. Usa le frecce sinistra e destra per spostarti tra le carte.Termine mostrato.
1 / 8

Fonti e ulteriori letture