Qwen3.8-Max: Das erste Max-Klasse-Modell mit offenen Gewichten (wenn die Gewichte erscheinen)
Am 3. August 2026 kündigte Alibabas Qwen-Team Qwen3.8-Max an — ein Mixture-of-Experts-Modell mit 2,4 Billionen Parametern, 95B aktiven Parametern, 1M-Token-Kontext und Benchmark-Zahlen, die es auf OSWorld-Verified leicht vor GPT-5.6 Sol Max positionieren. Alibaba präsentierte den Launch als das erste Qwen-"Max"-Klasse-Modell, das mit offenen Gewichten erscheint — eine Wende, denn bisherige Max-Klasse-Qwens waren nur per API verfügbar. Gewichte wurden für die Woche des 10. August 2026 auf Hugging Face und ModelScope versprochen.
Es gibt einen Haken, den man lesen sollte, bevor man etwas umschreibt, das davon abhängt: beim Launch und in den Tagen danach war die Hugging-Face-Seite leer. Diese Seite geht den tatsächlichen Stand von Qwen3.8-Max ab Anfang August 2026 durch — die Architektur, das Pricing, die dualen Spec-APIs, die es zu einem Drop-in für Claude oder OpenAI-Clients machen, die Benchmark-Tabelle mit einem "vom Anbieter gemeldet"-Sternchen, und die belastbaren Fragen, die man stellen sollte, bevor man Code darauf festlegt.
- Verstehen, was am 3. August ausgeliefert wurde vs. was nur versprochen wurde — API-Zugang vs. offene Gewichte
- Die Sparsity-Mathematik von 2,4T / 95B aktiv MoE richtig lesen, besonders vor der Kalkulation eines Self-Hosted-Deployments
- Wissen, dass Qwen3.8-Max sowohl OpenAI-Spec- als auch Anthropic-Spec-APIs bereitstellt — eine seltene Eigenschaft, die Portabilität verändert
- Die Launch-Benchmarks (OSWorld 86.1, PaperBench 93.0) mit der richtigen Skepsis interpretieren — vom Anbieter gemeldet, keine Model Card, noch keine unabhängigen Läufe
- Das Muster 'offene Gewichte versprochen ≠ offene Gewichte ausgeliefert' erkennen und wissen, was zu tun ist, während man wartet
Die Ein-Satz-Version
Qwen3.8-Max ist ein sparses MoE mit 2,4 Billionen Parametern (95B aktiv pro Token) mit 1M-Token-Kontext, nativem Text- + Vision-Input, dualen OpenAI-Spec- und Anthropic-Spec-APIs, mit Preisen von $2/$6 pro Million Input/Output-Tokens — angekündigt am 3. August 2026 als API-only, mit Gewichten und einem begleitenden Qwen3.8-27B, die für die Woche des 10. August 2026 zur offenen Freigabe versprochen wurden.
Drei Dinge zu Qwen3.8-Max, die aus den Schlagzeilen nicht offensichtlich sind
1. "Open Weight" wurde angekündigt, aber noch nicht ausgeliefert
Alibabas Launch-Kommunikation und die meisten Berichte beschrieben Qwen3.8-Max als das erste Open-Weight-"Max"-Klasse-Qwen. Das ist eine echte Wende — Qwen3-Max, Qwen3.5-Max, Qwen3.6-Max und Qwen3.7-Max waren alle API-only. Aber beim Launch, und durch die erste Woche, hatte die Qwen-Organisation auf Hugging Face kein Qwen3.8-Max-Repository, kein Qwen3.8-27B-Repository und keine deklarierte Lizenz. Die Zusage lautete "Gewichte in der Woche des 10. August"; verifizieren, bevor man einen Compliance-Fall darum plant.
Die Community-Reaktion in der ersten Stunde nach dem Launch drehte sich fast ausschließlich um die Gewichte, nicht um die Benchmarks. Nutzer widersprachen Alibabas "Open-Source"-Framing, während die Artefakte nicht öffentlich waren. Die nützliche Unterscheidung, die man verinnerlichen sollte:
- Ein "verfügbares" Modell ist ein Dienst, den man zu den Bedingungen des Anbieters mietet. Wird die API abgekündigt, ist die Abhängigkeit gebrochen.
- Ein "Open-Weight"-Modell ist ein Artefakt, das man herunterlädt und hält. Man kann es auditieren, in einem air-gapped Cluster betreiben, es behalten, nachdem der Anbieter pivotiert.
Das sind unterschiedliche Produkte mit unterschiedlichen Risikoprofilen. Frühere Qwen-Open-Weight-Releases (Qwen 3.5, Qwen 3.6) wurden unter Apache-2.0 veröffentlicht, was ein starkes Muster ist, aber keine Zusage für Qwen3.8. Die Lizenz an dem Tag lesen, an dem sie erscheint; nicht annehmen.
2. Das 4%-Sparsity-Verhältnis bedeutet nicht 4% der Hardware
Qwen3.8-Max ist ein Mixture-of-Experts. Von den 2,4T Gesamtparametern aktivieren sich nur ~95B pro Token — etwa 4% Sparsity. Deshalb kann der Preis pro Token wettbewerbsfähig sein und die Latenz vernünftig: man zahlt für ~95B Forward-Pass-Compute, nicht für 2,4T.
Die Falle ist, dass Weight-Memory nicht so funktioniert. Um das Modell zu betreiben, müssen alle 2,4T Parameter irgendwo schnell genug resident sein, damit der Router die richtigen Experten ziehen kann. In fp8 sind das rund 2,4 TB Weight-Memory. In fp16 ~4,8 TB. Selbst mit aggressiver MXFP4- oder ähnlicher 4-Bit-Quantisierung schaut man auf ≥1,2 TB allein für Gewichte, bevor man den KV-Cache für einen 1M-Token-Kontext zählt. Das bedeutet:
- Eine einzelne H100 (80 GB) — nicht machbar für das Vollmodell, selbst bei 4 Bit.
- 8×H100-Node (640 GB) — bei 4 Bit für das volle 2,4T noch zu klein; möglich mit starkem CPU-Offload, bei hohen Latenzkosten.
- Multi-Node-Inferenz (16+ H100 oder vergleichbar) — der realistische Footprint für Echtzeit-Serving.
Wenn jemand einem sagt "das kannst du auf einer einzigen Maschine betreiben, weil nur 95B aktiv sind" — der zählt die falsche Zahl. Das begleitende dichte Modell Qwen3.8-27B existiert teilweise aus diesem Grund: es ist das, das man tatsächlich auf einem einzelnen 8-GPU-Node ohne Heldentaten betreiben kann.
3. Sowohl eine OpenAI-kompatible als auch eine Anthropic-kompatible API — vom selben Endpunkt
Die API von Qwen3.8-Max unterstützt sowohl die OpenAI-/v1/chat/completions-Form als auch die Anthropic-/v1/messages-Form. Die meisten Anbieter liefern eine; einige liefern einen OpenAI-Compat-Shim; dass Qwen erstklassigen Anthropic-Spec-Support liefert, ist wirklich ungewöhnlich und einen Plan wert.
Praktische Konsequenz: Code, den man gegen das Anthropic Python SDK für Claude geschrieben hat — inklusive messages.create(), Tool-Blocks, System-Prompt-Handling und Streaming — kann mit nur einem Base-URL-Wechsel und ohne Message-Shape-Umschreibungen auf Qwen3.8-Max zeigen. Dasselbe gilt für OpenAI-SDK-Code. Das macht A/B-Testing gegen Claude oder GPT deutlich günstiger als den üblichen "Porte-deine-Tool-Schemas"-Aufwand.
Qwen3.8-Max über die Anthropic-kompatible API (Python)
from anthropic import Anthropic
client = Anthropic(
api_key="YOUR_DASHSCOPE_KEY",
base_url="https://dashscope.aliyuncs.com/api/v1", # verify current base URL in Qwen docs
)
response = client.messages.create(
model="qwen3.8-max",
max_tokens=1024,
messages=[{"role": "user", "content": "Plan a migration from Postgres 15 to 17 for a 4TB OLTP database."}],
)
print(response.content[0].text)Qwen3.8-Max über die OpenAI-kompatible API (Python)
import openai
client = openai.OpenAI(
api_key="YOUR_DASHSCOPE_KEY",
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Refactor this Python coroutine to use asyncio.TaskGroup."}],
)
print(response.choices[0].message.content)Was die Launch-Benchmarks sagen — und was die Sternchen bedeuten
Alibabas Launch-Zahlen (selbst gemeldet, keine Model Card, keine reproduzierbaren Eval-Traces beim Launch):
| Benchmark | Qwen3.8-Max | GPT-5.6 Sol Max | Claude Fable 5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| OSWorld-Verified (agentische OS-Nutzung) | 86.1 | 83.2 | 85.0 | 76.2 |
| PaperBench (Forschungssynthese) | 93.0 | — | — | — |
| Frontend Code Arena | 4. Platz | — | — | — |
Die konkreten Sternchen, die man sich merken sollte, bevor man diese Werte irgendjemandem zitiert:
- Vom Anbieter gemeldet. Keine Model Card, kein Eval-Harness-Commit, keine unabhängige Reproduktion beim Launch — auch nicht von Artificial Analysis, die normalerweise unabhängige Werte innerhalb weniger Tage veröffentlicht.
- OSWorld-Verified ist an der Spitze ein kleiner Abstand. Qwen 86.1, Claude Fable 5 85.0, GPT-5.6 Sol Max 83.2 ist ein Abstand von 1–3 Punkten. Innerhalb des Rauschbandes vieler agentischer Benchmarks. "Schlägt die Frontier um 1,1 Punkte auf einem Benchmark" ist nicht "verdrängt die Frontier".
- PaperBench ist weniger etabliert als SWE-bench oder GPQA. Eine 93.0-Schlagzeile ist beeindruckend, aber man sollte sie als richtungsweisend, nicht als definitiv behandeln.
- Frontend Code Arena platzierte Qwen3.8-Max auf dem vierten Platz — hinter mehreren Anthropic-Modellen und einer Fable-5-Variante. Unterschiedliche Aufgaben belohnen unterschiedliche Trainings-Signale; eine #1 auf einem Benchmark und eine #4 auf einem anderen ist ein normales Ergebnis, kein Widerspruch.
Auf unabhängige Evals zu warten (Artificial Analysis, LMArena, Third-Party-akademische Läufe), bevor man seine Modell-Auswahl-Default umschreibt, ist der besonnene Zug.
Pricing-Mathematik, die man kennen sollte
Die API-Pricing-Tabelle:
| Tier | Preis pro MTok |
|---|---|
| Input | $2,00 |
| Output | $6,00 |
| Cached Input | $0,25 |
Das ist 8× günstiger im Input-Preis als das aktuelle Anthropic Max-Tier und etwa die Hälfte der Output-Kosten von GPT-5.6 Sol Max. Der Cached Input bei $0,25/MTok ist der interessante Teil: bei wiederholten agentischen Tool-Loops mit demselben System-Prompt liegen Cache-Hit-Raten typischerweise über 80%, sodass die effektiven Input-Kosten für einen laufenden Agenten näher an $0,35–$0,60/MTok liegen, nicht an $2,00.
Verglichen mit der Kimi K3 Ökonomie — wo Cache-Hit-Input $0,30/MTok kostet — ist Qwen3.8-Max im selben Low-Cache-Preis-Band. Das macht beide für kostensensitive Long-Horizon-agentische Workloads geeignet, bei denen dasselbe Prompt-Scaffolding bei jedem Tool-Schritt neu gesendet wird.
Erste Schritte mit Qwen3.8-Max (heute, per API)
- Die Qwen-API wird über DashScope (China-Region) und Model Studio (international) angeboten. Beide exponieren die Modell-ID qwen3.8-max, sobald man das Modell im Workspace aktiviert und einen API-Key generiert hat.
- OpenAI-Spec: Base URL https://dashscope-intl.aliyuncs.com/compatible-mode/v1 mit dem openai SDK. Anthropic-Spec: Qwens Anthropic-kompatiblen Endpunkt verwenden, dokumentiert in Model Studio. Wähle diejenige, die zu deiner bestehenden Codebasis passt — du musst keine Message-Shapes umschreiben.
- Führe eine kurze agentische Aufgabe durch Qwen3.8-Max mit deinen bestehenden Tool-Schemas aus. Vergleiche Kosten, Latenz und Tool-Auswahl-Qualität mit deinem aktuellen Default. Anbieter-Benchmarks sind richtungsweisend; dein eigener Workload ist die Ground Truth.
- Die Qwen3.8-Max- und Qwen3.8-27B-Repositories wurden für die Woche des 10. August 2026 erwartet. Lies die Lizenz an dem Tag, an dem sie erscheint — ein starkes Apache-2.0-Muster aus früheren Qwens ist keine Zusage für diesen Release.
Qwen3.8-Max vs. die Modelle, mit denen es konkurriert
| Qwen3.8-Max | Kimi K3 | GLM-5.2 | Claude Fable 5 | GPT-5.6 Sol Max | |
|---|---|---|---|---|---|
| Gesamtparameter | 2,4T MoE | 2,8T MoE | 753B | nicht offengelegt | nicht offengelegt |
| Aktiv pro Token | ~95B | 16/896 Experten | — | — | — |
| Kontextfenster | 1M | 1M | — | 1M+ | 400K+ |
| Native Vision | Ja | Ja | Nur Text | Ja | Ja |
| Offene Gewichte | Angekündigt (Woche 10. Aug.) | Ausgeliefert 27. Juli 2026 | Ausgeliefert | Nein | Nein |
| Input-Preis / MTok | $2,00 ($0,25 cached) | $3,00 ($0,30 cached) | Kostenlos (Self-Host) | Anbieter-Tier | Anbieter-Tier |
| Output-Preis / MTok | $6,00 | $15,00 | Kostenlos (Self-Host) | Anbieter-Tier | Anbieter-Tier |
| API-Spec | OpenAI + Anthropic | OpenAI-Compat | Variiert | Anthropic | OpenAI |
Greif zu Qwen3.8-Max, wenn: du eine Frontier-Tier-API willst, die du später auch selbst hosten kannst, dein Budget knapper ist als das Anthropic/OpenAI Max-Tier, oder du gegen Claude mit minimalen Code-Änderungen A/B-testen willst (dank Anthropic-Spec-Support).
Greif zu Kimi K3, wenn: du offene Gewichte heute brauchst (K3 wurde am 27. Juli 2026 ausgeliefert), oder du bereits mit Moonshot-Tooling arbeitest.
Greif zu GLM-5.2, wenn: Self-Hosting jetzt eine harte Anforderung ist und Vision nicht kritisch ist.
Bleib bei Claude Fable 5 oder GPT-5.6 Sol Max, wenn: du die tiefste Third-Party-Benchmark-Historie brauchst, formale Enterprise-Anbieterzusagen, oder das spezifische Tool-Use-/Safety-Verhalten, auf das diese Modelle abgestimmt sind.
Siehe auch: DeepSeek, Qwen & die Open-Weight-Welle für den breiteren Landschaftskontext, und Modell auswählen für das allgemeine Framework.
Praktische Checkliste, bevor du dich auf Qwen3.8-Max festlegst
- Bestätige, dass die Gewichte tatsächlich veröffentlicht sind auf Hugging Face oder ModelScope, bevor du "Open Weight" in ein Compliance-Dokument schreibst.
- Lies die Lizenz an dem Tag, an dem sie erscheint. Apache-2.0 ist das starke Muster von Qwen 3.5 und 3.6; keine Garantie für 3.8.
- Führe deinen eigenen Eval-Lauf durch. Anbieter-OSWorld-Verified-Zahlen sind richtungsweisend; der 1–3-Punkte-Abstand an der Spitze dieses Benchmarks liegt im Rauschband.
- Cache-Kosten sorgfältig modellieren. Der $0,25/MTok Cached-Input-Preis ist da, wo die Ökonomie interessant wird; ohne Cache-Hits ist die $2/$6-Schlagzeile der effektive Preis.
- Plane den Self-Hosting-Footprint ehrlich. 4% aktive Parameter ≠ 4% GPU-Speicher. Voll-Weight-Residenz für ein 2,4T MoE ist ein ernsthaftes Deployment, kein Laptop-Projekt.
- Entscheide, gegen welche Spec du programmierst. OpenAI-Spec und Anthropic-Spec sind beide erstklassig — wähle diejenige, die zu deinem bestehenden Code-Pfad passt, erfinde keine dritte Abstraktion.
Quiz
Check yourself
0/5Quellen & weiterführende Lektüre
- Qwen3.8-Max: Features, Benchmarks, and Pricing — DataCamp — Launch-Zusammenfassung, Architektur und Pricing-Überblick
- Qwen 3.8-Max: Release Date, Specs, and How to Access It (2026) — Yotta Labs — API-Kompatibilität und Preisaufschlüsselung pro Tier
- Qwen3.8 Open Weights: Check This Before Downloading — Digital Applied — Hardware-Dimensionierungs-Überlegungen und Lizenz-Risikoanalyse
- Alibaba's New AI Was Called Open-Source. Its Model Page Is Empty. — Cherry Creek News — der "angekündigt ≠ ausgeliefert"-Realitätscheck
- Qwen-Team auf Hugging Face — hier auf die tatsächliche Weight-Publikation und Lizenz prüfen
- Verwandt: DeepSeek, Qwen & die Open-Weight-Welle — belastbarer Überblick über die Open-Weight-Landschaft und die Qwen-Familie vor 3.8
- Verwandt: Kimi K3: Weltgrößtes Open-Weight-Modell — der aktuell ausgelieferte 2,8T Open-Weight-Konkurrent
- Verwandt: GLM-5.2: Open-Weight-Frontier — eine weitere Open-Weight-Option, nur Text, aber heute verfügbar
- Verwandt: Modell auswählen — Entscheidungsframework für Open-Weight vs. Closed-Frontier-Trade-offs
- Verwandt: Was KI bei Anbietern kostet — Preisvergleich an der Frontier