GPT-5.6-August-Update 2026: Effort-Slider, kostenloser Think-Button & die 272K-Preisklippe
Am 6. August 2026 hat OpenAI eine Mid-Cycle-Auffrischung von GPT-5.6 ausgeliefert, die die meisten Berichte in einen Satz zusammenfassten: "Sol ist schlauer geworden, kostenlose Nutzer bekommen unbegrenzte Chats." Das eigentliche Update ist interessanter — und folgenreicher, wenn du Claude-Nutzer bist und gelegentlich zum OpenAI-Stack greifst. Drei bewegliche Teile haben sich gleichzeitig geändert: Eine Effort-Steuerung läuft jetzt sowohl in der ChatGPT-UI (als Slider) als auch in der API (als sechsstufiger Parameter); ein Think-Button für die kostenlose Stufe wird in der Woche darauf mit unbegrenzten Luna-Chats ausgeliefert; und die Preisklippe für langen Kontext bei 272K Input-Tokens interagiert unangenehm mit dem Fast-Modus, der nur auf Sol läuft. Jedes davon verschiebt eine reale Entscheidung.
Diese Seite zieht diese Entscheidungen aus dem Release-Notes-Nebel und zeigt, was sich für einen Builder, der in Claude-Begriffen denkt, tatsächlich ändert.
- Genau sehen, was am 6. August 2026 für GPT-5.6 ausgeliefert wurde — und was in der Woche vom 10. August für kostenlose Nutzer ausgeliefert wurde
- Den sechsstufigen Effort-Parameter verstehen (`none, low, medium, high, xhigh, max`) und ihn auf Claudes Thinking-Effort-Modell abbilden
- Die Preisklippe bei 272K Input-Tokens lernen — und wie sie einen Job, den du budgetiert glaubtest, still verdoppeln kann
- Wissen, wann der Fast-Modus hilft, wann er nichts bringt und welche Requests er stillschweigend ablehnt
- Entscheiden, wann das Update ein realer Grund ist, eine Workload von Claude auf Sol umzustellen — und wann nicht
Was am 6. August 2026 tatsächlich ausgeliefert wurde
Drei konkrete Dinge. Der Rest ist Politur.
- Plus- und Pro-Nutzer sehen einen neuen Slider auf Web, Mobile und Desktop, der einstellt, wie viel Reasoning ChatGPT pro Antwort verwendet. Unter der Haube legt die API denselben Regler als `reasoning.effort` mit sechs Positionen offen — `none`, `low`, `medium`, `high`, `xhigh`, `max` — mit `medium` als Default, wenn ausgelassen. Das ersetzt das bisherige 'Modell entscheidet'-Verhalten: Du wählst jetzt die Stufe und zahlst dafür.
- OpenAI hat Sol aktualisiert, damit er 'direktere Antworten gibt, straffere Formatierung nutzt und zusätzliche Details vermeidet, wenn sie nicht helfen', damit er Detailtiefe pro Frage anpasst und 'weniger geneigt ist zuzustimmen, wenn eine Korrektur hilfreicher wäre' — das Näheste, dem OpenAI je einem expliziten Anti-Sykophanz-Durchlauf gekommen ist. Interne Evals zu Finanz-, Medizin- und Rechts-Prompts berichteten, dass Faktenfehler '68 % seltener' waren als beim eingestellten GPT-5.5 Instant.
- Kostenlose Nutzer bekommen unbegrenzte Text-Chats auf GPT-5.6 Luna (vorher begrenzt) und einen neuen Think-Button für tieferes Reasoning bei schwierigeren Fragen, 'vorbehaltlich Missbrauchsschutz'. Der Think-Button war am 6. August nicht live — er wurde in der Woche danach ausgerollt.
Der Effort-Slider — die sechs Stufen auf ein Claude-Mentalmodell abbilden
Wenn du in Claudes fünfstufiger Effort-Einstellung gedacht hast (eingeführt mit Opus 5 im Juli), ist das Mentalmodell ähnlich, aber die Labels decken sich nicht sauber. GPT-5.6 hat sechs Stufen, wo Claude fünf hat, und die Semantik unterscheidet sich an beiden Enden.
| GPT-5.6-Stufe | Was sie macht | Grob wie Claude Opus 5 |
|---|---|---|
none | Überspringt Reasoning komplett; sofortige Antwort | Kein direktes Äquivalent — Claude plant immer ein bisschen |
low | Kurzer Chain-of-Thought, billig | minimal Effort |
medium (Default) | Ausgewogenes Planen; der ausgelieferte Default | low–medium |
high | Tieferes Planen; langsamer, teurer | medium |
xhigh | Lange Deliberation; mehrstufiges Reasoning | high |
max | Volle Reasoning-Obergrenze — teuer | maximum |
Zwei praktische Konsequenzen:
- Der Default hat sich bewegt. Auf der API bekommst du, wenn du
reasoning.effortauslässt,medium. Viele Wrapper haben sich vorher darauf verlassen, dass das Modell Effort automatisch auswählt; dieses Verhalten ist weg. Für vorhersehbare Kosten ist Explizites jetzt erforderlich. noneist ein echter Knopf. Er ist wirklich nützlich für Klassifikator-Prompts, strukturierte Extraktion oder Tool-Router-Calls, bei denen Reasoning-Tokens reiner Overhead sind. Claude hat keinen sauber äquivalenten 'Aus'-Schalter.
Ein sicheres Request-Template, das Effort explizit fixiert
{
"model": "gpt-5.6-sol",
"reasoning": { "effort": "low" },
"messages": [
{ "role": "system", "content": "Extract only. Output JSON." },
{ "role": "user", "content": "..." }
]
}Die 272K-Token-Preisklippe — eine reale Gefahr
Das ist die Änderung, die am wahrscheinlichsten eine Rechnung unerwartet in die Höhe treibt.
Die Regel: Wenn der Input eines Requests 272.000 Tokens überschreitet, wird der gesamte Request zu 2× Input-Rate und 1,5× Output-Rate neu bepreist, nicht nur die Tokens über der Linie. Es gibt keine Proration.
Zwei Dinge zu dieser Regel sind wichtig:
- Es ist eine Klippe, keine Rampe. Ein Prompt bei 271.999 Input-Tokens zahlt die Basisrate. Ein Prompt bei 272.001 zahlt 2×/1,5× auf jeden Input- und Output-Token im Call — einschließlich der Reasoning-Tokens, die das Modell erzeugt.
- Lange Konversationen kriechen darüber hinaus. Multi-Turn-Chats und Agent-Loops sammeln Historie an. Eine Session, die unter 272K startet, kann still auf Turn 12 die Linie überschreiten und jeden weiteren Turn neu bepreisen.
- GPT-5.6-Sol-Basispreise sind 5 $ / 30 $ pro Million (Input / Output), mit gecachtem Input bei 0,50 $. Über 272K Input-Tokens kostet derselbe Call 10 $ / 45 $. Auf einem 300K-Token-Dokument mit 4K Output sind die Basiskosten 1,62 $. Über die Klippe werden es 3,18 $ — fast 2× für einen extra Token über der Schwelle.
- Zwei 200K-Calls kosten 2 $ Input. Ein 400K-Call kostet 8 $ (2× Input auf den ganzen Request). Chunking ist 4× billiger im Input, wenn jeder Chunk unter 272K bleibt. Stopfe nur, wenn das Modell wirklich alles auf einmal sehen muss.
- Gecachter Input bei 0,50 $ ist bis 272K immer noch bei 0,50 $ gecacht. Über der Klippe gilt der Multiplikator für jeden bepreisten Token — einschließlich ungecachten Inputs über dem gecachten Präfix. Ein stabiles 250K-gecachtes-Präfix plus ein wachsender Schwanz kann dich still darüberdrücken.
Fast-Modus — Kleingedrucktes, das man lesen sollte
Der Fast-Modus ist eine Sol-exklusive Option, die Preis gegen Latenz tauscht: bis zu 2,5× schneller bei 2× API-Preis. Terra und Luna bieten ihn nicht an.
Drei Dinge, die die Launch-Pitch herunterspielt:
- 'Bis zu' ist eine Obergrenze, keine Norm. Der Wall-Clock-Speedup hängt von deiner Workload ab — Tool-Calls, Netzwerk-Hops und Streaming-Rate deckeln den realisierten Gewinn alle deutlich unter 2,5×.
- Fast-Modus und langer Kontext mischen sich nicht sauber. OpenAI hat keine Mutual-Exclusivity-Regel veröffentlicht, aber frühe Guides berichten, dass Fast-Modus-Requests sich schlecht verhalten (oder still degradieren), sobald du die 272K-Input-Schwelle überschreitest. Behandle sie als inkompatibel, bis OpenAI etwas anderes dokumentiert.
- Reasoning-Tokens zählen weiterhin. Der Fast-Modus macht Durchsatz schneller, aber ein
max-Effort-Call erzeugt trotzdem dasselbe Volumen an Reasoning-Output. Die Ökonomie funktioniert nur, wenn du für Latenz zahlst, die du tatsächlich spürst.
- Der Break-Even des Fast-Modus liegt bei etwa 25 % mehr Durchsatz pro Dollar an der 2,5×-Obergrenze — schlechter, wenn die Obergrenze nicht erreicht wird.
- Bevorzuge den Fast-Modus für interaktiven Chat, bei dem der Nutzer wartet. Überspringe ihn bei Batch, Background-Agents und Long-Context-RAG.
- Wenn du eine Batch-Pipeline von Claude auf Sol umstellen wolltest, um Kosten zu sparen, schalte den Fast-Modus nicht ein — du löschst die Ersparnis.
Free-Tier: unbegrenztes Luna + der Think-Button
Für Claude-Nutzer zählt das weniger als die API-Änderungen, aber es ist die Änderung, die am wahrscheinlichsten im Screenshot eines Freundes auftaucht und einen Streit auslöst.
- Unbegrenzte Text-Chats auf GPT-5.6 Luna für kostenlose ChatGPT-Nutzer, ab der Woche vom 10. August 2026. Vorher begrenzt.
- Think-Button auf kostenlosen Chats, gleiches Zeitfenster. Fügt einer bestimmten Nachricht einen tieferen Reasoning-Durchlauf hinzu, vorbehaltlich Missbrauchsschutz. Es ist nicht dieselbe UI wie der Plus/Pro-Effort-Slider — es ist ein Pro-Nachrichten-Toggle, keine sessionweite Einstellung.
Die praktische Lesart: OpenAI verteidigt jetzt aggressiv den Free-Tier, jetzt wo Claude und Gemini beide großzügige kostenlose Reasoning-Optionen haben. Erwarte, dass die Missbrauchsschutz-Obergrenze in den ersten Wochen eng ist.
Wo dieses Update tatsächlich die Entscheidung eines Claude-Nutzers verändert
Für die meisten Claude-Workloads bleibt die Antwort dieselbe. Für drei spezifische Muster bewegt sie sich.
- `reasoning.effort: none` auf Sol Luna ist jetzt eine plausibel billigere Option als ein Min-Effort-Claude-Haiku-Call für hochvolumiges Routing, Tag-Extraktion oder strukturiertes Labelling — vorausgesetzt, deine Prompts bleiben weit unter 272K. Benchmarke es an einem repräsentativen Sample, bevor du umschaltest.
- Sol + Fast-Modus ist jetzt die schnellste Qualitätsstufe, die OpenAI ausliefert. Wenn ein Nutzer auf jede Antwort wartet und deine Prompts unter 272K passen, ist das das Update, das den Tradeoff am meisten verändert. Für Background-Agent-Läufe ignoriere es.
- Die 272K-Klippe bedeutet, dass du dafür designen solltest. Der 1M-Kontext von Claude Opus 5 und der 1,05M-Kontext von Sol reichen beide weit über 272K hinaus, aber Claude hat keine Klippe derselben Form — sein Long-Context-Pricing ist flach. Für Repo-weite Operationen bei 400K+ Input hat Claude derzeit den Kostenvorteil.
Migrationsnotizen für bestehenden GPT-5.6-API-Code
Wenn du vor dem 6. August gegen Sol ausgeliefert hast, müssen sich zwei Dinge ändern:
- Setze
reasoning.effortexplizit bei jedem Call. Auslassen kostet dich jetztmedium; wahrscheinlich wolltest dulowfür die meisten. - Füge eine 272K-Schranke am Rand deiner Pipeline hinzu. Lehne Requests ab oder chunke sie, deren Input-Tokens über die Schwelle drücken. Eine dumme Prüfung von
len(input) / 4als Näherung reicht als erste Verteidigungslinie.
Ein Guardrail-Einzeiler für Node.js-Wrapper
if (estimateTokens(input) > 260_000) { chunkOrReject(input); }Was das nicht einschließt
Zwei Gerüchte, die um dieses Update kursierten, sind nicht Teil davon:
- GPT-6 (Astra). In einigen Outlets für August gerüchtet, aber Stand 11. August 2026 hat OpenAI kein Launch-Datum, keine Model-Card und kein Pricing bestätigt. Siehe unsere Seite OpenAI-Astra-Vorschau für das, was tatsächlich bekannt versus spekuliert ist.
- Sol-Preissenkung. Die Basisrate von 5 $ / 30 $ hat sich nicht geändert. Einige Berichterstattungen verwechselten die 272K-Klippe (einen Aufschlag) mit einer Preisänderung.
Probier's aus
Check yourself
0/4Quellen & weiterführende Lektüre
- OpenAI: GPT-5.6 August 2026 Updates (PDF) — die Primärquelle für den Verhaltensdurchlauf vom 6. August und den Free-Tier-Rollout
- ChatGPT-Release-Notes (OpenAI Help Center) — kanonische ChatGPT-seitige Release-Notes
- Model-Release-Notes (OpenAI Help Center) — API-Model-Verhaltensnotizen
- 9to5Mac: OpenAI updating ChatGPT with a smarter GPT-5.6 Sol and unlimited free chats (6. Aug 2026)
- Visual Studio Magazine: GPT-5.6 Sol Ascends for Token Efficiency (6. Aug 2026)
- AIToolsReview: GPT-5.6 Review — August 2026 — Effort-Slider- und 272K-Klippen-Details
- Kingy AI: GPT-5.6 Fast Mode — Speed, Pricing and Tradeoffs — Fast-Modus-Preismultiplikator und Vorbehalte
- Coursiv Blog: GPT-5.6 Sol — Benchmarks, API Pricing & Review — sechsstufiger
reasoning.effort-API-Parameter - BenchLM: GPT-5.6 Sol Benchmarks & Pricing — Basispreise und Benchmark-Vergleiche
Querverweise innerhalb von AILmanac:
- GPT-5.6 & ChatGPT Work for Claude Users — die Launch-Seite vom 9. Juli 2026
- Fast Inference & Token Speed — wie Fast-Tier-Produkte über Anbieter hinweg abschneiden
- Opus 5 Field Guide — für die Claude-Seite des Effort-Tier-Vergleichs
- OpenAI-Astra-Vorschau — was für die nächste OpenAI-Generation gerüchtet wird und was tatsächlich bestätigt ist