Zum Hauptinhalt springen

GPT-5.6 & ChatGPT Work für Claude-Nutzer

Fortgeschritten

Du denkst schon in Claude. Dann kippte am 9. Juli 2026 die ganze Timeline: OpenAI hat drei GPT-5.6-Varianten — Sol, Terra, Luna — und ChatGPT Work ausgeliefert, einen Agent, der ein Ziel entgegennimmt und stundenlang im Hintergrund daran arbeitet. Ein Kollege fragt „Sollten wir auf Sol wechseln?"; ein Kunde will, dass ChatGPT Work die Hälfte eines Workflows ersetzt, den du bereits in Claude betreibst. Diese Seite bildet den Launch auf dein Claude-Denkmodell ab und — noch nützlicher — hebt die Teile hervor, die die Berichterstattung begräbt: die realen Preise, die exakten Benchmark-Differenzen, die 1,05 Mio. Kontext, die niemand erwartet hat, und wo OpenAI immer noch gegen Anthropic verliert.

What you'll learn
  • Lerne, was tatsächlich ausgeliefert wurde: Sol, Terra, Luna (plus Sol Ultra), alle mit einem 1,05-Mio.-Token-Kontextfenster
  • Lies die Benchmark-Tabelle so, wie OpenAI sie nicht veröffentlicht hat — wo GPT-5.6 führt und wo Claude Fable 5 weiterhin gewinnt
  • Verstehe ChatGPT Work: kein Chat-Modus, sondern ein Hintergrund-Agent, der Stunden später ein fertiges Spreadsheet, Deck, Dokument oder eine Web-App zurückgibt
  • Wisse, wann du zu GPT-5.6 Sol statt zu Claude greifen solltest für Coding, Agenten, Browser-Aufgaben — und wann die Antwort immer noch Claude lautet

Die Ein-Satz-Version

GPT-5.6 ist ein Refresh der GPT-5-Familie in drei Tiers — Sol (Flaggschiff), Terra (mittel), Luna (Budget) — die sich ein 1,05-Mio.-Token-Kontextfenster, 128K max. Output und eine von OpenAI veröffentlichte Behauptung von 54 % besserer Token-Effizienz bei agentischem Coding teilen; ChatGPT Work ist der neue autonome Agent, der darauf aufbaut, ausgeliefert als vereinte Desktop-App, die Codex geschluckt hat.

Der interessante Teil ist nicht der Modell-Refresh — der war zu erwarten. Es ist die Form des Releases: OpenAI liefert nun Modell + Agent + IDE als ein Produkt und bepreist das Arbeitspferd-Tier ($1 in / $6 out bei Luna) unterhalb dessen, wo „günstige Coding-Modelle" historisch angesiedelt waren.

Drei Dinge am GPT-5.6-Launch, die Leute überraschen

Alle schreiben den Benchmark-Recap. Hier sind die Teile, die die meisten Claude-Nutzer beim ersten Lesen übersehen.

1. Alle drei Tiers teilen sich denselben 1,05-Mio.-Kontext

Das ist nicht, wie OpenAI normalerweise ausliefert. In früheren Refreshes kam das günstige Tier mit einem geschrumpften Kontextfenster, als Anreiz zum Upgrade. In GPT-5.6 geben Sol, Terra und Luna alle einen 1,05-Mio.-Token-Kontext und 128K max. Output an — dieselbe Form. Das bedeutet: Luna zu $1 Input / $6 Output pro Million Token ist eine tragfähige Long-Context-Option, nicht nur eine für kurze Requests, und es verändert die Rechnung für RAG-Pipelines, Whole-Repo-Reviews und lange Tool-Schleifen. Wenn du ein Claude-Haiku-artiges Tier für hochvolumige Retrieval-Arbeit im Blick hattest, ist Luna jetzt der offensichtliche Cross-Check.

2. ChatGPT Work ist kein „Chat-Modus" — es ist ein Hintergrund-Agent, der dir eine fertige Datei überreicht

Der Rahmen, den OpenAI verwendet, ist vielsagend: Du chattest nicht mit ChatGPT Work, du briefst es. Es nimmt ein Ergebnis („baue eine Wettbewerbsanalyse dieser fünf Anbieter"), sammelt Kontext aus deinen verbundenen Apps und Dateien, zerlegt die Aufgabe in Schritte, arbeitet eigenständig für Minuten oder Stunden und liefert ein fertiges Artefakt — ein Spreadsheet, Slide Deck, Dokument, Report oder eine funktionierende Web-App. Codex wurde in dieselbe Desktop-App eingegliedert, sodass ChatGPT Work auch die Coding-Oberfläche besitzt. Das ist dieselbe Wette auf „langlaufende autonome Arbeit", die Anthropic mit den Managed Agents von Claude eingegangen ist, aber zuerst als Endnutzer-Produkt und erst danach als API ausgeliefert. Es rollte am Launch-Tag auf Pro / Enterprise / Edu aus, mit Plus und Business in den folgenden Tagen.

3. Sol gewinnt die von OpenAI veröffentlichten Benchmarks. Claude führt weiterhin SWE-bench Pro an.

Lies über die Marketing-Grafik hinaus, und das Bild wird gemischter als „Sol ist der neue König". OpenAIs eigene Zahlen sagen, Sol erreicht 80 auf dem Artificial Analysis Coding Agent Index (etwa +2,8 vs. Claude Fable 5) und verwendet dabei weniger als die Hälfte der Output-Tokens zu ungefähr einem Drittel der Kosten. Das ist ein echter Sieg. Aber Fable 5 führt SWE-Bench Pro weiterhin mit einem großen berichteten Abstand an — Sol kommt dort auf ~64,6 % — und die Launch-Berichterstattung neigt dazu, das zu vergraben. Übersetzung: Wähle nach Workload, nicht nach Pressemitteilung. Für „Agent-Index"-artige Tool-und-Browser-Arbeit ist Sol jetzt das zu schlagende Modell. Für echte Repo-Bugfixes mit sinnvollem Kontext hat Anthropic weiterhin die Nase vorn.

Die GPT-5.6-Tier-Tabelle (Stand 9. Juli 2026)

ModellInput $/1MOutput $/1MKontextMax. OutputPositionierung
Sol$5$301,05M128KFlaggschiff: komplexes Reasoning, Coding, Science, Agenten
Terra$2,50$151,05M128K„GPT-5.5-Leistung zu ~halben Kosten" — Routinearbeit
Luna$1$61,05M128KHohes Volumen, einfachere Aufgaben; Long-Context zum Budget
Sol Ultra(nicht offengelegt)(nicht offengelegt)1,05M128KHöheres Effort-Tier von Sol, das in einigen veröffentlichten Benchmarks verwendet wird

Von OpenAI veröffentlichte Benchmarks (Sol / Terra / Luna):

  • Artificial Analysis Coding Agent Index v1.1: 80 / 77,4 / 74,6
  • SWE-Bench Pro: 64,6 % / 63,4 % / 62,7 % (Claude Fable 5 führt hier weiterhin)
  • Terminal-Bench 2.1: 88,8 % (Sol Ultra 91,9 %) / 87,4 % / 84,7 %
  • DeepSWE v1.1: 72,7 % / 69,6 % / 67,2 %
  • BrowseComp: 90,4 % (Sol Ultra 92,2 %) / 87,5 % / 83,3 %
  • ExploitBench: 73,5 % / 52,9 % / 33,2 %

Die letzte Zeile — ExploitBench — verdient einen zweiten Blick. Der Sol → Luna-Abfall von 73,5 % auf 33,2 % ist deutlich schärfer als jeder andere Benchmark der Liste, weshalb OpenAI die Cybersecurity-Story speziell für Sol betonte und weshalb Bundes-Prüfer das Modell für zusätzliche Tests zurückhielten, bevor sie es freigaben.

ChatGPT Work, entschlüsselt

Drücke Enter oder die Leertaste, um die Karte umzudrehen. Nutze die Pfeiltasten links und rechts, um zwischen den Karten zu wechseln.Begriff angezeigt.
1 / 6

Was aus Claude übertragbar ist (das meiste)

Deine Prompting-Instinkte funktionieren weiterhin. Klare Anweisungen, explizite Output-Formen, Few-Shot-Beispiele und Tools mit guten Beschreibungen — all das lässt sich übertragen, weil es Eigenschaften instruktions-tuned Frontier-Modelle sind, keine Claude-spezifischen Tricks. Für die tiefe Version dieses Arguments siehe Prompts über Modelle hinweg portieren und den praktischen Leitfaden ChatGPT für Claude-Nutzer.

Zwei Dinge, die du beim Wechsel zurücksetzen solltest:

  • API-Form. Anthropic verwendet einen tools-Block in der messages-API; OpenAI verwendet tools in den Chat Completions (oder der Responses API) mit dem OpenAI-Function-Calling-Schema. Gleiche Idee, anderes Wire-Format.
  • Reasoning als Modus, nicht nur als Slider. Claude exponiert einen Parameter für Thinking/Effort; bei GPT-5.6 zeigen sich die schärfsten Gewinne, wenn du das richtige Tier (Sol / Sol Ultra) wählst, statt nur den Effort am günstigen zu tunen. Kosten zählen mehr als bei GPT-5.5.

Probier's in ein paar Zeilen

Das OpenAI-SDK bleibt unverändert — richte model einfach auf eine GPT-5.6-Variante:

GPT-5.6 Sol aus Python aufrufen (OpenAI-SDK)

from openai import OpenAI

client = OpenAI()  # uses OPENAI_API_KEY

resp = client.chat.completions.create(
  model="gpt-5.6-sol",         # try gpt-5.6-terra / gpt-5.6-luna to trade cost for quality
  messages=[
      {"role": "system", "content": "You are a careful research agent. Use tools; verify before you conclude."},
      {"role": "user", "content": "Compare our 3 largest competitors on pricing, packaging, and 2026 launches."},
  ],
  # tools=[...]  # OpenAI-style function/tool schema
)

print(resp.choices[0].message.content)
Guided walkthrough1 of 4
  1. Sol für komplexes Coding, Agent-Schleifen oder alles, wo du zu einem Claude-Opus-Tier gegriffen hättest. Terra als das Standard-Arbeitspferd GPT-5.5 zum halben Preis. Luna für Retrieval, Extraktion, Klassifikation und andere hochvolumige Aufgaben — der gemeinsame 1,05-Mio.-Kontext macht es zu einer echten Option, nicht zu einem Spielzeug.

Wann du zu GPT-5.6 statt zu Claude greifst

Keines ist strikt besser. Greif zu GPT-5.6, wenn:

  • Du ein $1/$6-Tier mit einem 1,05-Mio.-Kontext brauchst. Luna ist derzeit der günstigste Weg zu Long-Context-Frontier-naher Qualität; das ist eine neue Fähigkeit, kein Rebrand.
  • Die Aufgabe browserlastig oder agent-index-förmig ist. BrowseComp und der Coding Agent Index sind Sols stärkste Karten. Wenn dein Agent die meiste Zeit im Browser oder in einer Shell verbringt, ist Sol das zu schlagende Modell.
  • Du den „Briefen und Vergessen"-Workflow von ChatGPT Work willst, um fertige Spreadsheets/Decks/Reports/Apps als Endnutzer-Artefakte zu produzieren, ohne selbst ein Agent-Framework zusammenzukleben.

Greif zu Claude, wenn du die verwaltete Plattform um das Modell haben willst — Prompt-Caching, Memory und Context Editing, Managed Agents, Computer Use, die Desktop-App — und speziell dann, wenn der Workload echtes Repo-Softwareengineering ist, wo Fable 5 SWE-Bench Pro immer noch mit großem Abstand anführt. Siehe Claude, GPT, Gemini für Coding für das laufende Head-to-Head und Was KI bei den Anbietern kostet für die Kostensicht.

Check yourself

0/3
  1. Welches GPT-5.6-Tier hat das kleinste Kontextfenster?
  2. Was ist ChatGPT Work in einer Zeile?
  3. Bei welchem von OpenAI veröffentlichten Benchmark führt Anthropics Claude Fable 5 weiterhin GPT-5.6 Sol an?

Quellen & weiterführende Lektüre