GPT-5.6 et ChatGPT Work pour les utilisateurs de Claude
Vous pensez déjà en Claude. Puis le 9 juillet 2026, toute la timeline a basculé : OpenAI a livré trois variantes de GPT-5.6 — Sol, Terra, Luna — et ChatGPT Work, un agent qui prend un objectif et travaille dessus en arrière-plan pendant des heures. Un collègue demande « on passe à Sol ? » ; un client veut que ChatGPT Work remplace la moitié d'un workflow que vous exécutez déjà dans Claude. Cette page cartographie le lancement sur votre modèle mental de Claude et — plus utile — extrait les parties que la couverture presse enterre : les vrais prix, les deltas exacts de benchmarks, les 1,05 M de contexte inattendus, et les endroits où OpenAI perd encore face à Anthropic.
- Apprendre ce qui a réellement été livré : Sol, Terra, Luna (plus Sol Ultra), tous avec une fenêtre de contexte de 1,05 M tokens
- Lire le tableau de benchmarks comme OpenAI ne l'a pas publié — où GPT-5.6 mène et où Claude Fable 5 gagne encore
- Comprendre ChatGPT Work : pas un mode de chat, mais un agent en arrière-plan qui rend un tableur, une présentation, un document ou une web app fini des heures plus tard
- Savoir quand se tourner vers GPT-5.6 Sol plutôt que Claude pour du code, des agents, des tâches navigateur — et quand la réponse reste Claude
La version en une phrase
GPT-5.6 est un rafraîchissement à trois tiers de la famille GPT-5 — Sol (flagship), Terra (milieu), Luna (budget) — partageant une fenêtre de contexte de 1,05 M tokens, une sortie maximale de 128 K, et une revendication publiée par OpenAI d'une efficacité tokens améliorée de 54 % sur le code agentique ; ChatGPT Work est le nouvel agent autonome construit dessus, livré comme une app desktop fusionnée qui a avalé Codex.
La partie intéressante n'est pas le rafraîchissement du modèle — c'était attendu. C'est la forme du lancement : OpenAI livre désormais modèle + agent + IDE comme un seul produit, et positionne le tier ouvrier (1 $ en entrée / 6 $ en sortie sur Luna) en dessous de là où les « modèles de code pas chers » se sont historiquement situés.
Trois choses sur le lancement GPT-5.6 qui surprennent
Tout le monde écrit le récap des benchmarks. Voici les parties que la plupart des utilisateurs Claude ratent à la première lecture.
1. Les trois tiers partagent le même contexte de 1,05 M
Ce n'est pas la façon dont OpenAI livre habituellement. Dans les rafraîchissements précédents, le tier bon marché venait avec une fenêtre de contexte rétrécie pour vous pousser vers le haut. Dans GPT-5.6, Sol, Terra et Luna citent tous un contexte de 1,05 M tokens et 128 K de sortie max — la même forme. Cela signifie que Luna à 1 $ en entrée / 6 $ en sortie par million de tokens est une option long-contexte viable, pas seulement pour les requêtes courtes, et cela change le calcul pour les pipelines RAG, la revue de dépôt complet et les longues boucles d'outils. Si vous prévoyiez un tier style Claude Haiku pour du travail de récupération à haut volume, Luna est maintenant le contre-check évident.
2. ChatGPT Work n'est pas « un mode de chat » — c'est un agent en arrière-plan qui vous rend un fichier fini
Le cadrage d'OpenAI est révélateur : vous ne chattez pas avec ChatGPT Work, vous le briefez. Il prend un résultat (« construis une analyse concurrentielle de ces cinq fournisseurs »), rassemble le contexte depuis vos apps et fichiers connectés, découpe le travail en étapes, travaille indépendamment pendant des minutes ou des heures, et livre un artefact fini — un tableur, un jeu de diapos, un document, un rapport ou une web app fonctionnelle. Codex a été plié dans la même app desktop, donc ChatGPT Work possède aussi la surface d'écriture de code. C'est le même pari « travail autonome de longue durée » qu'Anthropic a fait avec les agents gérés de Claude, mais livré d'abord comme un produit utilisateur final et ensuite comme une API. Il a été déployé sur Pro / Enterprise / Edu le jour du lancement, avec Plus et Business suivant dans les jours qui ont suivi.
3. Sol gagne les benchmarks publiés par OpenAI. Claude mène encore sur SWE-bench Pro.
Lisez au-delà du graphique marketing et le tableau est plus mitigé que « Sol est le nouveau roi ». Les propres chiffres d'OpenAI disent que Sol atteint 80 sur l'Artificial Analysis Coding Agent Index (environ +2,8 vs Claude Fable 5) tout en utilisant moins de la moitié des tokens de sortie à environ un tiers du coût. C'est une vraie victoire. Mais Fable 5 mène encore sur SWE-Bench Pro avec une marge rapportée large — Sol y arrive à ~64,6 % — et la couverture presse a tendance à enterrer cela. Traduction : choisissez par charge de travail, pas par communiqué de presse. Pour le travail style « agent index » outil-et-navigateur, Sol est maintenant le modèle à battre. Pour les vraies corrections de bugs sur dépôt réel avec du contexte significatif, Anthropic a encore l'avantage.
Le tableau des tiers GPT-5.6 (au 9 juillet 2026)
| Modèle | Entrée $/1M | Sortie $/1M | Contexte | Sortie max | Positionnement |
|---|---|---|---|---|---|
| Sol | 5 $ | 30 $ | 1,05 M | 128 K | Flagship : raisonnement complexe, code, science, agents |
| Terra | 2,50 $ | 15 $ | 1,05 M | 128 K | « Performance GPT-5.5 à ~la moitié du coût » — travail routinier |
| Luna | 1 $ | 6 $ | 1,05 M | 128 K | Tâches à haut volume, plus simples ; long-contexte à petit budget |
| Sol Ultra | (non divulgué) | (non divulgué) | 1,05 M | 128 K | Tier Sol à effort supérieur utilisé dans certains benchmarks publiés |
Benchmarks publiés par OpenAI (Sol / Terra / Luna) :
- Artificial Analysis Coding Agent Index v1.1 : 80 / 77,4 / 74,6
- SWE-Bench Pro : 64,6 % / 63,4 % / 62,7 % (Claude Fable 5 mène encore celui-ci)
- Terminal-Bench 2.1 : 88,8 % (Sol Ultra 91,9 %) / 87,4 % / 84,7 %
- DeepSWE v1.1 : 72,7 % / 69,6 % / 67,2 %
- BrowseComp : 90,4 % (Sol Ultra 92,2 %) / 87,5 % / 83,3 %
- ExploitBench : 73,5 % / 52,9 % / 33,2 %
Cette dernière ligne — ExploitBench — vaut le coup d'œil. La chute Sol → Luna de 73,5 % à 33,2 % est bien plus abrupte que n'importe quel autre benchmark de la liste, c'est pourquoi OpenAI s'est appuyé sur l'histoire cybersécurité pour Sol spécifiquement et pourquoi les examinateurs fédéraux ont retenu le modèle pour des tests supplémentaires avant de le laisser sortir.
ChatGPT Work, décodé
Ce qui se transfère depuis Claude (la plupart)
Vos instincts de prompting fonctionnent toujours. Instructions claires, formes de sortie explicites, exemples few-shot, et donner au modèle des outils avec de bonnes descriptions — tout se transfère, parce que ce sont des propriétés des modèles frontier instruits, pas des astuces spécifiques à Claude. Pour la version profonde de cet argument, voir porter des prompts entre modèles et le guide pratique ChatGPT pour les utilisateurs de Claude.
Deux choses à réinitialiser quand vous sautez :
- Forme de l'API. Anthropic utilise un bloc
toolssur l'APImessages; OpenAI utilisetoolssur Chat Completions (ou l'API Responses), avec le schéma function-calling d'OpenAI. Même idée, format de fil différent. - Raisonnement comme mode, pas juste comme curseur. Claude expose un paramètre thinking/effort ; sur GPT-5.6, les gains les plus tranchants apparaissent quand vous choisissez le bon tier (Sol / Sol Ultra) plutôt que juste régler l'effort sur le moins cher. Le coût compte plus qu'avec GPT-5.5.
Essayez-le en quelques lignes
Le SDK OpenAI est inchangé — pointez juste model sur une variante GPT-5.6 :
Appeler GPT-5.6 Sol depuis Python (SDK OpenAI)
from openai import OpenAI
client = OpenAI() # uses OPENAI_API_KEY
resp = client.chat.completions.create(
model="gpt-5.6-sol", # try gpt-5.6-terra / gpt-5.6-luna to trade cost for quality
messages=[
{"role": "system", "content": "You are a careful research agent. Use tools; verify before you conclude."},
{"role": "user", "content": "Compare our 3 largest competitors on pricing, packaging, and 2026 launches."},
],
# tools=[...] # OpenAI-style function/tool schema
)
print(resp.choices[0].message.content)- Sol pour le code complexe, les boucles d'agent, ou tout ce pour quoi vous auriez pris un tier Claude Opus. Terra comme workhorse par défaut « GPT-5.5 à la moitié du coût ». Luna pour la récupération, l'extraction, la classification et autres tâches à haut volume — le contexte partagé de 1,05 M en fait une vraie option, pas un jouet.
- Si la demande a un artefact définissable à la fin (tableur, deck, rapport, petite web app), briefez ChatGPT Work et laissez-le tourner. Si c'est une conversation ou une aide à la décision, restez sur un chat normal.
- Décrivez chaque outil comme une bonne spec produit : nom clair, but en une ligne, descriptions de paramètres avec exemples. GPT-5.6 répond à la même discipline « donne les outils comme à un junior » que Claude.
- Les prix Sol/Terra/Luna sont 6× plus chers en sortie qu'en entrée. La revendication d'efficacité de 54 % porte exactement sur la *sortie* — vérifiez-la sur votre charge de travail avant de migrer un budget Claude.
Quand se tourner vers GPT-5.6 plutôt que Claude
Aucun n'est strictement meilleur. Prenez GPT-5.6 quand :
- Vous avez besoin d'un tier à 1 $/6 $ avec un contexte de 1,05 M. Luna est actuellement le moyen le moins cher d'obtenir une qualité long-contexte proche du frontier ; c'est une nouvelle capacité, pas un rebranding.
- La tâche est lourde en navigation ou en forme d'agent-index. BrowseComp et le Coding Agent Index sont les cartes les plus fortes de Sol. Si votre agent passe la plupart de son temps dans un navigateur ou un shell, Sol est le modèle à battre.
- Vous voulez le workflow « brief et oublie » de ChatGPT Work pour produire tableurs/decks/rapports/apps finis comme artefacts utilisateur final, sans coller vous-même un framework d'agents.
Prenez Claude quand vous voulez la plateforme gérée autour du modèle — cache de prompt, mémoire et édition de contexte, agents gérés, computer use, l'app desktop — et spécifiquement quand la charge de travail est du génie logiciel sur dépôt réel, où Fable 5 mène encore SWE-Bench Pro par une large marge. Voir Claude, GPT, Gemini pour le code pour le duel en cours, et ce que coûte l'IA chez les fournisseurs pour la vue coût.
Check yourself
0/3Sources et lectures complémentaires
- OpenAI launches its new family of models with GPT-5.6 (TechCrunch, 9 juillet 2026) — couverture du lancement : variantes, prix, déploiement de ChatGPT Work, citation « 54 % d'efficacité tokens en plus », comparaison Fable 5
- OpenAI gets permission to roll out GPT-5.6 to the public on July 9 (Engadget) — processus d'examen gouvernemental, Center for AI Standards and Innovation, déploiement par phases
- OpenAI Debuts ChatGPT Work Workplace AI Agent With GPT-5.6 (Forbes) — citations Altman, positionnement en entreprise, comparateur Claude
- OpenAI Launches ChatGPT Work Agent to Handle Complex Tasks (Bloomberg) — cadrage autonomie « heures », fusion Codex
- GPT-5.6: Models Explained, Benchmarks & Access (CometAPI) — tableau complet des benchmarks (SWE-Bench Pro, Terminal-Bench 2.1, DeepSWE, BrowseComp, ExploitBench, Coding Agent Index), chiffres de contexte 1,05 M / sortie 128 K
- Liens sur AILmanac : ChatGPT pour les utilisateurs de Claude · Claude, GPT & Gemini pour le code · Porter des prompts entre modèles · Ce que coûte l'IA chez les fournisseurs · CLI d'agents de code comparés