Aller au contenu principal

GPT-5.6 et ChatGPT Work pour les utilisateurs de Claude

Intermédiaire

Vous pensez déjà en Claude. Puis le 9 juillet 2026, toute la timeline a basculé : OpenAI a livré trois variantes de GPT-5.6 — Sol, Terra, Luna — et ChatGPT Work, un agent qui prend un objectif et travaille dessus en arrière-plan pendant des heures. Un collègue demande « on passe à Sol ? » ; un client veut que ChatGPT Work remplace la moitié d'un workflow que vous exécutez déjà dans Claude. Cette page cartographie le lancement sur votre modèle mental de Claude et — plus utile — extrait les parties que la couverture presse enterre : les vrais prix, les deltas exacts de benchmarks, les 1,05 M de contexte inattendus, et les endroits où OpenAI perd encore face à Anthropic.

What you'll learn
  • Apprendre ce qui a réellement été livré : Sol, Terra, Luna (plus Sol Ultra), tous avec une fenêtre de contexte de 1,05 M tokens
  • Lire le tableau de benchmarks comme OpenAI ne l'a pas publié — où GPT-5.6 mène et où Claude Fable 5 gagne encore
  • Comprendre ChatGPT Work : pas un mode de chat, mais un agent en arrière-plan qui rend un tableur, une présentation, un document ou une web app fini des heures plus tard
  • Savoir quand se tourner vers GPT-5.6 Sol plutôt que Claude pour du code, des agents, des tâches navigateur — et quand la réponse reste Claude

La version en une phrase

GPT-5.6 est un rafraîchissement à trois tiers de la famille GPT-5 — Sol (flagship), Terra (milieu), Luna (budget) — partageant une fenêtre de contexte de 1,05 M tokens, une sortie maximale de 128 K, et une revendication publiée par OpenAI d'une efficacité tokens améliorée de 54 % sur le code agentique ; ChatGPT Work est le nouvel agent autonome construit dessus, livré comme une app desktop fusionnée qui a avalé Codex.

La partie intéressante n'est pas le rafraîchissement du modèle — c'était attendu. C'est la forme du lancement : OpenAI livre désormais modèle + agent + IDE comme un seul produit, et positionne le tier ouvrier (1 $ en entrée / 6 $ en sortie sur Luna) en dessous de là où les « modèles de code pas chers » se sont historiquement situés.

Trois choses sur le lancement GPT-5.6 qui surprennent

Tout le monde écrit le récap des benchmarks. Voici les parties que la plupart des utilisateurs Claude ratent à la première lecture.

1. Les trois tiers partagent le même contexte de 1,05 M

Ce n'est pas la façon dont OpenAI livre habituellement. Dans les rafraîchissements précédents, le tier bon marché venait avec une fenêtre de contexte rétrécie pour vous pousser vers le haut. Dans GPT-5.6, Sol, Terra et Luna citent tous un contexte de 1,05 M tokens et 128 K de sortie max — la même forme. Cela signifie que Luna à 1 $ en entrée / 6 $ en sortie par million de tokens est une option long-contexte viable, pas seulement pour les requêtes courtes, et cela change le calcul pour les pipelines RAG, la revue de dépôt complet et les longues boucles d'outils. Si vous prévoyiez un tier style Claude Haiku pour du travail de récupération à haut volume, Luna est maintenant le contre-check évident.

2. ChatGPT Work n'est pas « un mode de chat » — c'est un agent en arrière-plan qui vous rend un fichier fini

Le cadrage d'OpenAI est révélateur : vous ne chattez pas avec ChatGPT Work, vous le briefez. Il prend un résultat (« construis une analyse concurrentielle de ces cinq fournisseurs »), rassemble le contexte depuis vos apps et fichiers connectés, découpe le travail en étapes, travaille indépendamment pendant des minutes ou des heures, et livre un artefact fini — un tableur, un jeu de diapos, un document, un rapport ou une web app fonctionnelle. Codex a été plié dans la même app desktop, donc ChatGPT Work possède aussi la surface d'écriture de code. C'est le même pari « travail autonome de longue durée » qu'Anthropic a fait avec les agents gérés de Claude, mais livré d'abord comme un produit utilisateur final et ensuite comme une API. Il a été déployé sur Pro / Enterprise / Edu le jour du lancement, avec Plus et Business suivant dans les jours qui ont suivi.

3. Sol gagne les benchmarks publiés par OpenAI. Claude mène encore sur SWE-bench Pro.

Lisez au-delà du graphique marketing et le tableau est plus mitigé que « Sol est le nouveau roi ». Les propres chiffres d'OpenAI disent que Sol atteint 80 sur l'Artificial Analysis Coding Agent Index (environ +2,8 vs Claude Fable 5) tout en utilisant moins de la moitié des tokens de sortie à environ un tiers du coût. C'est une vraie victoire. Mais Fable 5 mène encore sur SWE-Bench Pro avec une marge rapportée large — Sol y arrive à ~64,6 % — et la couverture presse a tendance à enterrer cela. Traduction : choisissez par charge de travail, pas par communiqué de presse. Pour le travail style « agent index » outil-et-navigateur, Sol est maintenant le modèle à battre. Pour les vraies corrections de bugs sur dépôt réel avec du contexte significatif, Anthropic a encore l'avantage.

Le tableau des tiers GPT-5.6 (au 9 juillet 2026)

ModèleEntrée $/1MSortie $/1MContexteSortie maxPositionnement
Sol5 $30 $1,05 M128 KFlagship : raisonnement complexe, code, science, agents
Terra2,50 $15 $1,05 M128 K« Performance GPT-5.5 à ~la moitié du coût » — travail routinier
Luna1 $6 $1,05 M128 KTâches à haut volume, plus simples ; long-contexte à petit budget
Sol Ultra(non divulgué)(non divulgué)1,05 M128 KTier Sol à effort supérieur utilisé dans certains benchmarks publiés

Benchmarks publiés par OpenAI (Sol / Terra / Luna) :

  • Artificial Analysis Coding Agent Index v1.1 : 80 / 77,4 / 74,6
  • SWE-Bench Pro : 64,6 % / 63,4 % / 62,7 % (Claude Fable 5 mène encore celui-ci)
  • Terminal-Bench 2.1 : 88,8 % (Sol Ultra 91,9 %) / 87,4 % / 84,7 %
  • DeepSWE v1.1 : 72,7 % / 69,6 % / 67,2 %
  • BrowseComp : 90,4 % (Sol Ultra 92,2 %) / 87,5 % / 83,3 %
  • ExploitBench : 73,5 % / 52,9 % / 33,2 %

Cette dernière ligne — ExploitBench — vaut le coup d'œil. La chute Sol → Luna de 73,5 % à 33,2 % est bien plus abrupte que n'importe quel autre benchmark de la liste, c'est pourquoi OpenAI s'est appuyé sur l'histoire cybersécurité pour Sol spécifiquement et pourquoi les examinateurs fédéraux ont retenu le modèle pour des tests supplémentaires avant de le laisser sortir.

ChatGPT Work, décodé

Appuyez sur Entrée ou Espace pour retourner la carte. Utilisez les flèches gauche et droite pour naviguer entre les cartes.Terme affiché.
1 / 6

Ce qui se transfère depuis Claude (la plupart)

Vos instincts de prompting fonctionnent toujours. Instructions claires, formes de sortie explicites, exemples few-shot, et donner au modèle des outils avec de bonnes descriptions — tout se transfère, parce que ce sont des propriétés des modèles frontier instruits, pas des astuces spécifiques à Claude. Pour la version profonde de cet argument, voir porter des prompts entre modèles et le guide pratique ChatGPT pour les utilisateurs de Claude.

Deux choses à réinitialiser quand vous sautez :

  • Forme de l'API. Anthropic utilise un bloc tools sur l'API messages ; OpenAI utilise tools sur Chat Completions (ou l'API Responses), avec le schéma function-calling d'OpenAI. Même idée, format de fil différent.
  • Raisonnement comme mode, pas juste comme curseur. Claude expose un paramètre thinking/effort ; sur GPT-5.6, les gains les plus tranchants apparaissent quand vous choisissez le bon tier (Sol / Sol Ultra) plutôt que juste régler l'effort sur le moins cher. Le coût compte plus qu'avec GPT-5.5.

Essayez-le en quelques lignes

Le SDK OpenAI est inchangé — pointez juste model sur une variante GPT-5.6 :

Appeler GPT-5.6 Sol depuis Python (SDK OpenAI)

from openai import OpenAI

client = OpenAI()  # uses OPENAI_API_KEY

resp = client.chat.completions.create(
  model="gpt-5.6-sol",         # try gpt-5.6-terra / gpt-5.6-luna to trade cost for quality
  messages=[
      {"role": "system", "content": "You are a careful research agent. Use tools; verify before you conclude."},
      {"role": "user", "content": "Compare our 3 largest competitors on pricing, packaging, and 2026 launches."},
  ],
  # tools=[...]  # OpenAI-style function/tool schema
)

print(resp.choices[0].message.content)
Guided walkthrough1 of 4
  1. Sol pour le code complexe, les boucles d'agent, ou tout ce pour quoi vous auriez pris un tier Claude Opus. Terra comme workhorse par défaut « GPT-5.5 à la moitié du coût ». Luna pour la récupération, l'extraction, la classification et autres tâches à haut volume — le contexte partagé de 1,05 M en fait une vraie option, pas un jouet.

Quand se tourner vers GPT-5.6 plutôt que Claude

Aucun n'est strictement meilleur. Prenez GPT-5.6 quand :

  • Vous avez besoin d'un tier à 1 $/6 $ avec un contexte de 1,05 M. Luna est actuellement le moyen le moins cher d'obtenir une qualité long-contexte proche du frontier ; c'est une nouvelle capacité, pas un rebranding.
  • La tâche est lourde en navigation ou en forme d'agent-index. BrowseComp et le Coding Agent Index sont les cartes les plus fortes de Sol. Si votre agent passe la plupart de son temps dans un navigateur ou un shell, Sol est le modèle à battre.
  • Vous voulez le workflow « brief et oublie » de ChatGPT Work pour produire tableurs/decks/rapports/apps finis comme artefacts utilisateur final, sans coller vous-même un framework d'agents.

Prenez Claude quand vous voulez la plateforme gérée autour du modèle — cache de prompt, mémoire et édition de contexte, agents gérés, computer use, l'app desktop — et spécifiquement quand la charge de travail est du génie logiciel sur dépôt réel, où Fable 5 mène encore SWE-Bench Pro par une large marge. Voir Claude, GPT, Gemini pour le code pour le duel en cours, et ce que coûte l'IA chez les fournisseurs pour la vue coût.

Check yourself

0/3
  1. Quel tier GPT-5.6 a la plus petite fenêtre de contexte ?
  2. Qu'est-ce que ChatGPT Work, en une ligne ?
  3. Sur quel benchmark publié par OpenAI Claude Fable 5 d'Anthropic mène-t-il encore GPT-5.6 Sol ?

Sources et lectures complémentaires