Aller au contenu principal

Mise à jour GPT-5.6 d'août 2026 : curseur d'effort, bouton Think gratuit et le précipice tarifaire des 272K

Intermédiaire

Le 6 août 2026, OpenAI a livré une actualisation de mi-cycle de GPT-5.6 que la plupart des articles ont réduite à une seule phrase : « Sol est devenu plus intelligent, les utilisateurs gratuits ont des conversations illimitées ». La vraie mise à jour est plus intéressante — et plus conséquente si vous êtes un utilisateur de Claude qui utilise occasionnellement la pile OpenAI. Trois éléments ont changé en même temps : un contrôle d'effort fonctionne désormais à la fois dans l'interface ChatGPT (comme un curseur) et dans l'API (comme un paramètre à six niveaux) ; un bouton Think pour le niveau gratuit est livré la semaine suivante avec des conversations Luna illimitées ; et le précipice tarifaire pour long contexte à 272K tokens d'entrée interagit maladroitement avec le mode Fast, qui ne fonctionne que sur Sol. Chacun modifie une décision réelle.

Cette page extrait ces décisions du brouillard des notes de version et montre ce qui change réellement pour un développeur qui raisonne en termes de Claude.

What you'll learn
  • Voir exactement ce qui a été livré le 6 août 2026 pour GPT-5.6 — et ce qui a été livré la semaine du 10 août pour les utilisateurs gratuits
  • Comprendre le paramètre d'effort à six niveaux (`none, low, medium, high, xhigh, max`) et le mapper sur le modèle d'effort de réflexion de Claude
  • Apprendre le précipice tarifaire à 272K tokens d'entrée — et comment il peut doubler silencieusement un job que vous pensiez avoir budgété
  • Savoir quand le mode Fast aide, quand il ne fait rien, et quelles requêtes il refuse silencieusement
  • Décider quand la mise à jour est une vraie raison de basculer une charge de travail de Claude vers Sol — et quand elle ne l'est pas

Ce qui a réellement été livré le 6 août 2026

Trois choses concrètes. Le reste, c'est du polissage.

Guided walkthrough1 of 3
  1. Les utilisateurs Plus et Pro voient un nouveau curseur sur web, mobile et desktop qui définit combien de raisonnement ChatGPT utilise par réponse. Sous le capot, l'API expose la même molette comme `reasoning.effort` avec six positions — `none`, `low`, `medium`, `high`, `xhigh`, `max` — avec `medium` par défaut si omis. Cela remplace le comportement précédent « le modèle décide » : vous choisissez maintenant le niveau et vous le payez.

Le curseur d'effort — mapper les six niveaux sur un modèle mental Claude

Si vous avez pensé en termes du réglage d'effort à cinq niveaux de Claude (introduit avec Opus 5 en juillet), le modèle mental est similaire mais les étiquettes ne s'alignent pas proprement. GPT-5.6 a six niveaux là où Claude en a cinq, et la sémantique diffère aux deux extrémités.

Niveau GPT-5.6Ce qu'il faitÀ peu près comme Claude Opus 5
noneSaute complètement le raisonnement ; réponse instantanéePas d'équivalent direct — Claude planifie toujours un peu
lowChaîne de pensée courte, bon marchéEffort minimal
medium (défaut)Planification équilibrée ; le défaut livrélowmedium
highPlanification plus profonde ; plus lent, plus chermedium
xhighLongue délibération ; raisonnement multi-étapeshigh
maxPlafond de raisonnement complet — coûteuxmaximum

Deux conséquences pratiques :

  • Le défaut a bougé. Sur l'API, si vous omettez reasoning.effort, vous obtenez medium. Auparavant, de nombreux wrappers s'appuyaient sur la sélection automatique d'effort par le modèle ; ce comportement a disparu. L'explicite est maintenant requis pour un coût prévisible.
  • none est un vrai bouton. Il est vraiment utile pour les prompts de classification, l'extraction structurée ou les appels de routeur d'outils où les tokens de raisonnement sont un pur surcoût. Claude n'a pas d'interrupteur « off » proprement équivalent.

Un modèle de requête sûr qui fixe l'effort explicitement

{
"model": "gpt-5.6-sol",
"reasoning": { "effort": "low" },
"messages": [
  { "role": "system", "content": "Extract only. Output JSON." },
  { "role": "user", "content": "..." }
]
}

Le précipice tarifaire des 272K tokens — un vrai danger

C'est le changement le plus susceptible de faire flamber une facture de manière inattendue.

La règle : si l'entrée d'une requête franchit 272 000 tokens, la requête entière est re-tarifée à 2× le tarif d'entrée et 1,5× le tarif de sortie, pas seulement les tokens au-dessus de la ligne. Il n'y a pas de proratisation.

Deux choses à propos de cette règle comptent :

  1. C'est un précipice, pas une pente. Un prompt à 271 999 tokens d'entrée paie le tarif de base. Un prompt à 272 001 paie 2×/1,5× sur chaque token d'entrée et de sortie de l'appel — y compris les tokens de raisonnement que le modèle génère.
  2. Les longues conversations la franchissent progressivement. Les conversations multi-tours et les boucles d'agent accumulent l'historique. Une session qui commence sous 272K peut silencieusement franchir la ligne au tour 12 et re-tarifier chaque tour suivant.
Guided walkthrough1 of 3
  1. La tarification de base de GPT-5.6 Sol est de 5 $ / 30 $ par million (entrée / sortie), avec entrée en cache à 0,50 $. Au-dessus de 272K tokens d'entrée, le même appel coûte 10 $ / 45 $. Sur un document de 300K tokens avec 4K de sortie, le coût de base est de 1,62 $. Franchissez le précipice et cela devient 3,18 $ — presque 2× pour un seul token supplémentaire au-delà du seuil.

Mode Fast — les petites lignes à lire

Le mode Fast est une option réservée à Sol qui échange le prix contre la latence : jusqu'à 2,5× plus rapide à 2× le prix de l'API. Terra et Luna ne l'offrent pas.

Trois choses que le discours de lancement minimise :

  • « Jusqu'à » est un plafond, pas une norme. L'accélération réelle dépend de votre charge de travail — les appels d'outils, les sauts réseau et le taux de streaming plafonnent tous le gain réalisé bien en dessous de 2,5×.
  • Le mode Fast et le long contexte ne se mélangent pas proprement. OpenAI n'a pas publié de règle d'exclusion mutuelle, mais les premiers guides rapportent que les requêtes en mode Fast se comportent mal (ou se dégradent silencieusement) une fois que vous franchissez le seuil d'entrée de 272K. Traitez-les comme incompatibles jusqu'à ce qu'OpenAI documente le contraire.
  • Les tokens de raisonnement comptent toujours. Le mode Fast rend le débit plus rapide, mais un appel à effort max génère toujours le même volume de sortie de raisonnement. L'économie ne fonctionne que quand vous payez pour une latence que vous pouvez réellement sentir.
Pro tip
  • Le point d'équilibre du mode Fast est d'environ 25 % de débit en plus par dollar au plafond de 2,5× — pire quand le plafond n'est pas atteint.
  • Préférez le mode Fast pour le chat interactif où l'utilisateur attend. Sautez-le pour le batch, les agents d'arrière-plan et le RAG à long contexte.
  • Si vous alliez basculer un pipeline batch de Claude vers Sol pour le coût, n'activez pas le mode Fast — vous effacerez l'économie.

Niveau gratuit : Luna illimité + le bouton Think

Pour un utilisateur de Claude, cela compte moins que les changements de l'API, mais c'est le changement le plus susceptible d'apparaître dans une capture d'écran d'un ami et de déclencher une discussion.

  • Conversations texte illimitées sur GPT-5.6 Luna pour les utilisateurs gratuits de ChatGPT, à partir de la semaine du 10 août 2026. Précédemment plafonnées.
  • Bouton Think sur les conversations gratuites, même fenêtre. Ajoute une passe de raisonnement plus profonde à un message spécifique, sous réserve des protections contre les abus. Ce n'est pas la même interface que le curseur d'effort Plus/Pro — c'est un bascule par message, pas un réglage à l'échelle de la session.

La lecture pratique : OpenAI défend agressivement le niveau gratuit maintenant que Claude et Gemini ont tous deux des options de raisonnement gratuit généreuses. Attendez-vous à ce que le plafond de protection contre les abus soit serré pendant les premières semaines.

Où cette mise à jour change réellement la décision d'un utilisateur de Claude

Pour la plupart des charges de travail Claude, la réponse reste la même. Pour trois patterns spécifiques, elle bouge.

Guided walkthrough1 of 3
  1. `reasoning.effort: none` sur Sol Luna est maintenant une option plausiblement moins chère qu'un appel Claude Haiku à effort minimum pour le routage à haut volume, l'extraction de tags ou l'étiquetage structuré — à condition que vos prompts restent bien en dessous de 272K. Testez-le sur un échantillon représentatif avant de basculer.

Notes de migration pour le code API GPT-5.6 existant

Si vous avez livré sur Sol avant le 6 août, deux choses doivent changer :

  • Définissez reasoning.effort explicitement sur chaque appel. L'omettre vous coûte maintenant medium ; vous vouliez probablement low pour la plupart.
  • Ajoutez une garde à 272K à la frontière de votre pipeline. Rejetez ou découpez les requêtes dont les tokens d'entrée poussent au-delà du seuil. Une vérification bête de len(input) / 4 comme approximation suffit comme première ligne de défense.

Un one-liner de garde-fou pour les wrappers Node.js

if (estimateTokens(input) > 260_000) { chunkOrReject(input); }

Ce que cela n'inclut pas

Deux rumeurs qui circulaient autour de cette mise à jour n'en font pas partie :

  • GPT-6 (Astra). Rumorisé pour août dans certains médias, mais au 11 août 2026, OpenAI n'a pas confirmé de date de lancement, de fiche modèle ou de tarification. Voir notre page aperçu OpenAI Astra pour ce qui est réellement connu par rapport à ce qui est spéculé.
  • Baisse de prix de Sol. Le tarif de base de 5 $ / 30 $ n'a pas changé. Certaines couvertures ont confondu le précipice à 272K (une surtaxe) avec un changement de prix.

Essayez-le

Check yourself

0/4
  1. Vous envoyez un prompt d'entrée de 300 000 tokens à GPT-5.6 Sol au tarif de base. Grossièrement, qu'arrive-t-il au coût comparé à l'envoi de 271 000 tokens ?
  2. Sur l'API, vous omettez `reasoning.effort` sur un appel GPT-5.6 Sol après la mise à jour du 6 août. Quel niveau d'effort obtenez-vous ?
  3. Laquelle de ces charges de travail bénéficie le plus du mode Fast ?
  4. Quel changement de comportement OpenAI a-t-il livré pour GPT-5.6 Sol le 6 août 2026 ?

Sources et lectures complémentaires

Liens croisés dans AILmanac :