Mise à jour GPT-5.6 d'août 2026 : curseur d'effort, bouton Think gratuit et le précipice tarifaire des 272K
Le 6 août 2026, OpenAI a livré une actualisation de mi-cycle de GPT-5.6 que la plupart des articles ont réduite à une seule phrase : « Sol est devenu plus intelligent, les utilisateurs gratuits ont des conversations illimitées ». La vraie mise à jour est plus intéressante — et plus conséquente si vous êtes un utilisateur de Claude qui utilise occasionnellement la pile OpenAI. Trois éléments ont changé en même temps : un contrôle d'effort fonctionne désormais à la fois dans l'interface ChatGPT (comme un curseur) et dans l'API (comme un paramètre à six niveaux) ; un bouton Think pour le niveau gratuit est livré la semaine suivante avec des conversations Luna illimitées ; et le précipice tarifaire pour long contexte à 272K tokens d'entrée interagit maladroitement avec le mode Fast, qui ne fonctionne que sur Sol. Chacun modifie une décision réelle.
Cette page extrait ces décisions du brouillard des notes de version et montre ce qui change réellement pour un développeur qui raisonne en termes de Claude.
- Voir exactement ce qui a été livré le 6 août 2026 pour GPT-5.6 — et ce qui a été livré la semaine du 10 août pour les utilisateurs gratuits
- Comprendre le paramètre d'effort à six niveaux (`none, low, medium, high, xhigh, max`) et le mapper sur le modèle d'effort de réflexion de Claude
- Apprendre le précipice tarifaire à 272K tokens d'entrée — et comment il peut doubler silencieusement un job que vous pensiez avoir budgété
- Savoir quand le mode Fast aide, quand il ne fait rien, et quelles requêtes il refuse silencieusement
- Décider quand la mise à jour est une vraie raison de basculer une charge de travail de Claude vers Sol — et quand elle ne l'est pas
Ce qui a réellement été livré le 6 août 2026
Trois choses concrètes. Le reste, c'est du polissage.
- Les utilisateurs Plus et Pro voient un nouveau curseur sur web, mobile et desktop qui définit combien de raisonnement ChatGPT utilise par réponse. Sous le capot, l'API expose la même molette comme `reasoning.effort` avec six positions — `none`, `low`, `medium`, `high`, `xhigh`, `max` — avec `medium` par défaut si omis. Cela remplace le comportement précédent « le modèle décide » : vous choisissez maintenant le niveau et vous le payez.
- OpenAI a mis à jour Sol pour donner des « réponses plus directes, utiliser un formatage plus serré, et éviter les détails supplémentaires quand ils n'aident pas », pour adapter le détail à la question, et pour être « moins susceptible d'être d'accord quand une correction serait plus utile » — le plus près qu'OpenAI ait été de livrer une passe anti-flagornerie explicite. Les évaluations internes sur des prompts financiers, médicaux et juridiques ont rapporté que les erreurs factuelles étaient « 68 % moins fréquentes » que dans le GPT-5.5 Instant retiré.
- Les utilisateurs gratuits reçoivent des conversations texte illimitées sur GPT-5.6 Luna (précédemment plafonnées) et un nouveau bouton Think pour un raisonnement plus profond sur les questions plus difficiles, « sous réserve des protections contre les abus ». Le bouton Think n'était pas actif le 6 août — il a été déployé la semaine suivante.
Le curseur d'effort — mapper les six niveaux sur un modèle mental Claude
Si vous avez pensé en termes du réglage d'effort à cinq niveaux de Claude (introduit avec Opus 5 en juillet), le modèle mental est similaire mais les étiquettes ne s'alignent pas proprement. GPT-5.6 a six niveaux là où Claude en a cinq, et la sémantique diffère aux deux extrémités.
| Niveau GPT-5.6 | Ce qu'il fait | À peu près comme Claude Opus 5 |
|---|---|---|
none | Saute complètement le raisonnement ; réponse instantanée | Pas d'équivalent direct — Claude planifie toujours un peu |
low | Chaîne de pensée courte, bon marché | Effort minimal |
medium (défaut) | Planification équilibrée ; le défaut livré | low–medium |
high | Planification plus profonde ; plus lent, plus cher | medium |
xhigh | Longue délibération ; raisonnement multi-étapes | high |
max | Plafond de raisonnement complet — coûteux | maximum |
Deux conséquences pratiques :
- Le défaut a bougé. Sur l'API, si vous omettez
reasoning.effort, vous obtenezmedium. Auparavant, de nombreux wrappers s'appuyaient sur la sélection automatique d'effort par le modèle ; ce comportement a disparu. L'explicite est maintenant requis pour un coût prévisible. noneest un vrai bouton. Il est vraiment utile pour les prompts de classification, l'extraction structurée ou les appels de routeur d'outils où les tokens de raisonnement sont un pur surcoût. Claude n'a pas d'interrupteur « off » proprement équivalent.
Un modèle de requête sûr qui fixe l'effort explicitement
{
"model": "gpt-5.6-sol",
"reasoning": { "effort": "low" },
"messages": [
{ "role": "system", "content": "Extract only. Output JSON." },
{ "role": "user", "content": "..." }
]
}Le précipice tarifaire des 272K tokens — un vrai danger
C'est le changement le plus susceptible de faire flamber une facture de manière inattendue.
La règle : si l'entrée d'une requête franchit 272 000 tokens, la requête entière est re-tarifée à 2× le tarif d'entrée et 1,5× le tarif de sortie, pas seulement les tokens au-dessus de la ligne. Il n'y a pas de proratisation.
Deux choses à propos de cette règle comptent :
- C'est un précipice, pas une pente. Un prompt à 271 999 tokens d'entrée paie le tarif de base. Un prompt à 272 001 paie 2×/1,5× sur chaque token d'entrée et de sortie de l'appel — y compris les tokens de raisonnement que le modèle génère.
- Les longues conversations la franchissent progressivement. Les conversations multi-tours et les boucles d'agent accumulent l'historique. Une session qui commence sous 272K peut silencieusement franchir la ligne au tour 12 et re-tarifier chaque tour suivant.
- La tarification de base de GPT-5.6 Sol est de 5 $ / 30 $ par million (entrée / sortie), avec entrée en cache à 0,50 $. Au-dessus de 272K tokens d'entrée, le même appel coûte 10 $ / 45 $. Sur un document de 300K tokens avec 4K de sortie, le coût de base est de 1,62 $. Franchissez le précipice et cela devient 3,18 $ — presque 2× pour un seul token supplémentaire au-delà du seuil.
- Deux appels de 200K coûtent 2 $ en entrée. Un seul appel de 400K coûte 8 $ (2× d'entrée sur toute la requête). Le découpage est 4× moins cher en entrée si l'un des morceaux reste en dessous de 272K. Ne remplissez tout que lorsque vous avez vraiment besoin que le modèle voie tout en même temps.
- L'entrée en cache à 0,50 $ reste en cache à 0,50 $ jusqu'à 272K. Au-dessus du précipice, le multiplicateur s'applique à chaque token tarifé — y compris l'entrée non mise en cache au-dessus du préfixe mis en cache. Un préfixe stable de 250K en cache plus une queue croissante peut silencieusement vous faire dépasser.
Mode Fast — les petites lignes à lire
Le mode Fast est une option réservée à Sol qui échange le prix contre la latence : jusqu'à 2,5× plus rapide à 2× le prix de l'API. Terra et Luna ne l'offrent pas.
Trois choses que le discours de lancement minimise :
- « Jusqu'à » est un plafond, pas une norme. L'accélération réelle dépend de votre charge de travail — les appels d'outils, les sauts réseau et le taux de streaming plafonnent tous le gain réalisé bien en dessous de 2,5×.
- Le mode Fast et le long contexte ne se mélangent pas proprement. OpenAI n'a pas publié de règle d'exclusion mutuelle, mais les premiers guides rapportent que les requêtes en mode Fast se comportent mal (ou se dégradent silencieusement) une fois que vous franchissez le seuil d'entrée de 272K. Traitez-les comme incompatibles jusqu'à ce qu'OpenAI documente le contraire.
- Les tokens de raisonnement comptent toujours. Le mode Fast rend le débit plus rapide, mais un appel à effort
maxgénère toujours le même volume de sortie de raisonnement. L'économie ne fonctionne que quand vous payez pour une latence que vous pouvez réellement sentir.
- Le point d'équilibre du mode Fast est d'environ 25 % de débit en plus par dollar au plafond de 2,5× — pire quand le plafond n'est pas atteint.
- Préférez le mode Fast pour le chat interactif où l'utilisateur attend. Sautez-le pour le batch, les agents d'arrière-plan et le RAG à long contexte.
- Si vous alliez basculer un pipeline batch de Claude vers Sol pour le coût, n'activez pas le mode Fast — vous effacerez l'économie.
Niveau gratuit : Luna illimité + le bouton Think
Pour un utilisateur de Claude, cela compte moins que les changements de l'API, mais c'est le changement le plus susceptible d'apparaître dans une capture d'écran d'un ami et de déclencher une discussion.
- Conversations texte illimitées sur GPT-5.6 Luna pour les utilisateurs gratuits de ChatGPT, à partir de la semaine du 10 août 2026. Précédemment plafonnées.
- Bouton Think sur les conversations gratuites, même fenêtre. Ajoute une passe de raisonnement plus profonde à un message spécifique, sous réserve des protections contre les abus. Ce n'est pas la même interface que le curseur d'effort Plus/Pro — c'est un bascule par message, pas un réglage à l'échelle de la session.
La lecture pratique : OpenAI défend agressivement le niveau gratuit maintenant que Claude et Gemini ont tous deux des options de raisonnement gratuit généreuses. Attendez-vous à ce que le plafond de protection contre les abus soit serré pendant les premières semaines.
Où cette mise à jour change réellement la décision d'un utilisateur de Claude
Pour la plupart des charges de travail Claude, la réponse reste la même. Pour trois patterns spécifiques, elle bouge.
- `reasoning.effort: none` sur Sol Luna est maintenant une option plausiblement moins chère qu'un appel Claude Haiku à effort minimum pour le routage à haut volume, l'extraction de tags ou l'étiquetage structuré — à condition que vos prompts restent bien en dessous de 272K. Testez-le sur un échantillon représentatif avant de basculer.
- Sol + mode Fast est maintenant le niveau de qualité le plus rapide qu'OpenAI livre. Si un utilisateur attend à chaque réponse et que vos prompts tiennent sous 272K, c'est la mise à jour qui change le plus le compromis. Pour les exécutions d'agents en arrière-plan, ignorez-la.
- Le précipice à 272K signifie que vous devriez concevoir en le prenant en compte. Le contexte 1M de Claude Opus 5 et le contexte 1,05M de Sol vont tous deux bien au-delà de 272K, mais Claude n'a pas de précipice de la même forme — sa tarification de long contexte est plate. Pour les opérations à l'échelle du repo à 400K+ d'entrée, Claude a actuellement l'avantage de coût.
Notes de migration pour le code API GPT-5.6 existant
Si vous avez livré sur Sol avant le 6 août, deux choses doivent changer :
- Définissez
reasoning.effortexplicitement sur chaque appel. L'omettre vous coûte maintenantmedium; vous vouliez probablementlowpour la plupart. - Ajoutez une garde à 272K à la frontière de votre pipeline. Rejetez ou découpez les requêtes dont les tokens d'entrée poussent au-delà du seuil. Une vérification bête de
len(input) / 4comme approximation suffit comme première ligne de défense.
Un one-liner de garde-fou pour les wrappers Node.js
if (estimateTokens(input) > 260_000) { chunkOrReject(input); }Ce que cela n'inclut pas
Deux rumeurs qui circulaient autour de cette mise à jour n'en font pas partie :
- GPT-6 (Astra). Rumorisé pour août dans certains médias, mais au 11 août 2026, OpenAI n'a pas confirmé de date de lancement, de fiche modèle ou de tarification. Voir notre page aperçu OpenAI Astra pour ce qui est réellement connu par rapport à ce qui est spéculé.
- Baisse de prix de Sol. Le tarif de base de 5 $ / 30 $ n'a pas changé. Certaines couvertures ont confondu le précipice à 272K (une surtaxe) avec un changement de prix.
Essayez-le
Check yourself
0/4Sources et lectures complémentaires
- OpenAI : Mises à jour GPT-5.6 d'août 2026 (PDF) — la source primaire pour la passe comportementale du 6 août et le déploiement du niveau gratuit
- Notes de version ChatGPT (Centre d'aide OpenAI) — notes de version canoniques côté ChatGPT
- Notes de version des modèles (Centre d'aide OpenAI) — notes de comportement des modèles API
- 9to5Mac : OpenAI met à jour ChatGPT avec un GPT-5.6 Sol plus intelligent et des conversations gratuites illimitées (6 août 2026)
- Visual Studio Magazine : GPT-5.6 Sol monte pour l'efficacité des tokens (6 août 2026)
- AIToolsReview : Revue GPT-5.6 — Août 2026 — détails sur le curseur d'effort et le précipice 272K
- Kingy AI : Mode Fast GPT-5.6 — Vitesse, Tarification et Compromis — multiplicateur de prix du mode Fast et mises en garde
- Coursiv Blog : GPT-5.6 Sol — Benchmarks, Tarification API et Revue — paramètre API
reasoning.effortà six niveaux - BenchLM : Benchmarks et tarification GPT-5.6 Sol — tarification de base et comparaisons de benchmarks
Liens croisés dans AILmanac :
- GPT-5.6 et ChatGPT Work pour les utilisateurs de Claude — la page de lancement du 9 juillet 2026
- Inférence rapide et vitesse des tokens — comment les produits de niveau Fast se comparent entre fournisseurs
- Guide de terrain Opus 5 — pour le côté Claude de la comparaison des niveaux d'effort
- Aperçu OpenAI Astra — ce qui est rumorisé pour la prochaine génération OpenAI, et ce qui est réellement confirmé