Aller au contenu principal

Le seuil cyber « Critique » : ce qu'OpenAI vient de déclencher avec Astra

Intermédiaire

Le 7 août 2026, OpenAI a publié un billet intitulé « Responding to the next frontier of critical cyber capabilities » et a annoncé à la presse qu'il suspendait certaines parties du développement interne de son modèle non publié Astra. La raison : des évaluations préliminaires des derniers jours ont conduit OpenAI à conclure qu'il ne peut actuellement pas exclure qu'Astra ait atteint le niveau de capacité cybersécurité Critique de son propre Preparedness Framework.

C'est une première. Le Preparedness Framework existe depuis décembre 2023. Aucun modèle de pointe — ni GPT-4, ni GPT-4o, ni GPT-5.6 Sol, ni aucun modèle Anthropic ou Google évalué publiquement — n'avait auparavant amené son propre laboratoire à lever le drapeau Critique. GPT-5.6 Sol s'est classé High sur la piste cyber et a été livré avec des mesures d'atténuation. Astra est le premier candidat à avoir fait dire à OpenAI, par écrit, nous ne pouvons peut-être pas déployer ceci comme nous déployons tout le reste.

Cette page est l'explicateur pratique qui (au moment de l'écriture) n'a été écrit par personne d'autre. Pas un simple relais d'actualité. Ce que Critique signifie réellement en tant que définition technique, ce qui se passe opérationnellement quand un laboratoire le dit, pourquoi cela compte même si vous ne touchez jamais à Astra, et comment cela s'aligne avec le cadre parallèle d'Anthropic afin que vous puissiez lire la prochaine annonce de ce type sans traducteur.

What you'll learn
  • Comprendre les quatre niveaux de capacité du Preparedness Framework (Low / Medium / High / Critical) et ce qui déclenche une réévaluation
  • Connaître la définition exacte de « Critique cyber » — bien plus étroite et spécifique que « le modèle est bon en hacking »
  • Voir la réponse opérationnelle concrète appliquée par OpenAI à Astra : environnements isolés, exécution en bac à sable, chiffrement des poids, surveillance de la chaîne de pensée, travaux suspendus
  • Cartographier le Preparedness Framework d'OpenAI sur la Responsible Scaling Policy / les niveaux ASL d'Anthropic afin de pouvoir raisonner sur les deux dans les mêmes unités
  • Retenir trois choses qu'un constructeur livrant sur des modèles de pointe devrait vraiment changer cette semaine

Ce qui s'est réellement passé, en un paragraphe

Entre le 1er et le 7 août 2026 environ, OpenAI a mené une série d'évaluations internes en cybersécurité et codage agentique sur Astra — la famille de modèles teasée le 1er août avec dix preuves mathématiques formalisées en Lean-4. Les évaluations ont montré des sauts importants par rapport aux modèles précédents. Assez importants pour que l'équipe Preparedness d'OpenAI conclue qu'elle ne pouvait pas exclure la possibilité qu'Astra se situe au niveau de capacité cyber Critique. OpenAI a annoncé publiquement qu'il étendait les tests de sécurité, renforçait les contrôles de sécurité et suspendait certains travaux internes qui ne respectaient pas les nouveaux contrôles. Il a également indiqué qu'il prévoit de mener d'autres tests avec des agences gouvernementales et des organisations indépendantes de sécurité IA avant une publication large. Astra n'est pas annulé. Sa publication est conditionnelle soit à une baisse de la capacité estimée, soit à la mise en place des mesures d'atténuation exigées par le cadre pour un modèle de niveau Critique.

Pour le contexte sur le modèle lui-même, voir OpenAI Astra : la note de terrain preview.

Le Preparedness Framework en 90 secondes

Le Preparedness Framework d'OpenAI — la version en vigueur est v2 — est un document qui dit : avant de livrer un modèle de pointe, nous l'évaluons dans un ensemble de domaines de capacité suivis, et chaque domaine a quatre niveaux. Les niveaux sont communs à tous les domaines :

NiveauSignification (simplifiée)
LowNiveau de référence. Le modèle n'augmente pas significativement la capacité de l'attaquant.
MediumAmélioration non triviale pour les attaquants. Livraison avec les mesures d'atténuation standard.
HighAmélioration sérieuse. Livraison uniquement avec les contrôles de sécurité et de déploiement « High » (isolation des poids, restrictions de déploiement, surveillance).
CriticalLe modèle peut mener de manière autonome des opérations de bout en bout dans le domaine contre des cibles réelles durcies. Ne pas déployer sans qu'un ensemble spécifique de garde-fous engagés au préalable ne soit d'abord en place.

Les domaines actuellement suivis par OpenAI sous Preparedness v2 incluent (paraphrasés) : cyber, biologique / chimique, auto-amélioration de l'IA et autonomie du modèle. Chacun a ses propres définitions pour les quatre niveaux. Ainsi, un modèle peut par exemple être Medium en cyber et High en bio.

Le cadre est un engagement sur le processus, pas une promesse que le modèle ne sera jamais mauvais dans quoi que ce soit. N'importe qui peut lire le PDF actuel sur cdn.openai.com/pdf/18a02b5d-6b67-4cec-ab64-68cdfbddebcd/preparedness-framework-v2.pdf.

Pourquoi le niveau juste en dessous de Critique (High) ne suffit pas ici

GPT-5.6 Sol a été placé en High sur cyber et livré avec les contrôles standard du niveau High — verrouillage de déploiement, surveillance des abus, pas de fine-tuning sur du savoir-faire offensif, sécurité des poids. Cet ensemble de contrôles est calibré pour un modèle qui assiste significativement un attaquant qui doit encore faire l'essentiel du travail.

Critique est un régime différent. Un modèle cyber de niveau Critique est un modèle où l'humain n'est pas dans la boucle pour la partie intéressante de l'attaque. Les contrôles pour un modèle High sont structurellement insuffisants parce qu'ils supposent que l'humain est le goulot d'étranglement.

Ce que « Critique » signifie réellement sur la piste cyber

C'est la phrase que les gens interprètent mal dans les actualités. Le propre cadrage d'OpenAI est étroit :

Un modèle qui peut découvrir et développer des exploits zero-day fonctionnels pour de nombreux systèmes critiques réels durcis sans aide humaine, ou concevoir et exécuter de nouvelles stratégies d'attaque cyber de bout en bout contre des cibles durcies à partir d'un simple objectif de haut niveau.

Deux choses à remarquer.

Premièrement, ce n'est pas « le modèle est très bon aux défis CTF ». Les CTF sont des puzzles préconçus avec des solutions attendues. Critique exige des attaques nouvelles de bout en bout contre des systèmes réels durcis (patchés, surveillés, défendus). C'est la classe de travail habituellement attribuée aux équipes rouges d'acteurs étatiques.

Deuxièmement, « sans aide humaine » fait beaucoup de travail. Un modèle qui peut aider un opérateur compétent à déployer un zero-day fonctionnel plus rapidement n'est pas automatiquement Critique — c'est carrément du territoire High. La barre Critique, c'est l'autonomie : le modèle planifie, découvre le bug, l'arme et le fait atterrir, avec pour seul objectif quelque chose comme « obtiens et exfiltre la base de données clients depuis cette URL. »

Sous cette définition, « nous ne pouvons pas actuellement exclure Critique » est une déclaration bien plus forte que « le modèle est bon en sécurité ». C'est : nos évaluations ont trouvé une capacité au niveau ou près du niveau où un adversaire compétent pourrait pointer cette chose sur une cible durcie et recevoir un accès shell sans autre intervention humaine.

La réponse opérationnelle, étape par étape

Quand un laboratoire prononce ces mots, ce qui se passe au bureau ressemble à ceci. Le billet d'OpenAI et les reportages qui ont suivi décrivent les actions concrètes suivantes :

Guided walkthrough1 of 7
  1. Astra passe dans des environnements de développement isolés avec accès réseau et accès aux outils restreints. La surface d'utilisation d'outils qu'un modèle de niveau Critique utiliserait pour *démontrer* le risque (accès internet arbitraire, shell, installation de paquets) est précisément la surface qui est coupée en premier.

OpenAI vs Anthropic : même forme, vocabulaire différent

Anthropic exécute un cadre parallèle appelé Responsible Scaling Policy (RSP), actuellement en v3.0. Au lieu de Low/Medium/High/Critical par domaine, Anthropic utilise des AI Safety Levels (ASL) globaux : ASL-1 à ASL-5. Les deux cadres tentent de résoudre le même problème et se chevauchent approximativement niveau par niveau, mais pas de manière un pour un.

L'alignement approximatif, tel qu'il peut être formulé sans qu'aucun laboratoire n'approuve la correspondance :

Niveau Preparedness OpenAIVoisinage ASL AnthropicCe qui est livré
LowASL-1 / ASL-2Tout, avec les politiques d'utilisation standard.
MediumASL-2Livraison avec les mesures d'atténuation par défaut d'aujourd'hui.
HighASL-3Contrôles côté déploiement et côté poids tous deux requis. Anthropic a activé les protections ASL-3 pour Claude Opus 4 en mai 2025.
CriticalASL-4 (approximativement)Le niveau qu'Anthropic affine activement parce qu'il s'avère véritablement difficile à spécifier de manière préventive. RSP v3 reconnaît explicitement que les définitions ASL-4/5 sont la partie difficile.

La nuance intéressante est que la position publique d'Anthropic sur ASL-4 a été « nous n'avons pas encore l'ensemble de garde-fous prêts à déployer un modèle qui atteint clairement les seuils ASL-4 » — ce qui est à peu près ce qu'OpenAI vient de dire à haute voix à propos d'Astra, avec d'autres mots. Quand vous lisez l'un ou l'autre cadre à l'avenir, la traduction mentale est :

« Critique cyber » (OpenAI) ≈ « capacité autonome de type ASL-4 » (Anthropic) ≈ « les garde-fous que nous avons déjà ne sont pas les garde-fous dont cela a besoin ».

Aucun des cadres n'est magique. Ce sont des engagements de processus. La valeur n'est pas qu'ils empêchent la capacité — ils ne le font pas — mais qu'ils forcent le laboratoire à un point de décision explicite et publiquement visible au lieu d'une dérive lente vers la livraison.

Trois enseignements non évidents pour les constructeurs

Vous ne livrez pas (encore) Astra. Vous livrez sur Claude, GPT-5.6, Gemini, ou quelque chose de local. Voici ce qui change réellement pour vous.

1. Les publications de modèles de pointe vont être en retard sur leurs propres annonces de capacités

L'événement Astra est l'instance concrète d'un motif qui va devenir plus courant. Les laboratoires annonceront une capacité (preuves mathématiques, un score d'eval, une démo) des semaines avant que le modèle ne soit déployable à cette capacité, parce que les processus de type Preparedness forcent un écart entre « nous avons les poids » et « nous sommes à l'aise de livrer les poids ». Prévoyez cela dans votre feuille de route : si un fournisseur pré-annonce un modèle de pointe, ne concevez pas la date de lancement de votre produit autour. Concevez autour du modèle actuellement livré, traitez le nouveau comme un chemin de mise à niveau.

2. Votre surface d'outils est la mesure d'atténuation

Quand une capacité de niveau Critique se trouve derrière une surface d'outils restreinte, le modèle peut encore être livré — il ne peut simplement pas faire d'E/S réseau arbitraire ou de shell arbitraire. C'est exactement la forme de déploiement que les laboratoires poussent déjà pour d'autres raisons (sécurité, coût, déterminisme). Si vous construisez un agent, la même hygiène de surface d'outils qui le rend débogable le rend aussi déployable dans le monde où le modèle sous-jacent est Critique-en-quelque-chose. Concrètement : des outils nommés, typés, avec des listes d'autorisation étroites, battent « donne-lui un shell ». Liens croisés vers Contrôler les compétences d'agent et Empoisonnement d'outils MCP et rug pulls.

3. Cela augmente la valeur de vos évaluations, pas celles du fournisseur

Les évaluations Preparedness / RSP du fournisseur concernent le pire cas — cette chose peut-elle attaquer de manière autonome des systèmes durcis. C'est la mauvaise question pour votre produit. Le risque de votre produit n'est pas « le modèle peut-il développer des zero-days », c'est « le modèle fait-il ce dont mes utilisateurs ont besoin sur mon workflow spécifique, sans produire des sorties que mon domaine considère comme nuisibles ». Les évaluations du fournisseur n'y répondront pas. La réponse la plus saine à entendre « Critique » est de doubler la mise sur vos propres évaluations de vos propres flux, afin que quoi que le fournisseur finisse par livrer (contraint, retardé ou autre), vous puissiez tester en régression le changement contre votre produit dès le premier jour. Voir Évaluations Supabase : benchmark d'agent pour un motif concret.

Un exemple travaillé : à quoi pourrait ressembler un déploiement « Critique-avec-atténuations »

Si les évaluations externes confirment Critique mais qu'OpenAI veut quand même livrer, la forme du déploiement est hautement prévisible. Quelque chose comme :

Contraintes de déploiement Astra hypothétiques (illustratives)

- No raw shell / arbitrary code execution tool exposed to third-party developers
- Browsing restricted to allow-listed content classes (docs, GitHub, package registries)
and blocked from arbitrary URL fetch on request
- All "security research" adjacent requests routed through a stricter refusal policy
with mandatory logging and human review sampling
- Fine-tuning API disabled for the Critical-tier model
- API-only, no download, no on-device version, no self-hosted variant
- Rate-limited and gated behind explicit enterprise agreements with reporting requirements
- Independent monitoring org receives redacted misuse signals

Rien de tout cela n'est confirmé pour Astra. C'est la forme de ce à quoi un déploiement Critique-avec-atténuations doit ressembler pour satisfaire les engagements propres au cadre. Si la publication éventuelle ressemble largement à cela, c'est le cadre qui fonctionne. Si elle ne ressemble en rien à cela, c'est un signal que la classification est finalement revenue en dessous de Critique.

Erreurs de lecture courantes à éviter

  • « OpenAI a annulé Astra. » Non. Il a suspendu les travaux internes qui ne respectaient pas les nouveaux contrôles et étendu les tests de sécurité. Il n'y a pas d'annulation.
  • « Astra peut hacker n'importe quoi. » Non. Le seuil n'est pas « peut hacker ». Il est « peut mener de manière autonome des attaques de bout en bout contre des cibles durcies à partir d'un objectif de haut niveau ». Même l'annonce utilise « ne peut pas actuellement exclure », pas « confirmé ».
  • « Cela signifie que l'IA est maintenant trop dangereuse pour être publiée. » Non. Tout l'intérêt du cadre est une réponse graduée. Critique ne signifie pas non livrable, il signifie non livrable sans les contrôles spécifiques que Critique exige.
  • « Le Preparedness Framework est une douve. » Non. Rien dans Preparedness ne restreint le modèle de quelqu'un d'autre. Les laboratoires open-weight (Meta, Mistral, DeepSeek, Qwen, MiniMax) ont leurs propres capacités, leurs propres choix, et aucune obligation d'adopter Preparedness. Le cadre engage le laboratoire qui l'a signé, pas le champ.

Quoi surveiller ensuite

  • Si la prochaine révision du Preparedness Framework d'OpenAI divise cyber-Critique en bandes plus fines (par exemple Critique-Autonome vs Critique-Assisté). Actuellement, la définition met beaucoup de poids sur « sans aide humaine » et la réalité est un spectre.
  • Si Anthropic cartographie explicitement ses niveaux RSP v3.0 sur les niveaux Preparedness publiquement. Les chercheurs indépendants le font déjà de manière informelle.
  • Si la prochaine grande publication de pointe de n'importe quel laboratoire (Anthropic, Google, xAI, DeepSeek) déclenche un motif inverse — un laboratoire disant « nous avons évalué pour Critique cyber et cela ne s'est pas déclenché, voici les chiffres ».
  • Si la forme de déploiement contraint esquissée ci-dessus devient le modèle par défaut pour la livraison de modèles de pointe en général, pas seulement pour les modèles de niveau Critique.

Vérification rapide

Check yourself

0/5
  1. Selon le Preparedness Framework d'OpenAI, qu'est-ce qui distingue une capacité cyber de niveau Critique d'une capacité de niveau High ?
  2. Qu'a réellement dit OpenAI à propos d'Astra le 7 août 2026 ?
  3. Laquelle des actions de contrôle suivantes OpenAI a-t-il appliquée à Astra dans le cadre de la réponse ?
  4. Quel est le voisin le plus proche du niveau « Critique » d'OpenAI dans la Responsible Scaling Policy d'Anthropic ?
  5. Pour un constructeur livrant un agent sur n'importe quel modèle de pointe, laquelle de ces réponses est le meilleur enseignement de l'événement Astra ?

Cartes mémoire

Aucune carte pour l'instant — ajoutez-en pour commencer à réviser. 🃏

Sources et lectures complémentaires