Skip to content
Tech AI Wire

GPT-6 Astra, premier modèle « Critical » cyber d'OpenAI

Astra a obtenu 100% sur ExploitBench et bâti une chaîne d'exploitation de navigateur en 29 heures. La version livrée refuse d'écrire des preuves de concept.

Par Tech AI Wire Team

3 min de lecture

XLinkedIn
An empty office reception area at night, with the OpenAI knot mark in brushed steel on the wall behind the desk.

En chiffres

to build a working browser exploit chain
29 hours
to build a kernel privilege-escalation exploit
12 hours
of tests where it exceeded authorized scope
0%
Exploit benchmark scores
ExploitBench, Astra
100%
ExploitBench, GPT-5.6 Sol
78.5%
ExploitGym, Astra
42.4%

OpenAI a classé GPT-6 Astra au niveau cyber « Critical » de son Preparedness Framework, le premier modèle à l'atteindre. CSO Online rapporte que l'entreprise dit qu'Astra a « franchi le seuil "Critical" de risque en cybersécurité au titre de son Preparedness Framework ».

Cette étiquette n'est pas un palier marketing. C'est le point à partir duquel les propres règles d'OpenAI exigent, pour la capacité offensive d'un modèle, un traitement différent de tout ce qui a précédé.

Ce que signifie le seuil Critical

InfoQ cite la définition du cadre. Un modèle y répond s'il peut « identifier et développer des exploits zero-day fonctionnels de tous niveaux de gravité dans de nombreux systèmes critiques réels et durcis » de lui-même. Il y répond aussi s'il peut « concevoir et exécuter de bout en bout des stratégies d'attaque inédites contre des cibles durcies à partir d'un simple objectif de haut niveau ».

Deux démonstrations soutiennent ce classement. Face à un navigateur, InfoQ rapporte qu'Astra a trouvé plusieurs vulnérabilités inconnues et bâti en 29 heures une chaîne d'exploitation fonctionnelle qui sortait du bac à sable. Il l'a ensuite adaptée à la version stable en 12 heures de plus. Face à un noyau de système d'exploitation, il a produit en 12 heures un exploit fonctionnel d'élévation de privilèges locale.

Ce sont les chiffres sur lesquels s'arrêter. Un seul modèle, doté d'outils et de temps, est passé d'une cible durcie à du code fonctionnel en environ une journée.

Les benchmarks et leur plafond

Astra a obtenu 100% sur ExploitBench, que The Hacker News décrit comme mesurant la capacité d'un modèle à transformer des vulnérabilités logicielles connues en exploits fonctionnels. Le modèle précédent, GPT-5.6 Sol, avait obtenu 78,5%.

Un benchmark saturé cesse d'informer, et c'est pourquoi la troisième barre du graphique compte davantage. Sur ExploitGym, qui teste le développement d'exploits plutôt que la conversion de failles connues, CSO Online rapporte un score de 42,4%. Le même modèle touche le plafond d'une tâche et reste sous la moitié sur la plus difficile.

Ce site a déjà vécu cela avec Astra. Son score ARC-AGI-3 valait 99,9% ou 62,7% selon qui menait le test, et la leçon se répète : le nombre dit peu de chose sans le banc d'essai qui l'a produit.

Ce qui est réellement livré

Le modèle que vous pouvez appeler n'est pas celui qui a été testé. The Hacker News rapporte que la version livrée se limite à la revue de code sécurisée et au correctif, et refuse les demandes de preuves de concept. CSO Online évoque un programme nommé Daybreak qui donne à des défenseurs vérifiés un accès avec, selon les mots d'OpenAI, « des garde-fous moins restrictifs ».

L'accès est désactivé par défaut pour les entreprises, et un administrateur doit l'activer. Le prix est de 10 dollars par million de tokens d'entrée et 50 dollars par million en sortie, soit le même chiffre d'entrée que lorsque Astra est devenu disponible sur Bedrock et Copilot.

OpenAI décrit aussi des contrôles internes ajoutés : isolation plus stricte du modèle, checkpoints chiffrés, surveillance des chaînes de raisonnement et évaluations d'alignement avant tout déploiement interne. Selon InfoQ, l'entreprise prévoit de signaler deux vulnérabilités zero-day aux mainteneurs concernés en retenant les noms de produits et les détails techniques.

Ce que cela signifie pour les développeurs

La lecture défensive est la plus utile. Un modèle qui transforme une CVE connue en code fonctionnel à ce rythme comprime le délai entre la publication d'un correctif et son exploitation. Si votre fenêtre de correctifs suppose des semaines de répit après la divulgation, c'est cette hypothèse qu'il faut revoir ce trimestre.

Soyez précis sur ce qui a été montré, et par qui. Tous les chiffres ici viennent d'OpenAI ou de reprises de ses affirmations, et aucune source ne décrit d'audit externe du classement Critical. L'entreprise a noté son propre modèle selon son propre cadre avec ses propres benchmarks, ce qui mérite d'être dit même quand la divulgation est exceptionnellement détaillée.

Un chiffre mérite plus d'attention que les durées d'exploitation : Astra a dépassé le périmètre autorisé dans 0% des tests, selon CSO Online. Pour qui fait tourner des agents contre de vrais systèmes, le respect du périmètre est la propriété qui décide si une capacité est utilisable.

Enfin, traitez le refus comme une décision produit et non comme une propriété de sûreté. Le modèle public refuse aujourd'hui d'écrire des exploits, et Daybreak existe pour assouplir cela pour certains utilisateurs. Ces deux choses peuvent changer sans que la capacité sous-jacente change.

Sources

  1. GPT-6 Astra Is the First Model OpenAI Classifies as Critical for Cybersecurity - InfoQ
  2. OpenAI launches GPT-6 Astra, its first model to cross a critical cybersecurity threshold - CSO Online
  3. GPT-6 Astra Scores 100% on ExploitBench as OpenAI Blocks PoC Exploit Requests - The Hacker News

Articles liés