Skip to content
Tech AI Wire

GPT-6 Astra obtient 99,9% ou 62,7% sur ARC-AGI-3, selon comment on demande

Le GPT-6 Astra d'OpenAI a obtenu 99,9% sur ARC-AGI-3 avec le dispositif de test propre à OpenAI, et 62,7% avec le dispositif neutre d'ARC Prize. L'écart vient de ce que le modèle a le droit de retenir.

Par Tech AI Wire Team

3 min de lecture

XLinkedIn
ARC Prize's own blog post showing GPT-6 Astra's 62.7% and 99.9% ARC-AGI-3 scores under two different test harnesses.

En chiffres

Astra's score using OpenAI's own Provider Adapter harness
99.9%
Astra's score using ARC Prize's neutral Standard harness
62.7%
of ARC-AGI-3 levels where Astra beat the human baseline
96%
Astra's ARC-AGI-3 score, by test harness
Standard (neutral)
62.7%
Provider Adapter (OpenAI's own)
99.9%

Astra, le prochain modèle d'OpenAI, a obtenu 99,9% au test de raisonnement ARC-AGI-3. Il a aussi obtenu 62,7% au même test. Les deux chiffres sont réels, et ARC Prize les a publiés lui-même le 3 septembre 2026. L'écart tient au dispositif de test utilisé par Astra, pas à un changement du modèle.

Tech AI Wire a déjà suivi le parcours d'Astra vers sa sortie, notamment le ralentissement de son développement par OpenAI face à des inquiétudes sur ses capacités cyber, et une pause d'entraînement après une faille impliquant des agents. Voici son premier résultat de benchmark public.

Deux dispositifs, un seul modèle

ARC Prize fait tourner deux dispositifs de test différents, et leur différence tient à la mémoire que le modèle est autorisé à garder.

Le dispositif Standard est neutre vis-à-vis du fournisseur. Le propre article d'ARC Prize indique qu'il permet au modèle de "conserver des notes qu'il choisit de garder avec lui tout au long de l'environnement", des notes visibles que le modèle s'écrit à lui-même entre les étapes. Le dispositif Provider Adapter est spécifique à OpenAI. ARC Prize le décrit comme préservant "un état de raisonnement opaque entre les requêtes" et utilisant "une compaction pour les conversations plus longues, permettant au modèle de réutiliser son travail antérieur".

En clair : le test neutre oblige Astra à écrire ce qu'il veut retenir, de façon visible. Le propre test d'OpenAI laisse un raisonnement caché se transmettre automatiquement, et compresse les longs historiques au lieu de les perdre.

DispositifScoreCe qu'il permet
Standard (neutre)62,7%Notes visibles seulement, écrites par le modèle lui-même
Provider Adapter (propre à OpenAI)99,9%État de raisonnement opaque conservé entre les requêtes, plus compaction

Superpower Daily rapporte que l'exécution sous Provider Adapter a aussi été environ 3,66 fois plus rapide en temps écoulé cumulé, et a utilisé 49% de jetons en moins au total. Quoi que fasse cet état caché, il le fait efficacement.

Le cadrage honnête, de la part de ceux qui ont fait passer le test

ARC Prize ne cache pas l'écart. L'organisation a publié les deux chiffres dans le même billet et a laissé les lecteurs voir quel dispositif avait produit lequel.

Superpower Daily pose clairement la vraie question. "La question clé désormais est de savoir quelle part de la capacité apparente d'Astra appartient au modèle", écrit le site, "et quelle part au système de gestion du contexte qui l'entoure." FourWeekMBA formule l'écart de façon similaire, écrivant qu'un écart "de plus de trente points... n'est pas la preuve d'une mauvaise foi. C'est la démonstration qu'un chiffre de benchmark phare peut dépendre du dispositif utilisé."

Au-delà de la question du dispositif, ARC Prize a aussi rapporté une capacité réellement nouvelle. Sur les niveaux qu'Astra a complétés, il a dépassé la performance humaine de référence sur 96% d'entre eux, selon ARC Prize, en utilisant en moyenne 51,7% d'actions de moins qu'un humain n'en aurait eu besoin. Le modèle se construit sa propre notation compacte pour chaque nouvel environnement, une sorte de sténographie algébrique pour les règles et les états, plutôt que de raisonner par étapes longues et verbeuses. François Chollet, cofondateur d'ARC Prize, a qualifié ce résultat de "changement en fonction palier" dans l'efficacité et la capacité du modèle, selon OfficeChai.

Ce que cela signifie pour les développeurs

Demandez quel dispositif a produit un chiffre de benchmark avant d'agir dessus, qu'il s'agisse d'Astra ou de tout autre modèle. Un écart de 37 points entre deux tests légitimes du même modèle est désormais un phénomène documenté et réel, pas une hypothèse. Si un fournisseur publie un chiffre sans nommer les conditions du test, cette omission est en elle-même le résultat à retenir.

Si vous évaluez des modèles pour votre propre usage, construisez votre propre dispositif de test plutôt que de faire confiance à un dispositif publié pour correspondre à votre déploiement. L'avantage du Provider Adapter, un état caché transporté d'une requête à l'autre, est exactement le genre d'infrastructure que la plupart des systèmes en production ne fournissent pas à un modèle par défaut. Testez dans des conditions qui ressemblent à ce que votre application donnera réellement au modèle.

Remarquez ce qui s'est vraiment maintenu : le taux de 96% de dépassement humain et l'efficacité de 51,7% d'actions en moins sont restés stables, quel que soit le dispositif ayant produit le chiffre phare. Quand vous lisez un résultat de benchmark, séparez deux types d'affirmations. Le score phare a bougé de 37 points selon le dispositif. Une affirmation précise, au niveau du mécanisme, comme l'efficacité d'action, reflète plus probablement quelque chose de réel sur le modèle lui-même.

De plus en plus de laboratoires publient des modèles agentiques dotés de leurs propres couches de gestion d'état. Attendez-vous à ce que l'écart entre un benchmark "neutre" et un benchmark "optimisé pour le fournisseur" devienne une caractéristique permanente de chaque sortie majeure, pas un simple astérisque propre à celle-ci.

Sources

  1. OpenAI's GPT-6 Astra on ARC-AGI-3 - ARC Prize
  2. GPT-6 Astra Hits 99.9% on ARC-AGI-3, but Scores 62.7% in a Shared Test - Superpower Daily
  3. GPT-6 Astra 'Major Breakthrough' On ARC-AGI-3 With Score Of 62% - OfficeChai

Articles liés