Skip to content
Tech AI Wire

GPT-6 Astra obtient 95% sur une tâche robotique, 10% sur une autre

Robocurve a testé GPT-6 Astra et Claude Fable 5.1 sur de vrais bras robotisés. Astra a réussi 19 fois sur 20 la tâche facile, et 2 fois sur 20 la difficile.

Par Tech AI Wire Team

3 min de lecture

XLinkedIn
Two robot arms with parallel-jaw grippers above a white table holding a red block, a bowl, a blue puzzle piece and a matching groove.

En chiffres

Astra's success rate on the block task
19/20
Astra's success rate on the puzzle task
2/20
cost per run for Astra on the block task
$0.94

Robocurve a fait tourner GPT-6 Astra d'OpenAI et Claude Fable 5.1 d'Anthropic sur de vrais bras robotisés, et les résultats se divisent nettement selon la tâche. Astra a réussi la tâche facile 19 fois sur 20. Sur la plus difficile, il a réussi 2 fois sur 20, exactement comme Fable 5.1. Robocurve a publié les résultats d'Astra le 4 septembre 2026, et ceux de Fable 5.1 la veille.

Robocurve est un évaluateur indépendant, et non l'un des deux laboratoires. Il se décrit comme une Public Benefit Corporation et dit être soutenu par Y Combinator.

Les deux tâches et les chiffres

Les deux modèles pilotaient le même montage : des bras I2RT YAM bimanuels, six degrés de liberté chacun, des pinces à mors parallèles, trois vues de caméra. Chaque modèle a effectué 20 essais par tâche, notés par des évaluateurs humains sur une échelle en cinq paliers.

La première tâche consistait à déposer un bloc rouge dans un bol. La seconde, à placer une pièce de puzzle bleue dans une rainure correspondante.

ModèleTâche du blocTâche du puzzleCoût par essai, bloc
GPT-6 Astra19/202/200,94 $
Claude Fable 5.18/202/202,12 $
Claude Fable 51/200/202,69 $

Astra était aussi plus rapide. Il a mis 2,5 minutes en moyenne par essai sur la tâche du bloc, contre 6,8 minutes pour Fable 5.1 et 8,2 minutes pour Fable 5.

Là où l'écart disparaît

Les chiffres du bloc semblent tranchés. Ceux du puzzle sont les plus intéressants.

Sur la tâche du puzzle, les deux modèles actuels sont tombés à 2 sur 20. Un score de 95% et un de 40% ont convergé vers les mêmes 10%. Ce qui sépare les modèles sur la tâche facile cesse de compter dès qu'il faut faire entrer une forme dans une fente.

La forme est familière. Nous avons raconté comment Astra obtient 99,9% ou 62,7% à ARC-AGI-3 selon le harnais, et voici la même leçon par une autre porte. Un pourcentage isolé en dit autant sur la tâche que sur le modèle.

Le compte rendu de Robocurve sur Fable 5.1 formule une affirmation étroite plutôt que large. Fable 5.1 "reached later stages of both tasks than Fable 5, completed each task more often, and produced fewer output tokens doing it."

Le harnais est open source

Le cadre d'évaluation, nommé inspect-robots, est sur GitHub sous licence MIT. Cela compte plus que n'importe quel score isolé.

Le dépôt contient les définitions de tâches et le code de notation, pas seulement les résultats. Les modèles se branchent par une interface définie, et le cadre vérifie l'espace d'action, l'espace d'observation et la fréquence de contrôle avant le démarrage d'un essai. Chaque essai est enregistré avec sa configuration résolue, la révision git et les versions des paquets.

Les chiffres peuvent donc être rejoués et contestés, ce qui n'est pas le cas de la plupart des comparaisons de modèles.

Ce que cela signifie pour les développeurs

Lisez les chiffres par tâche, jamais la moyenne. Si Robocurve avait publié un seul chiffre mêlant les deux tâches, Astra paraîtrait environ deux fois plus capable que Fable 5.1. Sur la tâche réellement difficile, ils sont identiques.

Si vous chiffrez un agent qui touche au monde physique, la colonne des coûts mérite autant d'attention que celle des réussites. Astra a mené la tâche du bloc à 0,94 $ contre 2,12 $, donc il y était moins cher et meilleur. Fable 5.1 a fortement baissé le prix des lectures de cache ce mois-ci, et ce genre de changement déplace ces chiffres d'une évaluation à l'autre.

Si vous construisez votre propre évaluation, clonez le harnais avant d'en écrire une. Il gère déjà ce que les gens ratent : vérifier qu'une politique et un robot s'accordent sur l'espace d'action, et figer la révision exacte d'où vient un résultat.

Et prenez les 20 essais pour ce qu'ils sont. C'est assez pour séparer 19 de 8. Ce n'est pas assez pour séparer 2 de 2.

Sources

  1. GPT-6 Astra - Robocurve
  2. Claude Fable 5.1 - Robocurve
  3. robocurve/inspect-robots - GitHub

Articles liés