Skip to content
Tech AI Wire

GPT-6 Astra erreicht 95% bei einer Roboteraufgabe, 10% bei einer anderen

Robocurve hat GPT-6 Astra und Claude Fable 5.1 an echten Roboterarmen getestet. Astra schaffte 19 von 20 bei der leichten Aufgabe und 2 von 20 bei der schweren.

Von Tech AI Wire Team

3 Min. Lesezeit

XLinkedIn
Two robot arms with parallel-jaw grippers above a white table holding a red block, a bowl, a blue puzzle piece and a matching groove.

Die Zahlen

Astra's success rate on the block task
19/20
Astra's success rate on the puzzle task
2/20
cost per run for Astra on the block task
$0.94

Robocurve hat OpenAIs GPT-6 Astra und Anthropics Claude Fable 5.1 gegen echte Roboterarme antreten lassen, und die Ergebnisse spalten sich scharf nach Aufgabe. Astra löste die leichte Aufgabe 19 von 20 Mal. Bei der schwereren schaffte es 2 von 20 und lag damit exakt gleichauf mit Fable 5.1. Robocurve veröffentlichte die Astra-Ergebnisse am 4. September 2026 und die Ergebnisse zu Fable 5.1 am Tag davor.

Robocurve ist ein unabhängiger Prüfer, kein Labor. Es beschreibt sich als Public Benefit Corporation und gibt an, von Y Combinator unterstützt zu werden.

Die zwei Aufgaben und die Zahlen

Beide Modelle steuerten denselben Aufbau: beidhändige I2RT-YAM-Arme, je sechs Freiheitsgrade, Parallelgreifer, drei Kameraperspektiven. Jedes Modell absolvierte 20 Versuche pro Aufgabe, bewertet von menschlichen Prüfern auf einer fünfstufigen Skala.

Die erste Aufgabe war, einen roten Block in eine Schale zu legen. Die zweite war, ein blaues Puzzleteil in eine passende Nut zu setzen.

ModellBlock-AufgabePuzzle-AufgabeKosten pro Lauf, Block
GPT-6 Astra19/202/200,94 $
Claude Fable 5.18/202/202,12 $
Claude Fable 51/200/202,69 $

Astra war auch schneller. Es brauchte im Schnitt 2,5 Minuten pro Lauf bei der Block-Aufgabe, gegenüber 6,8 Minuten für Fable 5.1 und 8,2 Minuten für Fable 5.

Wo der Abstand verschwindet

Die Block-Zahlen wirken eindeutig. Interessant sind die Puzzle-Zahlen.

Bei der Puzzle-Aufgabe landeten beide aktuellen Modelle bei 2 von 20. Ein Wert von 95% und einer von 40% fielen auf dieselben 10% zusammen. Was die Modelle bei der leichten Aufgabe trennt, hört auf zu zählen, sobald eine Form in einen Schlitz passen muss.

Dieses Muster ist bekannt. Wir haben berichtet, wie Astra je nach Harness 99,9% oder 62,7% bei ARC-AGI-3 erreicht, und hier kommt dieselbe Lehre durch eine andere Tür. Eine einzelne Prozentzahl sagt ebenso viel über die Aufgabe wie über das Modell.

Robocurves Bericht zu Fable 5.1 formuliert eine eng gefasste Aussage statt einer breiten. Fable 5.1 "reached later stages of both tasks than Fable 5, completed each task more often, and produced fewer output tokens doing it."

Das Harness ist quelloffen

Das Auswertungsgerüst mit dem Namen inspect-robots liegt auf GitHub unter der MIT-Lizenz. Das zählt mehr als jeder einzelne Wert.

Das Repository enthält die Aufgabendefinitionen und den Bewertungscode, nicht nur die Ergebnisse. Modelle docken über eine definierte Schnittstelle an, und das Gerüst prüft Aktionsraum, Beobachtungsraum und Regelrate, bevor ein Lauf startet. Jeder Lauf wird mit aufgelöster Konfiguration, Git-Revision und Paketversionen aufgezeichnet.

Die Zahlen lassen sich also nachfahren und bestreiten, was bei den meisten Modellvergleichen nicht gilt.

Was das für Entwickler bedeutet

Lesen Sie die Werte pro Aufgabe, nie den Durchschnitt. Hätte Robocurve eine gemischte Zahl über beide Aufgaben berichtet, sähe Astra etwa doppelt so fähig aus wie Fable 5.1. Bei der wirklich schweren Aufgabe sind sie identisch.

Wer einen Agenten kalkuliert, der die physische Welt berührt, sollte die Kostenspalte so genau lesen wie die Erfolgsspalte. Astra fuhr die Block-Aufgabe für 0,94 $ gegenüber 2,12 $, war dort also billiger und besser. Fable 5.1 hat diesen Monat die Preise für Cache-Lesevorgänge deutlich gesenkt, und solche Änderungen verschieben diese Zahlen von einer Auswertung zur nächsten.

Wer eine eigene Auswertung baut, klont besser zuerst das Harness. Es erledigt bereits die Teile, die oft schiefgehen: zu prüfen, dass Policy und Roboter sich über den Aktionsraum einig sind, und die genaue Revision festzuhalten, aus der ein Ergebnis stammt.

Und behandeln Sie 20 Versuche als das, was sie sind. Sie reichen, um 19 von 8 zu trennen. Sie reichen nicht, um 2 von 2 zu trennen.

Quellen

  1. GPT-6 Astra - Robocurve
  2. Claude Fable 5.1 - Robocurve
  3. robocurve/inspect-robots - GitHub

Ähnliche Artikel