Skip to content
Tech AI Wire

GPT-6 Astra logra un 95% en una tarea robótica y un 10% en otra

Robocurve probó GPT-6 Astra y Claude Fable 5.1 con brazos robóticos reales. Astra acertó 19 de 20 en la tarea fácil y 2 de 20 en la difícil.

Por Tech AI Wire Team

3 min de lectura

XLinkedIn
Two robot arms with parallel-jaw grippers above a white table holding a red block, a bowl, a blue puzzle piece and a matching groove.

En cifras

Astra's success rate on the block task
19/20
Astra's success rate on the puzzle task
2/20
cost per run for Astra on the block task
$0.94

Robocurve ha puesto a GPT-6 Astra de OpenAI y a Claude Fable 5.1 de Anthropic frente a brazos robóticos reales, y los resultados se parten con nitidez según la tarea. Astra completó la tarea fácil 19 veces de 20. En la más difícil logró 2 de 20, exactamente igual que Fable 5.1. Robocurve publicó los resultados de Astra el 4 de septiembre de 2026, y los de Fable 5.1 el día anterior.

Robocurve es un evaluador independiente, no uno de los dos laboratorios. Se describe como una Public Benefit Corporation y dice contar con el respaldo de Y Combinator.

Las dos tareas y los números

Ambos modelos manejaron el mismo montaje: brazos I2RT YAM bimanuales, seis grados de libertad cada uno, pinzas de mordaza paralela y tres vistas de cámara. Cada modelo hizo 20 intentos por tarea, puntuados por evaluadores humanos en una escala de cinco etapas.

La primera tarea era meter un bloque rojo en un cuenco. La segunda, colocar una pieza de puzle azul en una ranura que le correspondía.

ModeloTarea del bloqueTarea del puzleCoste por intento, bloque
GPT-6 Astra19/202/200,94 $
Claude Fable 5.18/202/202,12 $
Claude Fable 51/200/202,69 $

Astra también fue más rápido. Promedió 2,5 minutos por intento en la tarea del bloque, frente a 6,8 minutos de Fable 5.1 y 8,2 minutos de Fable 5.

Donde la diferencia desaparece

Los números del bloque parecen concluyentes. Los del puzle son los interesantes.

En la tarea del puzle los dos modelos actuales se quedaron en 2 de 20. Un 95% y un 40% se juntaron en el mismo 10%. Lo que separa a los modelos en la tarea fácil deja de importar en cuanto hay que encajar una forma en una ranura.

Es una forma conocida. Contamos cómo Astra saca un 99,9% o un 62,7% en ARC-AGI-3 según el arnés, y aquí llega la misma lección por otra puerta. Un porcentaje suelto dice tanto de la tarea como del modelo.

El informe de Robocurve sobre Fable 5.1 hace una afirmación estrecha en lugar de amplia. Fable 5.1 "reached later stages of both tasks than Fable 5, completed each task more often, and produced fewer output tokens doing it."

El arnés es de código abierto

El marco de evaluación, llamado inspect-robots, está en GitHub bajo licencia MIT. Eso importa más que cualquier puntuación aislada.

El repositorio guarda las definiciones de tareas y el código de puntuación, no solo los resultados. Los modelos se enchufan por una interfaz definida, y el marco comprueba el espacio de acción, el de observación y la frecuencia de control antes de arrancar un intento. Cada intento queda registrado con su configuración resuelta, la revisión de git y las versiones de los paquetes.

Así que los números se pueden repetir y discutir, cosa que no ocurre con la mayoría de comparativas de modelos.

Qué significa esto para los desarrolladores

Lee los números por tarea, nunca la media. Si Robocurve hubiera dado una sola cifra mezclando ambas tareas, Astra parecería el doble de capaz que Fable 5.1. En la tarea que de verdad es difícil, son idénticos.

Si estás calculando el coste de un agente que toca el mundo físico, la columna de coste merece tanta atención como la de éxito. Astra hizo la tarea del bloque por 0,94 $ frente a 2,12 $, así que allí fue más barato y mejor. Fable 5.1 recortó con fuerza el precio de las lecturas de caché este mes, y ese tipo de cambio mueve estas cifras de una evaluación a la siguiente.

Si vas a montar tu propia evaluación, clona el arnés antes de escribir una. Ya resuelve lo que la gente hace mal: validar que una política y un robot coinciden en el espacio de acción, y fijar la revisión exacta de la que salió un resultado.

Y toma los 20 intentos por lo que son. Bastan para separar 19 de 8. No bastan para separar 2 de 2.

Fuentes

  1. GPT-6 Astra - Robocurve
  2. Claude Fable 5.1 - Robocurve
  3. robocurve/inspect-robots - GitHub

Artículos relacionados