GPT-6 Astra logra un 95% en una tarea robótica y un 10% en otra
Robocurve probó GPT-6 Astra y Claude Fable 5.1 con brazos robóticos reales. Astra acertó 19 de 20 en la tarea fácil y 2 de 20 en la difícil.
3 min de lectura

En cifras
- Astra's success rate on the block task
- 19/20
- Astra's success rate on the puzzle task
- 2/20
- cost per run for Astra on the block task
- $0.94
Robocurve ha puesto a GPT-6 Astra de OpenAI y a Claude Fable 5.1 de Anthropic frente a brazos robóticos reales, y los resultados se parten con nitidez según la tarea. Astra completó la tarea fácil 19 veces de 20. En la más difícil logró 2 de 20, exactamente igual que Fable 5.1. Robocurve publicó los resultados de Astra el 4 de septiembre de 2026, y los de Fable 5.1 el día anterior.
Robocurve es un evaluador independiente, no uno de los dos laboratorios. Se describe como una Public Benefit Corporation y dice contar con el respaldo de Y Combinator.
Las dos tareas y los números
Ambos modelos manejaron el mismo montaje: brazos I2RT YAM bimanuales, seis grados de libertad cada uno, pinzas de mordaza paralela y tres vistas de cámara. Cada modelo hizo 20 intentos por tarea, puntuados por evaluadores humanos en una escala de cinco etapas.
La primera tarea era meter un bloque rojo en un cuenco. La segunda, colocar una pieza de puzle azul en una ranura que le correspondía.
| Modelo | Tarea del bloque | Tarea del puzle | Coste por intento, bloque |
|---|---|---|---|
| GPT-6 Astra | 19/20 | 2/20 | 0,94 $ |
| Claude Fable 5.1 | 8/20 | 2/20 | 2,12 $ |
| Claude Fable 5 | 1/20 | 0/20 | 2,69 $ |
Astra también fue más rápido. Promedió 2,5 minutos por intento en la tarea del bloque, frente a 6,8 minutos de Fable 5.1 y 8,2 minutos de Fable 5.
Donde la diferencia desaparece
Los números del bloque parecen concluyentes. Los del puzle son los interesantes.
En la tarea del puzle los dos modelos actuales se quedaron en 2 de 20. Un 95% y un 40% se juntaron en el mismo 10%. Lo que separa a los modelos en la tarea fácil deja de importar en cuanto hay que encajar una forma en una ranura.
Es una forma conocida. Contamos cómo Astra saca un 99,9% o un 62,7% en ARC-AGI-3 según el arnés, y aquí llega la misma lección por otra puerta. Un porcentaje suelto dice tanto de la tarea como del modelo.
El informe de Robocurve sobre Fable 5.1 hace una afirmación estrecha en lugar de amplia. Fable 5.1 "reached later stages of both tasks than Fable 5, completed each task more often, and produced fewer output tokens doing it."
El arnés es de código abierto
El marco de evaluación, llamado inspect-robots, está en GitHub bajo licencia MIT. Eso importa más que cualquier puntuación aislada.
El repositorio guarda las definiciones de tareas y el código de puntuación, no solo los resultados. Los modelos se enchufan por una interfaz definida, y el marco comprueba el espacio de acción, el de observación y la frecuencia de control antes de arrancar un intento. Cada intento queda registrado con su configuración resuelta, la revisión de git y las versiones de los paquetes.
Así que los números se pueden repetir y discutir, cosa que no ocurre con la mayoría de comparativas de modelos.
Qué significa esto para los desarrolladores
Lee los números por tarea, nunca la media. Si Robocurve hubiera dado una sola cifra mezclando ambas tareas, Astra parecería el doble de capaz que Fable 5.1. En la tarea que de verdad es difícil, son idénticos.
Si estás calculando el coste de un agente que toca el mundo físico, la columna de coste merece tanta atención como la de éxito. Astra hizo la tarea del bloque por 0,94 $ frente a 2,12 $, así que allí fue más barato y mejor. Fable 5.1 recortó con fuerza el precio de las lecturas de caché este mes, y ese tipo de cambio mueve estas cifras de una evaluación a la siguiente.
Si vas a montar tu propia evaluación, clona el arnés antes de escribir una. Ya resuelve lo que la gente hace mal: validar que una política y un robot coinciden en el espacio de acción, y fijar la revisión exacta de la que salió un resultado.
Y toma los 20 intentos por lo que son. Bastan para separar 19 de 8. No bastan para separar 2 de 2.
Fuentes
- GPT-6 Astra - Robocurve
- Claude Fable 5.1 - Robocurve
- robocurve/inspect-robots - GitHub
Artículos relacionados

GPT-6 Astra saca 99,9% o 62,7% en ARC-AGI-3, según cómo se le pregunte
El GPT-6 Astra de OpenAI logró 99,9% en ARC-AGI-3 con el montaje de prueba propio de OpenAI, y 62,7% con el montaje neutral de ARC Prize. La diferencia está en lo que se le permite recordar al modelo.

El nuevo estándar de Anthropic deja que los agentes manejen equipos de laboratorio
Anthropic abrió el 27 de agosto de 2026 una vista previa de investigación del Model Hardware Standard, que da a los agentes una sola forma de manejar microscopios y brazos robóticos.

ChatGPT, Claude y Grok se cayeron todos a la vez
ChatGPT, Claude y Grok se cayeron dentro de la misma ventana el 3 de septiembre. Cursor también se vio afectado. Ninguna empresa ha confirmado una causa compartida.