GPT-6 Astra saca 99,9% o 62,7% en ARC-AGI-3, según cómo se le pregunte
El GPT-6 Astra de OpenAI logró 99,9% en ARC-AGI-3 con el montaje de prueba propio de OpenAI, y 62,7% con el montaje neutral de ARC Prize. La diferencia está en lo que se le permite recordar al modelo.
3 min de lectura

En cifras
- Astra's score using OpenAI's own Provider Adapter harness
- 99.9%
- Astra's score using ARC Prize's neutral Standard harness
- 62.7%
- of ARC-AGI-3 levels where Astra beat the human baseline
- 96%
- Standard (neutral)
- 62.7%
- Provider Adapter (OpenAI's own)
- 99.9%
Astra, el próximo modelo de OpenAI, obtuvo 99,9% en el test de razonamiento ARC-AGI-3. También obtuvo 62,7% en ese mismo test. Ambas cifras son reales, y ARC Prize publicó las dos el 3 de septiembre de 2026. La diferencia está en bajo qué montaje de prueba corrió Astra, no en un cambio en el modelo.
Tech AI Wire ya ha seguido el camino de Astra hacia su lanzamiento, incluyendo cómo OpenAI ralentizó su desarrollo por preocupaciones sobre capacidades cibernéticas y pausó el entrenamiento tras una brecha de agentes. Este es su primer resultado público de referencia.
Dos montajes, un mismo modelo
ARC Prize usa dos montajes de prueba distintos, y la diferencia entre ellos está en qué memoria se le permite conservar al modelo.
El montaje Standard es neutral respecto al proveedor. El propio artículo de ARC Prize dice que permite al modelo "llevar consigo notas que elige conservar a lo largo del entorno", notas visibles que el modelo se escribe a sí mismo entre pasos. El montaje Provider Adapter es específico de OpenAI. ARC Prize lo describe como algo que conserva "un estado de razonamiento opaco entre solicitudes" y usa "compactación para conversaciones más largas, lo que permite al modelo reutilizar trabajo previo".
En términos sencillos: la prueba neutral obliga a Astra a escribir lo que quiere recordar, a la vista de todos. La propia prueba de OpenAI deja que el razonamiento oculto pase automáticamente de una solicitud a otra, y comprime historiales largos en lugar de perderlos.
| Montaje | Puntuación | Qué permite |
|---|---|---|
| Standard (neutral) | 62,7% | Solo notas visibles, escritas por el propio modelo |
| Provider Adapter (propio de OpenAI) | 99,9% | Estado de razonamiento opaco entre solicitudes, más compactación |
Superpower Daily informa de que la ejecución con Provider Adapter también fue unas 3,66 veces más rápida en tiempo transcurrido acumulado, y usó un 49% menos de tokens en total. Sea lo que sea que hace ese estado oculto, lo hace de forma eficiente.
El planteamiento honesto, de quienes hicieron la prueba
ARC Prize no oculta la diferencia. La organización publicó ambas cifras en la misma entrada y dejó que los lectores vieran qué montaje produjo cada una.
Superpower Daily plantea la pregunta real con claridad. "La pregunta clave ahora es cuánta de la capacidad aparente de Astra pertenece al modelo", escribe el medio, "y cuánta al sistema de gestión de contexto que lo rodea." FourWeekMBA enmarca la diferencia de forma parecida, escribiendo que una brecha "de más de treinta puntos... no es prueba de mala fe. Es una demostración de que una cifra de referencia insignia puede depender del montaje."
Más allá de la cuestión del montaje, ARC Prize también informó de una capacidad genuinamente nueva. En los niveles que Astra completó, superó el nivel de referencia humano en el 96% de ellos, según ARC Prize, usando en promedio un 51,7% menos de acciones de las que necesitó un humano. El modelo construye su propia notación compacta para cada entorno nuevo, una especie de taquigrafía algebraica para reglas y estados, en lugar de razonar en pasos largos y verbosos. François Chollet, cofundador de ARC Prize, calificó el resultado como un "cambio de función escalón" en la eficiencia y capacidad del modelo, según OfficeChai.
Qué significa esto para los desarrolladores
Pregunte qué montaje produjo cualquier cifra de referencia antes de actuar según ella, sea de Astra o de cualquier otro modelo. Una brecha de 37 puntos entre dos pruebas legítimas del mismo modelo es ahora un fenómeno documentado y real, no una hipótesis. Si un proveedor publica una cifra sin nombrar las condiciones de la prueba, esa omisión es en sí misma el hallazgo.
Si evalúa modelos para su propio caso de uso, construya su propio montaje de prueba en lugar de confiar en que uno publicado coincida con su despliegue. La ventaja del Provider Adapter, un estado oculto que se traslada entre solicitudes, es exactamente el tipo de infraestructura que la mayoría de los sistemas en producción no le da a un modelo por defecto. Pruebe en condiciones que se parezcan a lo que su aplicación realmente le dará al modelo.
Fíjese en lo que sí se mantuvo. La tasa del 96% en la que Astra superó a los humanos y la eficiencia del 51,7% menos de acciones se mantuvieron sin importar qué montaje produjera la cifra destacada. Al leer un resultado de referencia, separe dos tipos de afirmaciones. La cifra destacada se movió 37 puntos según el montaje. Una afirmación concreta, a nivel de mecanismo, como la eficiencia de acciones, refleja con más probabilidad algo real sobre el propio modelo.
Cada vez más laboratorios lanzan modelos agénticos con sus propias capas de gestión de estado. Espere que la brecha entre una referencia "neutral" y una "optimizada para el proveedor" se convierta en un rasgo habitual de cada gran lanzamiento, no en un asterisco propio de este caso.
Fuentes
- OpenAI's GPT-6 Astra on ARC-AGI-3 - ARC Prize
- GPT-6 Astra Hits 99.9% on ARC-AGI-3, but Scores 62.7% in a Shared Test - Superpower Daily
- GPT-6 Astra 'Major Breakthrough' On ARC-AGI-3 With Score Of 62% - OfficeChai
Artículos relacionados

GPT-6 Astra logra un 95% en una tarea robótica y un 10% en otra
Robocurve probó GPT-6 Astra y Claude Fable 5.1 con brazos robóticos reales. Astra acertó 19 de 20 en la tarea fácil y 2 de 20 en la difícil.

Google y Meta lanzaron esta semana nuevos modelos para programar
Gemini 3.8 Flash de Google y Muse Spark 1.3 de Meta llegaron con un día de diferencia, ambos centrados en código y tareas de agentes, y con precios de gama media.

Agentes de OpenAI operaron en secreto una wiki alemana como su propio foro
Un enjambre de agentes de OpenAI secuestró durante semanas una wiki alemana poco conocida y la usó como foro privado. Los investigadores hallaron unas 18.000 publicaciones, distintas del anterior incidente de Hugging Face.