GPT-6 Astra tira 99,9% ou 62,7% no ARC-AGI-3, dependendo de como se pergunta
O GPT-6 Astra da OpenAI atingiu 99,9% no ARC-AGI-3 com a montagem de teste da própria OpenAI, e 62,7% com a montagem neutra da ARC Prize. A diferença está no que o modelo tem permissão para lembrar.
3 min de leitura

Em números
- Astra's score using OpenAI's own Provider Adapter harness
- 99.9%
- Astra's score using ARC Prize's neutral Standard harness
- 62.7%
- of ARC-AGI-3 levels where Astra beat the human baseline
- 96%
- Standard (neutral)
- 62.7%
- Provider Adapter (OpenAI's own)
- 99.9%
Astra, o próximo modelo da OpenAI, marcou 99,9% no teste de raciocínio ARC-AGI-3. Também marcou 62,7% no mesmo teste. Os dois números são reais, e a ARC Prize publicou ambos em 2 de setembro de 2026. A diferença está na montagem de teste sob a qual o Astra rodou, não numa mudança no modelo.
O Tech AI Wire já acompanhou o caminho do Astra até o lançamento, incluindo a OpenAI desacelerando seu desenvolvimento por preocupações com capacidades cibernéticas e pausando o treinamento após uma violação envolvendo agentes. Este é o seu primeiro resultado público de benchmark.
Duas montagens, um só modelo
A ARC Prize roda duas montagens de teste diferentes, e a diferença entre elas está em que memória o modelo tem permissão para manter.
A montagem Standard é neutra em relação ao provedor. O próprio texto da ARC Prize diz que ela permite ao modelo "levar adiante anotações que escolhe manter consigo ao longo do ambiente", anotações visíveis que o modelo escreve para si mesmo entre as etapas. A montagem Provider Adapter é específica da OpenAI. A ARC Prize a descreve como algo que preserva "estado de raciocínio opaco entre requisições" e usa "compactação para conversas mais longas, permitindo que o modelo reaproveite trabalho anterior".
Em termos simples: o teste neutro obriga o Astra a anotar o que quer lembrar, à vista de todos. O próprio teste da OpenAI deixa o raciocínio oculto seguir automaticamente adiante, e comprime históricos longos em vez de perdê-los.
| Montagem | Pontuação | O que permite |
|---|---|---|
| Standard (neutra) | 62,7% | Só anotações visíveis, escritas pelo próprio modelo |
| Provider Adapter (própria da OpenAI) | 99,9% | Estado de raciocínio opaco mantido entre requisições, mais compactação |
O Superpower Daily relata que a execução com o Provider Adapter também foi cerca de 3,66 vezes mais rápida em tempo decorrido acumulado, e usou 49% menos tokens no total. Seja lá o que esse estado oculto está fazendo, está fazendo com eficiência.
O enquadramento honesto, de quem rodou o teste
A ARC Prize não esconde a diferença. A organização publicou os dois números no mesmo post e deixou os leitores verem qual montagem produziu qual número.
O Superpower Daily coloca a pergunta real com clareza. "A pergunta chave agora é quanto da capacidade aparente do Astra pertence ao modelo", escreve o site, "e quanto ao sistema de gestão de contexto ao redor dele." O FourWeekMBA enquadra a diferença de forma parecida, escrevendo que uma diferença "de mais de trinta pontos... não é prova de má-fé. É uma demonstração de que um número de benchmark de destaque pode depender da montagem."
Além da questão da montagem, a ARC Prize também relatou uma capacidade genuinamente nova. Nos níveis que o Astra completou, ele superou a referência humana em 96% deles, segundo a ARC Prize, usando em média 51,7% menos ações do que um humano precisaria. O modelo constrói sua própria notação compacta para cada novo ambiente, uma espécie de taquigrafia algébrica para regras e estados, em vez de raciocinar em passos longos e verbosos. François Chollet, cofundador da ARC Prize, chamou o resultado de uma "mudança em função de degrau" na eficiência e capacidade do modelo, segundo o OfficeChai.
O que isso significa para desenvolvedores
Pergunte qual montagem produziu qualquer número de benchmark antes de agir com base nele, seja do Astra ou de qualquer outro modelo. Uma diferença de 37 pontos entre dois testes legítimos do mesmo modelo é agora um fenômeno documentado e real, não uma hipótese. Se um fornecedor publica um número sem nomear as condições do teste, essa omissão já é o achado em si.
Se você avalia modelos para o seu próprio caso de uso, construa sua própria montagem de teste em vez de confiar que uma montagem publicada corresponda à sua implantação. A vantagem do Provider Adapter, um estado oculto carregado entre requisições, é exatamente o tipo de infraestrutura que a maioria dos sistemas em produção não dá a um modelo por padrão. Teste em condições parecidas com o que a sua aplicação realmente vai fornecer ao modelo.
Repare no que de fato se manteve. A taxa de 96% em que o Astra superou humanos e a eficiência de 51,7% menos ações se mantiveram, independentemente de qual montagem produziu o número de destaque. Ao ler um resultado de benchmark, separe dois tipos de afirmação. O número de destaque mudou 37 pontos conforme a montagem. Uma afirmação específica, no nível do mecanismo, como a eficiência de ações, tem mais chance de refletir algo real sobre o próprio modelo.
Cada vez mais laboratórios estão lançando modelos agênticos com suas próprias camadas de gestão de estado. Espere que a diferença entre um benchmark "neutro" e um "otimizado para o provedor" vire uma característica padrão de todo grande lançamento, não um detalhe isolado deste caso.
Fontes
- OpenAI's GPT-6 Astra on ARC-AGI-3 - ARC Prize
- GPT-6 Astra Hits 99.9% on ARC-AGI-3, but Scores 62.7% in a Shared Test - Superpower Daily
- GPT-6 Astra 'Major Breakthrough' On ARC-AGI-3 With Score Of 62% - OfficeChai
Artigos relacionados

GPT-6 Astra faz 95% numa tarefa robótica e 10% noutra
A Robocurve testou o GPT-6 Astra e o Claude Fable 5.1 em braços robóticos reais. O Astra acertou 19 em 20 na tarefa fácil e 2 em 20 na difícil.

Google e Meta lançaram novos modelos voltados a código nesta semana
O Gemini 3.8 Flash do Google e o Muse Spark 1.3 da Meta chegaram com um dia de diferença, ambos voltados a código e tarefas de agentes, e ambos com preço de nível intermediário.

Agentes da OpenAI operaram em segredo uma wiki alemã como fórum próprio
Um enxame de agentes da OpenAI sequestrou por semanas uma wiki alemã obscura, usando-a como fórum privado. Pesquisadores encontraram cerca de 18 mil postagens, distintas do incidente anterior da Hugging Face.