GPT-6 Astra entra em disponibilidade geral no Bedrock e no Copilot
O GPT-6 Astra está em disponibilidade geral no Amazon Bedrock a US$ 10 por milhão de tokens de entrada, e no GitHub Copilot para os planos Pro+, Max, Business e Enterprise.
3 min de leitura

Em números
- standard price per million input / output tokens, short context
- $10 / $50
- per million cached input tokens, short context
- $1
- input tokens of context on Amazon Bedrock
- 1M
O GPT-6 Astra da OpenAI agora está em disponibilidade geral fora dos próprios produtos da OpenAI. O GitHub o colocou em disponibilidade geral no Copilot em 4 de setembro de 2026, e a AWS o colocou em disponibilidade geral no Amazon Bedrock em 8 de setembro de 2026. No Bedrock, ele aceita uma janela de contexto de até 1 milhão de tokens de entrada.
Para os desenvolvedores, o número que importa é a conta, e a tabela de preços da OpenAI é mais complicada do que uma tarifa única.
Quanto custa
A documentação de preços da OpenAI divide o GPT-6 Astra de duas formas ao mesmo tempo. Os preços mudam com o tamanho do seu contexto, e de novo conforme você escolhe o modo Standard ou o modo Fast. Todos os valores são por milhão de tokens.
| Modo e contexto | Entrada | Entrada em cache | Saída |
|---|---|---|---|
| Standard, contexto curto | $10.00 | $1.00 | $50.00 |
| Standard, contexto longo | $20.00 | $2.00 | $75.00 |
| Modo Fast, contexto curto | $20.00 | - | $100.00 |
| Modo Fast, contexto longo | $40.00 | - | $150.00 |
Dois detalhes são fáceis de deixar passar e caros de descobrir tarde.
O modo Fast dobra o preço de entrada e dobra o preço de saída em relação ao Standard. Ele também não está disponível em todo lugar: a documentação da OpenAI afirma que "o modo Fast não está disponível para o GPT-6 Astra com residência de dados na UE. Use o processamento Standard para essas requisições".
Separadamente, modelos lançados depois de 5 de março de 2026 carregam um aumento de custo de 10% quando chamados por endpoints regionais. O GPT-6 Astra está dentro dessa janela, então uma implantação regional custa mais do que a tabela acima.
A entrada em cache é onde está a economia de verdade. A US$ 1,00 contra US$ 10,00, um acerto de cache em contexto curto custa um décimo de uma leitura nova. Esse padrão agora é regra entre os provedores de fronteira, e a Anthropic mexeu na mesma alavanca quando o Claude Fable 5.1 cortou em 75% as leituras de cache mantendo os preços dos tokens inalterados.
Onde consegui-lo
| Plataforma | Detalhes |
|---|---|
| Amazon Bedrock | Disponibilidade geral em 8 de setembro de 2026. Até 1M de tokens de entrada. O ChatGPT Work e o Codex podem ser configurados para usá-lo aqui |
| GitHub Copilot | Disponibilidade geral em 4 de setembro de 2026, pelo seletor de modelos |
| Planos do Copilot | Pro+, Max, Business e Enterprise |
| Superfícies do Copilot | VS Code, Visual Studio, Copilot CLI, o agente de codificação, o app do Copilot, github.com, GitHub Mobile, IDEs da JetBrains, Xcode e Eclipse |
O GitHub descreve a liberação no Copilot como gradual, então o modelo pode não aparecer no seu seletor no primeiro dia. Administradores dos planos Business e Enterprise controlam o acesso por políticas de modelo, o que significa que um desenvolvedor individual em um plano corporativo pode estar esperando por um administrador, e não pelo GitHub.
O GitHub também afirma que o uso no Copilot é cobrado como "cobrança por uso ao preço de lista do provedor OpenAI". As tarifas da tabela acima são as que você paga lá, não uma tarifa separada do Copilot.
A AWS aponta para a documentação do Bedrock quanto à disponibilidade por região, em vez de listar regiões no anúncio, e nenhum dos dois anúncios informa limites de taxa.
O que isso significa para os desenvolvedores
Precifique a sua própria carga de trabalho antes de trocar qualquer coisa. A divisão em quatro entre tamanho de contexto e modo significa que uma única tarifa de manchete diz muito pouco. Na saída, uma chamada em modo Fast com contexto longo custa três vezes a tarifa Standard de contexto curto.
Verifique se você está mesmo em contexto curto. A documentação da OpenAI precifica contexto curto e longo de forma diferente, mas os anúncios não dizem onde fica a fronteira. Se os seus prompts ficam perto de um limite que você não consegue ver, o seu custo por chamada pode mudar sem que o seu código mude. Vale medir isso com tráfego real antes de comprometer um orçamento.
Se você está na UE, planeje sem o modo Fast em vez de contar com ele. A residência de dados na UE o descarta por completo, e um endpoint regional acrescenta 10% por cima. Uma arquitetura que pressupõe o modo Fast não sobrevive a uma revisão de conformidade que exija residência de dados.
O conselho sobre cache é o menos glamouroso e o mais valioso. Estruture os prompts de modo que a parte estável venha primeiro e permaneça idêntica byte a byte entre as chamadas, porque é isso que torna um acerto de cache possível. A um décimo do preço de entrada, acertar isso vale mais do que a maioria das escolhas de modelo.
Uma ressalva sobre capacidade. Os resultados de benchmark publicados do Astra variaram bastante conforme a forma de testá-lo, incluindo uma diferença de 37 pontos no ARC-AGI-3 que se devia ao harness de teste. A disponibilidade geral muda o que você pode comprar, não o que ele consegue fazer. Rode a sua própria avaliação nas suas próprias tarefas antes de mover tráfego de produção.
Fontes
- OpenAI GPT-6 Astra is now generally available on Amazon Bedrock - AWS
- GPT-6 Astra is generally available in GitHub Copilot - GitHub Changelog
- OpenAI API pricing - OpenAI
Artigos relacionados

O Jev, da TypeSafe, devolve decisões tipadas, não texto
O Jev responde em 70 a 500 milissegundos e custa 0,042 dólar por milhão de tokens de entrada, com saída grátis. Ele não gera texto de jeito nenhum.

DeepSeek avisa desenvolvedores sobre aumento significativo nos preços da API
A DeepSeek avisou os desenvolvedores em 6 de agosto que os preços da API vão subir 'significativamente' em breve, sem números nem datas - enquanto o V4-Flash é o modelo conhecido mais barato de rodar.

Claude Fable 5.1 corta 75% no custo de leitura de cache
O Fable 5.1 mantém entrada e saída em 10 e 50 dólares por milhão de tokens e baixa a leitura de cache de 1,00 para 0,25 dólar. O Mythos 5.1 segue por convite.