Skip to content
Tech AI Wire

GPT-6 Astra entra em disponibilidade geral no Bedrock e no Copilot

O GPT-6 Astra está em disponibilidade geral no Amazon Bedrock a US$ 10 por milhão de tokens de entrada, e no GitHub Copilot para os planos Pro+, Max, Business e Enterprise.

Por Tech AI Wire Team

3 min de leitura

XLinkedIn
The GitHub Copilot model picker in Visual Studio Code, open and showing GPT-6 Astra among the selectable models.

Em números

standard price per million input / output tokens, short context
$10 / $50
per million cached input tokens, short context
$1
input tokens of context on Amazon Bedrock
1M

O GPT-6 Astra da OpenAI agora está em disponibilidade geral fora dos próprios produtos da OpenAI. O GitHub o colocou em disponibilidade geral no Copilot em 4 de setembro de 2026, e a AWS o colocou em disponibilidade geral no Amazon Bedrock em 8 de setembro de 2026. No Bedrock, ele aceita uma janela de contexto de até 1 milhão de tokens de entrada.

Para os desenvolvedores, o número que importa é a conta, e a tabela de preços da OpenAI é mais complicada do que uma tarifa única.

Quanto custa

A documentação de preços da OpenAI divide o GPT-6 Astra de duas formas ao mesmo tempo. Os preços mudam com o tamanho do seu contexto, e de novo conforme você escolhe o modo Standard ou o modo Fast. Todos os valores são por milhão de tokens.

Modo e contextoEntradaEntrada em cacheSaída
Standard, contexto curto$10.00$1.00$50.00
Standard, contexto longo$20.00$2.00$75.00
Modo Fast, contexto curto$20.00-$100.00
Modo Fast, contexto longo$40.00-$150.00

Dois detalhes são fáceis de deixar passar e caros de descobrir tarde.

O modo Fast dobra o preço de entrada e dobra o preço de saída em relação ao Standard. Ele também não está disponível em todo lugar: a documentação da OpenAI afirma que "o modo Fast não está disponível para o GPT-6 Astra com residência de dados na UE. Use o processamento Standard para essas requisições".

Separadamente, modelos lançados depois de 5 de março de 2026 carregam um aumento de custo de 10% quando chamados por endpoints regionais. O GPT-6 Astra está dentro dessa janela, então uma implantação regional custa mais do que a tabela acima.

A entrada em cache é onde está a economia de verdade. A US$ 1,00 contra US$ 10,00, um acerto de cache em contexto curto custa um décimo de uma leitura nova. Esse padrão agora é regra entre os provedores de fronteira, e a Anthropic mexeu na mesma alavanca quando o Claude Fable 5.1 cortou em 75% as leituras de cache mantendo os preços dos tokens inalterados.

Onde consegui-lo

PlataformaDetalhes
Amazon BedrockDisponibilidade geral em 8 de setembro de 2026. Até 1M de tokens de entrada. O ChatGPT Work e o Codex podem ser configurados para usá-lo aqui
GitHub CopilotDisponibilidade geral em 4 de setembro de 2026, pelo seletor de modelos
Planos do CopilotPro+, Max, Business e Enterprise
Superfícies do CopilotVS Code, Visual Studio, Copilot CLI, o agente de codificação, o app do Copilot, github.com, GitHub Mobile, IDEs da JetBrains, Xcode e Eclipse

O GitHub descreve a liberação no Copilot como gradual, então o modelo pode não aparecer no seu seletor no primeiro dia. Administradores dos planos Business e Enterprise controlam o acesso por políticas de modelo, o que significa que um desenvolvedor individual em um plano corporativo pode estar esperando por um administrador, e não pelo GitHub.

O GitHub também afirma que o uso no Copilot é cobrado como "cobrança por uso ao preço de lista do provedor OpenAI". As tarifas da tabela acima são as que você paga lá, não uma tarifa separada do Copilot.

A AWS aponta para a documentação do Bedrock quanto à disponibilidade por região, em vez de listar regiões no anúncio, e nenhum dos dois anúncios informa limites de taxa.

O que isso significa para os desenvolvedores

Precifique a sua própria carga de trabalho antes de trocar qualquer coisa. A divisão em quatro entre tamanho de contexto e modo significa que uma única tarifa de manchete diz muito pouco. Na saída, uma chamada em modo Fast com contexto longo custa três vezes a tarifa Standard de contexto curto.

Verifique se você está mesmo em contexto curto. A documentação da OpenAI precifica contexto curto e longo de forma diferente, mas os anúncios não dizem onde fica a fronteira. Se os seus prompts ficam perto de um limite que você não consegue ver, o seu custo por chamada pode mudar sem que o seu código mude. Vale medir isso com tráfego real antes de comprometer um orçamento.

Se você está na UE, planeje sem o modo Fast em vez de contar com ele. A residência de dados na UE o descarta por completo, e um endpoint regional acrescenta 10% por cima. Uma arquitetura que pressupõe o modo Fast não sobrevive a uma revisão de conformidade que exija residência de dados.

O conselho sobre cache é o menos glamouroso e o mais valioso. Estruture os prompts de modo que a parte estável venha primeiro e permaneça idêntica byte a byte entre as chamadas, porque é isso que torna um acerto de cache possível. A um décimo do preço de entrada, acertar isso vale mais do que a maioria das escolhas de modelo.

Uma ressalva sobre capacidade. Os resultados de benchmark publicados do Astra variaram bastante conforme a forma de testá-lo, incluindo uma diferença de 37 pontos no ARC-AGI-3 que se devia ao harness de teste. A disponibilidade geral muda o que você pode comprar, não o que ele consegue fazer. Rode a sua própria avaliação nas suas próprias tarefas antes de mover tráfego de produção.

Fontes

  1. OpenAI GPT-6 Astra is now generally available on Amazon Bedrock - AWS
  2. GPT-6 Astra is generally available in GitHub Copilot - GitHub Changelog
  3. OpenAI API pricing - OpenAI

Artigos relacionados