O chip de inferência Groq 3 LPX da Nvidia entra em produção plena
4 min de leitura
Em números
- 3,400
- output tokens/sec on Gemma 4 31B at 100K context
- 256
- LPX accelerators in one rack
- $20B
- paid for Groq in December 2025 (SiliconANGLE)

A Nvidia anunciou em 24 de agosto de 2026 que o Groq 3 LPX, um chip feito para não fazer nada além de gerar tokens, está em produção plena. A aposta por trás disso é arquitetural: em vez de uma GPU tratar todas as fases de uma requisição de inferência, a Nvidia agora divide o trabalho, deixando as GPUs Rubin mastigarem o contexto enquanto um acelerador separado cuida da parte pela qual o usuário realmente espera. Para quem constrói agentes, isso é uma afirmação sobre o único número que decide se um agente parece vivo ou quebrado: o tempo até o próximo token.
Como o trabalho é dividido
O blog para desenvolvedores da Nvidia descreve a divisão com precisão: as GPUs Vera Rubin cuidam do prefill e da atenção na decodificação, enquanto os aceleradores LPX assumem os componentes de decodificação sensíveis à latência - a execução feed-forward e mixture-of-experts - por meio do que a Nvidia chama de laço de Attention-FFN Disaggregation. O NVIDIA Dynamo orquestra o serviço heterogêneo entre esses backends desagregados.
Por que se dar ao trabalho? As duas fases de uma requisição de inferência querem hardware oposto. Ler um contexto de 100 mil tokens é um trabalho em lote limitado por banda, que combina com uma GPU. Emitir o próximo token é uma operação pequena, serial e limitada por latência, que na maior parte do tempo espera pela memória. Rodar as duas no mesmo silício significa que uma delas é sempre mal atendida - e num laço de agente, que emite tokens continuamente enquanto ferramentas devolvem mais contexto, a mal atendida é exatamente a que o usuário vê.
O rack, no papel
| Especificação | Número |
|---|---|
| Aceleradores por rack | 256 |
| Computação FP8 | 315 PFLOPS |
| SRAM total | 128 GB |
| Banda no chip | 40 PB/s |
| Banda chip a chip | 640 TB/s |
Todo número dessa tabela vem de uma única fonte - o próprio blog para desenvolvedores da Nvidia, publicado em 16 de março de 2026, seis meses antes deste anúncio de produção. O mesmo texto afirma até 35 vezes mais throughput de inferência por megawatt e até dez vezes mais oportunidade de receita para modelos de um trilhão de parâmetros em relação a sistemas GB200, medido a 400 tokens por segundo por usuário. São números da Nvidia sobre hardware mais antigo da Nvidia, e devem ser lidos como modelagem de fornecedor, não como benchmark.
O único número de fora
O número que carrega um nome externo: a Artificial Analysis mediu 3.400 tokens de saída por segundo no modelo de pesos abertos Gemma 4 31B com contexto de 100 mil tokens, o que a sala de imprensa da Nvidia traduz como "4x mais responsividade" que a plataforma alternativa mais próxima. Tanto o texto da sala de imprensa quanto a SiliconANGLE relatam isso de forma idêntica.
É um modelo em um comprimento de contexto, e o alvo da comparação não é nomeado. Ainda é o número mais útil do anúncio, porque alegações de throughput por megawatt não dizem a um desenvolvedor se o seu agente vai parecer rápido.
O que está sendo entregue de fato, e para quem
A Nvidia aponta a Nebius como primeira cliente em produção, entregando pela sua plataforma de inferência Token Factory, e diz que a própria Groq planeja ser uma das primeiras adotantes. A SiliconANGLE, reportando do Hot Chips 2026, acrescenta o histórico que os textos da Nvidia omitem por completo: a Nvidia comprou a Groq por US$ 20 bilhões em dezembro de 2025, licenciando a tecnologia e contratando o fundador Jonathan Ross e o presidente Sunny Madra. Esse preço aparece, entre estas fontes, apenas na SiliconANGLE.
Uma confusão de nome vale registrar: o blog para desenvolvedores chama as peças de "aceleradores Groq 3 LPU"; a SiliconANGLE as chama de "LP30". As fontes não chegaram a um acordo sobre como a coisa se chama.
O que isso significa para desenvolvedores
Nada aqui é um chip que se compra. É capacidade que se aluga, e a pergunta de curto prazo é se a Nebius, provedores da classe da CoreWeave ou o seu fornecedor de inferência atual vão expor isso - e a que preço por milhão de tokens de saída. Faça essa pergunta antes de reescrever qualquer coisa: uma alegação de 4x mais responsividade só importa se sobreviver ao contato com uma tabela de preços.
A ideia transferível é a desagregação entre prefill e decodificação. Se a Nvidia está construindo silício em torno da premissa de que processar contexto e gerar tokens são cargas diferentes, esse é um sinal forte sobre o formato que as pilhas de serviço vão ter - e já é visível no serviço open source de hoje. Quem roda a própria inferência deveria medir as duas fases separadamente - tempo até o primeiro token contra latência entre tokens - porque um único número médio esconde exatamente o problema que este hardware existe para resolver.
Trate a latência de agentes como orçamento, não como esperança. A Nvidia consegue vender um chip dedicado à decodificação porque laços de agente emitem tokens constantemente e cada chamada de ferramenta reinicia o ciclo. Se o seu agente faz dez chamadas de modelo em sequência, a latência entre tokens é multiplicada por dez antes de um usuário ver uma resposta. Essa conta vale ser feita esta semana nos seus próprios traces: não custa nada e diz se hardware de inferência especializado será uma linha no seu orçamento ou uma manchete interessante.
Sources
- NVIDIA Groq 3 LPX Now in Full Production With World-Class Speed for Agentic AI - NVIDIA Newsroom
- Inside NVIDIA Groq 3 LPX, the low-latency inference accelerator for the NVIDIA Vera Rubin platform - NVIDIA Developer Blog
- Nvidia's dedicated inference accelerator Groq 3 LPX enters full production to supercharge AI agents - SiliconANGLE