Pular para o conteúdo

OpenAI diz que seu chip Jalapeño supera o GB300 da Nvidia por watt

Os primeiros benchmarks publicados do Jalapeño, da OpenAI, alegam 1,5 a 1,9 vezes mais trabalho por quilowatt que o GB300 da Nvidia, com metade da energia. Os números são da própria OpenAI.

Por Tech AI Wire Team

4 min de leitura

XLinkedIn
A bare AI accelerator chip standing next to a larger Nvidia module in a black heatsink shroud on a gray studio backdrop.

Em números

more throughput per kilowatt, per OpenAI
1.5-1.9x
lower end-to-end latency at the top of the range
3.6x
HBM4 memory on each chip
216 GB
from first design to tape-out
9 months
Rated power per accelerator
OpenAI Jalapeño
700W
Nvidia GB300
1400W

A OpenAI publicou os primeiros benchmarks do Jalapeño, o chip de inferência que construiu com a Broadcom, e diz que ele supera o carro-chefe da Nvidia. O The Register e o TechCrunch relataram os números em 25 de agosto de 2026. A OpenAI alega 1,5 a 1,9 vezes mais trabalho de IA por quilowatt do que sistemas concorrentes, e latência 1,7 a 3,6 vezes menor. O chip tem potência nominal de metade da do GB300 da Nvidia. Se os números se sustentarem fora dos testes da própria OpenAI, o custo de servir um modelo acabou de ganhar um segundo fornecedor.

Inferência é o trabalho de rodar um modelo treinado para responder a requisições, em oposição a treiná-lo. É para onde vai a maior parte da eletricidade de um produto de IA depois que o produto tem usuários. Um chip que faz mais inferência por watt corta a maior linha da conta.

Os números que a OpenAI publicou

O Tom's Hardware relata que o Jalapeño tem potência nominal de 700 watts, contra 1.400 watts do GB300 da Nvidia. Com base nisso, a OpenAI alega até 1,9 vezes a vazão por quilowatt. O The Register acrescenta que, para trabalho de latência ultrabaixa, a vantagem sobe para 2,1 a 4,1 vezes. Ele também estima o consumo de energia do chip em 40% a 60% dos sistemas de GPU concorrentes.

As especificações de um único chip, segundo o The Register:

MedidaJalapeño
Computação em MXFP413,4 petaFLOPS
Memória216 GB HBM4
Largura de banda de memória15,4 TB/s
Potência nominal700 W

MXFP4 é um formato numérico de 4 bits, que compacta os pesos para que mais do modelo caiba na memória rápida. HBM4 é memória de alta largura de banda, a memória empilhada que fica ao lado do chip. Um rack completo de 128 chips chega a 1,7 exaFLOPS de computação em 4 bits, 27,5 TB de memória e quase 2 petabytes por segundo de largura de banda.

Como ele consegue a velocidade

A aposta do projeto é mover menos dados. Richard Ho, chefe de hardware da OpenAI, disse ao TechCrunch: "Projetamos o Jalapeño para minimizar a movimentação de dados e os atrasos de comunicação." O The Register relata um grande cache SRAM no chip e um posicionamento cuidadoso do KV cache, o armazenamento de tokens passados que um modelo consulta a cada passo.

Isso importa porque a inferência tem duas fases. O prefill lê o prompt inteiro de uma vez, e o decode produz a resposta um token por vez. O decode é a parte lenta, e ele é limitado pela rapidez com que o chip consegue buscar o que já sabe. Manter esses dados perto é o que os números de latência refletem.

O chip também foi construído em um prazo incomum. O The Register relata 9 meses do primeiro projeto até o tape-out, o ponto em que um projeto é congelado para fabricação. Ele o descreve como "projetado (em parte) por IA, para IA". O TechCrunch confirma que os próprios modelos da OpenAI ajudaram no projeto.

Quando você poderia de fato usá-lo

Não tão cedo. O TechCrunch relata que a OpenAI espera implantar o Jalapeño em "volumes muito pequenos" no fim de 2026, com implantação mais ampla em 2027. O projeto foi anunciado pela primeira vez em outubro de 2025, e o TechCrunch o descreve como uma plataforma multigeracional, então este é o primeiro chip de uma linha.

Ho foi direto sobre o que acha que os resultados significam. "O resumo é que os resultados mostram um avanço de desempenho muito, muito significativo sobre o estado da arte", disse ele ao TechCrunch. Ele acrescentou que o Jalapeño "pode servir mais trabalho de IA por unidade de energia, e ao mesmo tempo devolver respostas mais rápido".

O que isso significa para desenvolvedores

Leia cada número com um fato à sua frente: os números vêm da OpenAI. Nenhum laboratório independente os reproduziu ainda, e a comparação é contra a potência nominal publicada pela Nvidia. O primeiro benchmark de um fornecedor sobre o próprio chip é uma alegação, não uma medição. Trate-o como uma razão para observar, não como uma razão para replanejar.

Se você roda inferência em escala, a métrica a roubar é trabalho por quilowatt. A maioria dos times ainda faz orçamento por contagem de GPUs. Energia é a restrição que de fato limita um data center, e é o eixo que a OpenAI escolheu para brigar. Comece a acompanhar tokens por quilowatt-hora da sua própria carga de trabalho agora, para poder avaliar qualquer chip, incluindo este, quando ele for lançado.

Você não vai comprar um Jalapeño. Os relatos descrevem um chip construído para a própria frota da OpenAI, em volumes pequenos no começo. A forma como ele chega até você é pelos preços e pela latência da API da OpenAI, em 2027 na melhor das hipóteses. Se o seu produto depende de decode rápido, observe os números de latência por token da OpenAI no ano que vem para o primeiro sinal real.

O tape-out em nove meses é a parte que vale lembrar. Um laboratório de fronteira projetou um chip de inferência competitivo em menos de um ano, com os próprios modelos ajudando. Se isso se confirmar, silício customizado deixa de ser uma aposta de cinco anos que só as maiores empresas podem fazer. A posição defensável da Nvidia passa a ser software e fornecimento, não eficiência bruta.

Fontes

  1. OpenAI's Jalapeño chip is built for fast inference at scale, benchmarks show - TechCrunch
  2. OpenAI's upcoming Jalapeño chip looks like it'll be an inference beast - The Register
  3. OpenAI says its Jalapeño chip beats Nvidia's GB300 in first published benchmarks - Tom's Hardware

Artigos relacionados