Aller au contenu

OpenAI affirme que sa puce Jalapeño bat la GB300 de Nvidia par watt

Les premiers benchmarks publiés par OpenAI pour Jalapeño revendiquent 1,5 à 1,9 fois plus de travail par kilowatt que la GB300 de Nvidia, pour moitié moins de puissance. Les chiffres sont ceux d'OpenAI.

Par Tech AI Wire Team

4 min de lecture

XLinkedIn
A bare AI accelerator chip standing next to a larger Nvidia module in a black heatsink shroud on a gray studio backdrop.

En chiffres

more throughput per kilowatt, per OpenAI
1.5-1.9x
lower end-to-end latency at the top of the range
3.6x
HBM4 memory on each chip
216 GB
from first design to tape-out
9 months
Rated power per accelerator
OpenAI Jalapeño
700W
Nvidia GB300
1400W

OpenAI a publié les premiers benchmarks de Jalapeño, la puce d'inférence qu'elle a conçue avec Broadcom, et affirme qu'elle bat le fleuron de Nvidia. The Register et TechCrunch ont rapporté les chiffres le 25 août 2026. OpenAI revendique 1,5 à 1,9 fois plus de travail d'IA par kilowatt que les systèmes concurrents, et une latence 1,7 à 3,6 fois plus faible. La puce est donnée pour la moitié de la puissance de la GB300 de Nvidia. Si les chiffres tiennent en dehors des propres tests d'OpenAI, le coût de servir un modèle vient de gagner un second fournisseur.

L'inférence est le travail consistant à exécuter un modèle entraîné pour répondre aux requêtes, par opposition à son entraînement. C'est là que va l'essentiel de l'électricité d'un produit d'IA une fois qu'il a des utilisateurs. Une puce qui fait plus d'inférence par watt réduit la plus grosse ligne de la facture.

Les chiffres publiés par OpenAI

Tom's Hardware rapporte que Jalapeño est donnée pour 700 watts contre 1 400 watts pour la GB300 de Nvidia. Sur cette base, OpenAI revendique jusqu'à 1,9 fois le débit par kilowatt. The Register ajoute que pour les travaux à très faible latence, l'avantage monte à 2,1 à 4,1 fois. The Register estime aussi la consommation de la puce à 40 % à 60 % de celle des systèmes GPU concurrents.

Les spécifications d'une seule puce, selon The Register :

MesureJalapeño
Calcul en MXFP413,4 pétaFLOPS
Mémoire216 Go HBM4
Bande passante mémoire15,4 To/s
Puissance nominale700 W

MXFP4 est un format de nombres sur 4 bits, qui compacte les poids pour qu'une plus grande part du modèle tienne dans la mémoire rapide. HBM4 est de la mémoire à haute bande passante, la mémoire empilée qui se trouve à côté de la puce. Un rack complet de 128 puces atteint 1,7 exaFLOPS de calcul 4 bits, 27,5 To de mémoire, et près de 2 pétaoctets par seconde de bande passante.

Comment elle obtient cette vitesse

Le pari de conception est de déplacer moins les données. Richard Ho, responsable du matériel chez OpenAI, a déclaré à TechCrunch : « Nous avons conçu Jalapeño pour minimiser les déplacements de données et les délais de communication. » The Register rapporte un grand cache SRAM sur la puce et un placement soigné du KV cache, la réserve de tokens passés qu'un modèle consulte à chaque étape.

Cela compte parce que l'inférence a deux phases. Le prefill lit tout le prompt d'un coup, et le décodage produit la réponse un token à la fois. Le décodage est la partie lente, et il est limité par la vitesse à laquelle la puce peut aller chercher ce qu'elle sait déjà. Garder ces données à proximité est ce que reflètent les chiffres de latence.

La puce a aussi été conçue exceptionnellement vite. The Register rapporte 9 mois entre la première conception et le tape-out, le moment où un design est gelé pour la fabrication. The Register la décrit comme « conçue (en partie) par l'IA, pour l'IA ». TechCrunch confirme que les propres modèles d'OpenAI ont aidé à la conception.

Quand vous pourriez vraiment l'utiliser

Pas bientôt. TechCrunch rapporte qu'OpenAI prévoit de déployer Jalapeño en « très petits volumes » fin 2026, avec un déploiement plus large en 2027. Le projet a été annoncé pour la première fois en octobre 2025, et TechCrunch le décrit comme une plateforme multigénérationnelle, il s'agit donc de la première puce d'une lignée.

Ho a été direct sur ce que signifient, selon lui, les résultats. « En résumé, les résultats montrent une avancée de performance très, très significative par rapport à l'état de l'art », a-t-il déclaré à TechCrunch. Il a ajouté que Jalapeño « peut servir plus de travail d'IA par unité de puissance, tout en renvoyant les réponses plus rapidement ».

Ce que cela signifie pour les développeurs

Lisez chaque chiffre avec un fait sous les yeux : les nombres viennent d'OpenAI. Aucun laboratoire indépendant ne les a encore reproduits, et la comparaison se fait avec la puissance nominale publiée par Nvidia. Le premier benchmark d'un fournisseur sur sa propre puce est une affirmation, pas une mesure. Traitez-le comme une raison de surveiller, pas comme une raison de tout replanifier.

Si vous faites de l'inférence à grande échelle, la métrique à emprunter est le travail par kilowatt. La plupart des équipes budgétisent encore en nombre de GPU. La puissance est la contrainte qui plafonne réellement un centre de données, et c'est l'axe qu'OpenAI a choisi pour se battre. Commencez dès maintenant à suivre les tokens par kilowattheure pour votre propre charge de travail, afin de pouvoir évaluer n'importe quelle puce, y compris celle-ci, quand elle sortira.

Vous n'achèterez pas de Jalapeño. Les articles décrivent une puce conçue pour la propre flotte d'OpenAI, en petits volumes d'abord. Elle vous atteindra par les prix et la latence de l'API d'OpenAI, en 2027 au plus tôt. Si votre produit dépend d'un décodage rapide, surveillez l'an prochain les chiffres de latence par token d'OpenAI pour le premier vrai signal.

Le tape-out en neuf mois est la partie à retenir. Un laboratoire de pointe a conçu une puce d'inférence compétitive en moins d'un an, avec l'aide de ses propres modèles. Si cela se confirme, le silicium sur mesure cesse d'être un pari à cinq ans que seules les plus grandes entreprises peuvent faire. La position défendable pour Nvidia devient le logiciel et l'approvisionnement, pas l'efficacité brute.

Sources

  1. OpenAI's Jalapeño chip is built for fast inference at scale, benchmarks show - TechCrunch
  2. OpenAI's upcoming Jalapeño chip looks like it'll be an inference beast - The Register
  3. OpenAI says its Jalapeño chip beats Nvidia's GB300 in first published benchmarks - Tom's Hardware

Articles liés