Skip to content
Tech AI Wire
AI & LLMs

NvidiaのGroq 3 LPX、推論専用チップが本格生産へ

4 分で読めます

著者 Tech AI Wire Team

数字で見る

3,400
output tokens/sec on Gemma 4 31B at 100K context
256
LPX accelerators in one rack
$20B
paid for Groq in December 2025 (SiliconANGLE)
A dark server rack with rows of gold-lit accelerator trays, photographed against black

Nvidiaは2026年8月24日、トークンを生成することしかしないチップ、Groq 3 LPXが本格生産に 入ったと発表した。その背後にある賭けはアーキテクチャの賭けだ。1台のGPUが推論要求の すべての段階を処理するのではなく、Nvidiaはいま仕事を分割する。Rubin GPUが文脈を噛み 砕き、別のアクセラレータが利用者が実際に待っている部分を受け持つ。エージェントを作る 者にとって、これはエージェントが生きているように感じられるか壊れて見えるかを決める 唯一の数値--次のトークンまでの時間--についての主張である。

仕事はどう分けられるのか

Nvidiaの開発者ブログはその分割を正確に記す。Vera Rubin GPUがprefillとdecodeの attentionを担い、LPXアクセラレータは遅延に敏感なdecodeの構成要素--feed-forwardと mixture-of-expertsの実行--をNvidiaがAttention-FFN Disaggregationと呼ぶループを通じて 引き受ける。NVIDIA Dynamoが、分離されたバックエンドをまたぐ異種混在のサービングを 統括する。

なぜ手間をかけるのか。推論要求の二つの段階は、正反対のハードウェアを求める。10万 トークンの文脈を読むのは帯域に律速されるバッチ処理で、GPUに向く。次のトークンを出す のは小さく直列で遅延に律速される操作で、ほとんどメモリを待っている。両方を同じ シリコンで動かせば、どちらか一方は常にひどい扱いを受ける。そしてツールがさらに文脈を 返すあいだ絶えずトークンを出し続けるエージェントのループでは、ひどい扱いを受けている 側こそ、利用者の目に触れる側だ。

ラック、紙の上では

仕様数値
ラックあたりのアクセラレータ数256
FP8演算性能315 PFLOPS
SRAM合計128 GB
オンチップ帯域40 PB/s
チップ間帯域640 TB/s

この表の数値はすべて単一の情報源--Nvidia自身の開発者ブログ、2026年3月16日公開、 今回の生産発表より6か月前--に由来する。同じ記事は、1兆パラメータ級モデルにおいて GB200システム比で最大35倍のメガワットあたり推論スループット、最大10倍の収益機会を 主張する。利用者あたり毎秒400トークンの対話性水準での測定だ。これはNvidiaが自社の 旧世代ハードウェアについて出した数字であり、ベンチマークではなくベンダーによる モデル化として読むべきものである。

外部の名前がついた唯一の数字

外部の名前がついた数値はこれだ。Artificial Analysisが、オープンウェイトのGemma 4 31B で文脈長10万トークンのとき、毎秒3,400の出力トークンを計測した。Nvidiaのニュース ルームはこれを、最も近い代替プラットフォームより「4倍の応答性」と表現する。ニュース ルームの記事とSiliconANGLEは、同一の内容を報じている。

これは一つのモデル、一つの文脈長での結果であり、比較対象は名指しされていない。それでも 発表のなかで最も有用な数値ではある。メガワットあたりスループットの主張は、自分の エージェントが機敏に感じられるかを開発者に教えてくれないからだ。

実際に何が、誰に届くのか

Nvidiaは最初の本番顧客としてNebiusを挙げ、同社のToken Factoryプラットフォームを通じて 提供するとしている。またGroq自身も早期採用者になる予定だという。Hot Chips 2026から 報じたSiliconANGLEは、Nvidiaの記事がまるごと省いた背景を補う。Nvidiaは2025年12月に Groqを200億ドルで買収し、技術をライセンスし、創業者Jonathan Rossと社長Sunny Madraを 迎えた。この価格は、ここに挙げた情報源のうちSiliconANGLEだけに現れる。

名称のねじれも一つ書き留めておく。開発者ブログは部品を「Groq 3 LPU accelerators」と 呼び、SiliconANGLEは「LP30」と呼ぶ。情報源はこの製品の呼び名で一致していない。

これが開発者にとって意味すること

ここにあるのは買うチップではない。借りる容量であり、当面の問いは、Nebiusや CoreWeave級の事業者、あるいは既存の推論ベンダーがそれを提供するのか、そして出力 100万トークンあたりいくらなのか、である。何かを書き直す前にそれを尋ねたい。応答性 4倍の主張は、価格表との接触に耐えたときにだけ意味を持つ。

転用できる考えはprefillとdecodeの分離だ。文脈処理とトークン生成は別の作業負荷である という前提のうえにNvidiaがシリコンを作っているなら、それはサービングのスタックが今後 どんな形になるかについての強い信号であり、今日のオープンソースのサービングにすでに 現れている。自前で推論を回している人は、二つの段階を別々に計測すべきだ--最初の トークンまでの時間と、トークン間の遅延を。単一の平均値は、このハードウェアが解こうと している問題をちょうど覆い隠す。

エージェントの遅延は希望ではなく予算として扱いたい。Nvidiaが専用のdecodeチップを 売れるのは、エージェントのループが絶えずトークンを出し、ツール呼び出しごとに周期が やり直されるからだ。自分のエージェントがモデル呼び出しを10回直列に行うなら、利用者が 答えを見る前にトークン間遅延は10倍される。この計算は今週、自分のトレースでやってみる 価値がある。費用はかからず、専用推論ハードウェアが将来の予算項目になるのか、興味深い 見出しにとどまるのかを教えてくれる。