Skip to content
Tech AI Wire
AI & LLMs

El chip de inferencia Groq 3 LPX de Nvidia entra en producción

4 min de lectura

Por Tech AI Wire Team

En cifras

3,400
output tokens/sec on Gemma 4 31B at 100K context
256
LPX accelerators in one rack
$20B
paid for Groq in December 2025 (SiliconANGLE)
A dark server rack with rows of gold-lit accelerator trays, photographed against black

Nvidia anunció el 24 de agosto de 2026 que Groq 3 LPX, un chip diseñado para no hacer nada más que generar tokens, está en plena producción. La apuesta de fondo es arquitectónica: en lugar de que una GPU se ocupe de todas las fases de una petición de inferencia, Nvidia ahora reparte el trabajo y deja que las GPU Rubin mastiquen el contexto mientras un acelerador aparte atiende la parte en la que el usuario realmente espera. Para quien construye agentes, esto es una afirmación sobre la única cifra que decide si un agente parece vivo o roto: el tiempo hasta el siguiente token.

Cómo se reparte el trabajo

El blog para desarrolladores de Nvidia describe la división con precisión: las GPU Vera Rubin se encargan del prefill y de la atención en el decodificado, mientras que los aceleradores LPX asumen los componentes de decodificado sensibles a la latencia -la ejecución feed-forward y mixture-of-experts- a través de lo que Nvidia llama un bucle de Attention-FFN Disaggregation. NVIDIA Dynamo orquesta el servicio heterogéneo entre esos backends desagregados.

¿Por qué molestarse? Las dos fases de una petición de inferencia quieren hardware opuesto. Leer un contexto de 100.000 tokens es un trabajo por lotes limitado por el ancho de banda, que le va bien a una GPU. Emitir el siguiente token es una operación pequeña, en serie y limitada por la latencia, que sobre todo espera a la memoria. Ejecutar ambas en el mismo silicio significa que una siempre queda mal atendida, y en un bucle de agente -que emite tokens de forma continua mientras las herramientas devuelven más contexto- la mal atendida es justo la que ve el usuario.

El rack, sobre el papel

EspecificaciónCifra
Aceleradores por rack256
Cómputo FP8315 PFLOPS
SRAM total128 GB
Ancho de banda en el chip40 PB/s
Ancho de banda chip a chip640 TB/s

Todas las cifras de esa tabla provienen de una sola fuente: el propio blog para desarrolladores de Nvidia, publicado el 16 de marzo de 2026, seis meses antes de este anuncio de producción. Ese mismo texto afirma hasta 35 veces más rendimiento de inferencia por megavatio y hasta diez veces más oportunidad de ingresos para modelos de un billón de parámetros frente a sistemas GB200, medido a 400 tokens por segundo y por usuario. Son cifras de Nvidia sobre hardware más antiguo de Nvidia, y deben leerse como modelado del proveedor, no como un benchmark.

La única cifra de fuera

La cifra que lleva un nombre ajeno: Artificial Analysis midió 3.400 tokens de salida por segundo con el modelo de pesos abiertos Gemma 4 31B y un contexto de 100.000 tokens, algo que la sala de prensa de Nvidia traduce como «4 veces más capacidad de respuesta» que la plataforma alternativa más cercana. Tanto la nota de prensa como SiliconANGLE lo informan de forma idéntica.

Es un modelo a una longitud de contexto, y no se nombra el objetivo de la comparación. Sigue siendo la cifra más útil del anuncio, porque las afirmaciones de rendimiento por megavatio no le dicen a una desarrolladora si su agente se sentirá rápido.

Qué se entrega en realidad, y a quién

Nvidia nombra a Nebius como primer cliente en producción, que lo despliega a través de su plataforma de inferencia Token Factory, y dice que Groq misma planea ser una de las primeras en adoptarlo. SiliconANGLE, informando desde Hot Chips 2026, añade el trasfondo que los textos de Nvidia omiten por completo: Nvidia compró Groq por 20.000 millones de dólares en diciembre de 2025, licenciando la tecnología y contratando al fundador Jonathan Ross y al presidente Sunny Madra. Ese precio aparece, entre estas fuentes, solo en SiliconANGLE.

Un detalle de nomenclatura que conviene señalar: el blog para desarrolladores llama a las piezas «aceleradores Groq 3 LPU» y SiliconANGLE las llama «LP30». Las fuentes no se han puesto de acuerdo en cómo se llama esto.

Qué significa esto para los desarrolladores

Nada de esto es un chip que compres. Es capacidad que alquilas, y la pregunta inmediata es si Nebius, proveedores del tipo CoreWeave o tu proveedor de inferencia actual lo ofrecerán, y a qué precio por millón de tokens de salida. Haz esa pregunta antes de reescribir nada: una promesa de cuadruplicar la capacidad de respuesta solo cuenta si sobrevive al contacto con una lista de precios.

La idea transferible es la desagregación entre prefill y decodificado. Si Nvidia está construyendo silicio en torno a la premisa de que procesar contexto y generar tokens son cargas distintas, es una señal fuerte de cómo van a ser las pilas de servicio, y ya se ve hoy en el servicio de código abierto. Quien ejecute su propia inferencia debería medir las dos fases por separado -tiempo hasta el primer token frente a latencia entre tokens- porque una sola cifra promediada esconde justo el problema que este hardware existe para resolver.

Trata la latencia de los agentes como un presupuesto y no como una esperanza. Si Nvidia puede vender un chip dedicado al decodificado es porque los bucles de agente emiten tokens sin parar y cada llamada a una herramienta reinicia el ciclo. Si tu agente hace diez llamadas al modelo en serie, la latencia entre tokens se multiplica por diez antes de que un usuario vea una respuesta. Vale la pena hacer esa cuenta esta semana con tus propias trazas: no cuesta nada y te dice si el hardware de inferencia especializado será una partida de tu presupuesto o un titular interesante.