Z.ai e IBM lanzan modelos de razonamiento de pesos abiertos con un día de diferencia
4 min de lectura
- GLM-5.2
- 4.6%
- GLM-5.3
- 28.3%

Dos modelos de razonamiento de pesos abiertos salieron con un día de diferencia. Z.ai publicó GLM-5.3-Flash el 26 de agosto de 2026 bajo licencia MIT, según MarkTechPost. IBM publicó Granite 4.2 el 25 de agosto de 2026 bajo Apache 2.0, según DataNorth. Pesos abiertos significa que se publican los propios ficheros del modelo, así que puedes descargarlos y ejecutarlos tú mismo. Los dos apuntan a hardware casi opuesto, y eso es lo que conviene entender antes de elegir uno.
Primero, una trampa de nombres. GLM-5.3 y GLM-5.3-Flash son lanzamientos distintos. DataNorth informa de que GLM-5.3 llegó el 14 de agosto de 2026 para trabajo de programación y ciberseguridad, con pesos abiertos prometidos unas dos semanas después. GLM-5.3-Flash es el lanzamiento del 26 de agosto, y sus pesos ya están en Hugging Face.
GLM-5.3-Flash: grande, barato de llamar, difícil de alojar
GLM-5.3-Flash es un modelo de mezcla de expertos con 320.000 millones de parámetros totales y 18.000 millones activos por token, según MarkTechPost. Una mezcla de expertos solo enciende una pequeña parte de sus parámetros para cada token, así que puede ser grande sin costar grandes cantidades de cómputo por token. Aquí activa 8 de 288 expertos.
MarkTechPost informa de que es el primer modelo nativamente multimodal de la serie GLM-5, que acepta entrada de imagen y vídeo, con una ventana de contexto de 1.048.576 tokens. Z.ai lo llama «el primer modelo nativamente multimodal de la serie GLM-5 y el modelo de programación capaz más barato». Las afirmaciones de eficiencia son concretas: 3 veces menos cómputo de atención y una caché KV 4,4 veces más pequeña que la de GLM-5.2.
El precio es donde aterriza el argumento. MarkTechPost enumera 0,15 dólares por millón de tokens de entrada, 0,03 dólares por millón de tokens de entrada en caché y 0,50 dólares por millón de tokens de salida. Z.ai dice que el modelo «supera a GLM-5.2 en benchmarks y en cargas de trabajo reales a alrededor de una décima parte del precio».
La pega está en el mismo artículo. Autoalojarlo exige hardware considerable, con unos pesos de alrededor de 306 GiB, y su capacidad de visión queda por detrás de Gemini 3.7 Flash.
Granite 4.2: lo bastante pequeño para ejecutarlo de verdad
IBM fue en la dirección contraria. DataNorth informa de que Granite 4.2 llega en tamaños de 3B, 8B y 30B parámetros bajo Apache 2.0, entrenado con unos 15 billones de tokens, incluido 1 billón de tokens sintéticos de código. El contexto es de 131.072 tokens, con una extensión declarada a 512K, y admite 12 idiomas.
Su rasgo de diseño más llamativo es lo que IBM llama «un interruptor de pensamiento, para que un mismo checkpoint pueda razonar paso a paso o responder directamente». Eso importa en la práctica: distribuyes un solo fichero de modelo y eliges en cada petición si pagas por tokens de razonamiento. DataNorth informa de que el modelo de 30B puntúa 57,00 en SWE-bench Verified, un benchmark que pide a un modelo arreglar issues reales de GitHub.
IBM publicó también modelos Granite Speech 5.0 Turbo CTC de 470M parámetros, que según DataNorth alcanzan un rendimiento de 12.600 RTFx en una NVIDIA H200.
Cara a cara
| GLM-5.3-Flash | Granite 4.2 | |
|---|---|---|
| Tamaños | 320B en total, 18B activos | 3B, 8B, 30B |
| Licencia | MIT | Apache 2.0 |
| Ventana de contexto | 1.048.576 tokens | 131.072 tokens |
| Entradas | texto, imagen, vídeo | texto |
| Tamaño de los pesos | unos 306 GiB | sin especificar |
| Benchmark citado | Terminal-Bench 3.0 al 28,3 % para GLM-5.3 | SWE-bench Verified 57,00 en 30B |
Qué significa esto para los desarrolladores
Elige por dónde va a ejecutarse el modelo, no por el número de parámetros. Un modelo de 320B con 306 GiB es un despliegue multi-GPU o una llamada a una API. Un modelo de 3B o 8B es algo que puedes poner en una sola máquina, incluido hardware que ya tienes. Si tu requisito es sin conexión o en tus propias instalaciones, los tamaños de Granite son los únicos de esta lista que lo hacen fácil, sin importar qué modelo puntúe mejor.
No compares entre sí las dos cifras destacadas de benchmark. Terminal-Bench 3.0 y SWE-bench Verified son pruebas distintas, así que 28,3 % y 57,00 no están en la misma escala. La cifra comparable aquí es GLM-5.3 frente a GLM-5.2 en el mismo benchmark, donde DataNorth informa de un salto del 4,6 % al 28,3 %. Esa mejora vino solo del postentrenamiento, sobre un modelo base sin cambios, lo que recuerda que el modelo base a menudo no es el cuello de botella.
Las dos licencias son permisivas, pero no son idénticas, y la diferencia aparece en la revisión legal. MIT y Apache 2.0 permiten ambas el uso comercial y la modificación. Apache 2.0 añade una concesión explícita de patentes, que algunos equipos legales exigen. Comprueba cuál ha aprobado ya tu organización antes de construir sobre cualquiera de las dos.
El precio de GLM-5.3-Flash es la cifra que debería cambiar un plan. A 0,03 dólares por millón de tokens de entrada en caché, una carga de trabajo que reenvía repetidamente el mismo contexto largo sale drásticamente más barata, y esa es justo la forma de la mayoría de las cargas de agentes y de análisis de documentos. Si el año pasado descartaste diseños de contexto largo por coste, ese cálculo merece repetirse. Verifica antes el comportamiento de acierto de caché con tu propio tráfico, porque el precio en caché solo ayuda si tus prompts se repiten de verdad.