Skip to content
Tech AI Wire
AI & LLMs

Z.ai e IBM lançam modelos de raciocínio de pesos abertos com um dia de diferença

4 min de leitura

Por Tech AI Wire Team

Terminal-Bench 3.0, before and after GLM-5.3's post-training
GLM-5.2
4.6%
GLM-5.3
28.3%
Two line-art cards bearing the Z.ai and IBM logos with a red open padlock hanging between them, above the words OPEN WEIGHTS.

Dois modelos de raciocínio de pesos abertos saíram com um dia de diferença. A Z.ai lançou o GLM-5.3-Flash em 26 de agosto de 2026 sob licença MIT, segundo o MarkTechPost. A IBM lançou o Granite 4.2 em 25 de agosto de 2026 sob Apache 2.0, segundo o DataNorth. Pesos abertos significa que os próprios arquivos do modelo são publicados, então você pode baixá-los e rodá-los por conta própria. Os dois miram hardwares quase opostos, e essa é a parte que vale entender antes de escolher um.

Primeiro, uma armadilha de nomes. GLM-5.3 e GLM-5.3-Flash são lançamentos diferentes. O DataNorth relata que o GLM-5.3 chegou em 14 de agosto de 2026 para trabalho de programação e cibersegurança, com pesos abertos prometidos cerca de duas semanas depois. O GLM-5.3-Flash é o lançamento de 26 de agosto, e seus pesos já estão no Hugging Face.

GLM-5.3-Flash: grande, barato de chamar, difícil de hospedar

O GLM-5.3-Flash é um modelo mixture-of-experts com 320 bilhões de parâmetros totais e 18 bilhões ativos por token, segundo o MarkTechPost. Uma mistura de especialistas só liga uma pequena parcela dos seus parâmetros para cada token, então ela pode ser grande sem custar grandes quantidades de computação por token. Aqui ela ativa 8 de 288 especialistas.

O MarkTechPost relata que ele é o primeiro modelo nativamente multimodal da série GLM-5, aceitando entrada de imagem e vídeo, com uma janela de contexto de 1.048.576 tokens. A Z.ai o chama de "o primeiro modelo nativamente multimodal da série GLM-5 e o modelo de programação capaz mais barato". As alegações de eficiência são específicas: 3 vezes menos computação de atenção e um cache KV 4,4 vezes menor que o do GLM-5.2.

O preço é onde o argumento pega. O MarkTechPost lista $0.15 por milhão de tokens de entrada, $0.03 por milhão de tokens de entrada em cache e $0.50 por milhão de tokens de saída. A Z.ai diz que o modelo "supera o GLM-5.2 em benchmarks e cargas reais por cerca de um décimo do preço".

O senão está no mesmo relato. Hospedar por conta própria exige hardware substancial, com os pesos em torno de 306 GiB, e sua capacidade de visão fica atrás do Gemini 3.7 Flash.

Granite 4.2: pequeno o suficiente para realmente rodar

A IBM foi na direção oposta. O DataNorth relata que o Granite 4.2 vem em tamanhos de 3B, 8B e 30B parâmetros sob Apache 2.0, treinado com cerca de 15 trilhões de tokens, incluindo 1 trilhão de tokens sintéticos de código. O contexto é de 131.072 tokens, com uma extensão alegada para 512K, e ele suporta 12 idiomas.

Seu recurso de projeto notável é o que a IBM chama de "um interruptor de pensamento, para que um mesmo checkpoint possa raciocinar passo a passo ou responder direto". Isso importa na prática: você entrega um único arquivo de modelo e escolhe, por requisição, se vai pagar por tokens de raciocínio. O DataNorth relata que o modelo de 30B marca 57,00 no SWE-bench Verified, um benchmark que pede a um modelo que corrija issues reais do GitHub.

A IBM também lançou modelos Granite Speech 5.0 Turbo CTC de 470M parâmetros, que, segundo o DataNorth, alcançam throughput de 12.600 RTFx em uma NVIDIA H200.

Lado a lado

GLM-5.3-FlashGranite 4.2
Tamanhos320B total, 18B ativos3B, 8B, 30B
LicençaMITApache 2.0
Janela de contexto1.048.576 tokens131.072 tokens
Entradastexto, imagem, vídeotexto
Tamanho dos pesoscerca de 306 GiBnão informado
Benchmark citadoTerminal-Bench 3.0 em 28,3% para o GLM-5.3SWE-bench Verified 57,00 em 30B

O que isso significa para desenvolvedores

Escolha pelo lugar onde o modelo vai rodar, não pela contagem de parâmetros. Um modelo de 320B com 306 GiB é uma implantação em várias GPUs ou uma chamada de API. Um modelo de 3B ou 8B é algo que você pode colocar em uma única máquina, incluindo hardware que você já tem. Se o seu requisito é offline ou on-premise, os tamanhos do Granite são os únicos desta lista que tornam isso fácil, independentemente de qual modelo pontua melhor.

Não compare os dois números de benchmark de destaque entre si. Terminal-Bench 3.0 e SWE-bench Verified são testes diferentes, então 28,3% e 57,00 não estão na mesma escala. O número comparável aqui é o GLM-5.3 contra o GLM-5.2 no mesmo benchmark, onde o DataNorth relata um salto de 4,6% para 28,3%. Esse ganho veio só do pós-treino, sobre um modelo base inalterado, o que é um lembrete útil de que a base muitas vezes não é o gargalo.

As duas licenças são permissivas, mas não são idênticas, e a diferença aparece na revisão jurídica. MIT e Apache 2.0 permitem uso comercial e modificação. A Apache 2.0 acrescenta uma concessão explícita de patente, que alguns times jurídicos exigem. Confira qual delas a sua organização já aprovou antes de construir sobre qualquer uma.

O preço do GLM-5.3-Flash é o número que deveria mudar um plano. A $0.03 por milhão de tokens de entrada em cache, uma carga que reenvia o mesmo contexto longo repetidamente fica drasticamente mais barata, e essa é exatamente a forma da maioria das cargas de agentes e de análise de documentos. Se você rejeitou projetos de contexto longo por custo no ano passado, vale refazer essa conta. Verifique primeiro o comportamento de acerto de cache no seu próprio tráfego, já que o preço com cache só ajuda se os seus prompts de fato se repetem.