Pesos do GLM-5.3 saem com licença própria e exigem oito GPUs
Os pesos do modelo principal GLM-5.3 da Z.ai estão no Hugging Face após atraso por revisão de segurança. A licença não é MIT e o modelo precisa de pelo menos oito GPUs de ponta.
4 min de leitura

Em números
- total parameters, 40B active per token
- 753B
- the FP8 download, in 141 shards
- 755.7 GB
- minimum high-end GPUs needed to run it
- 8
- revenue that triggers a Z.ai security review
- $10B
Os pesos do GLM-5.3, o maior modelo aberto do laboratório chinês Z.ai, já estão publicados no Hugging Face. Dois detalhes importam mais que as notas de benchmark. A licença é um documento próprio da Z.ai e não MIT, e o modelo precisa de pelo menos oito GPUs de data center de ponta para funcionar.
O GLM-5.3 é um modelo de mistura de especialistas. Esse desenho divide a rede em muitas seções especializadas e acorda apenas algumas para cada palavra processada. A ficha técnica da Kingy.ai indica 753,3 bilhões de parâmetros no total e 40 bilhões ativos por token, tirados de 256 especialistas roteados, dos quais 8 são escolhidos por vez. A janela de contexto é de 1.048.576 tokens, ou seja, o texto que ele consegue segurar de uma vez.
A licença é a notícia de verdade
O GLM-5.2 saiu sob MIT, uma licença permissiva quase sem amarras. O GLM-5.3 não. Segundo a leitura dos termos feita pela Kingy.ai, os pesos do modelo principal trazem uma "GLM-5.3 License" própria, que permite uso comercial na maioria dos casos, mas acrescenta um gatilho.
O gatilho tem como alvo empresas que revendem acesso ao modelo. Qualquer operador de Model-as-a-Service cuja receita somada, incluindo licenciado e afiliadas, passe de 10 bilhões de dólares em 12 meses consecutivos precisa passar por uma revisão de segurança da Z.ai antes de continuar o uso comercial. Essa condição não existe no MIT, e ela escreve uma aprovação do fornecedor dentro da licença.
O irmão menor seguiu outro caminho. Segundo a explainX, o GLM-5.3-Flash saiu em 26 de agosto sob MIT. Ele tem 320 bilhões de parâmetros, com 18 bilhões ativos. Os pesos MIT do GLM-5.2 também seguem disponíveis.
Por que o lançamento atrasou
A Z.ai lançou o GLM-5.3 em 14 de agosto e prometeu os pesos em cerca de duas semanas, ou seja, por volta de 28 de agosto. Segundo a explainX, o prazo escorregou por causa de uma revisão de segurança.
A razão apresentada é incomum. Durante a avaliação, a Z.ai viu que a capacidade do modelo em segurança cibernética havia crescido mais rápido do que o esperado. Isso incluía raciocinar sobre cadeias de exploração em várias etapas. A mesma avaliação encontrou 2.436 vulnerabilidades em 269 projetos de código aberto, segundo a explainX. Dessas, 1.097 foram classificadas como críticas ou altas.
Quanto custa rodar
| Item | Número |
|---|---|
| Parâmetros totais | 753,3 bilhões, 40 bilhões ativos por token |
| Especialistas | 256 roteados, 8 escolhidos por token |
| Janela de contexto | 1.048.576 tokens |
| Quantização padrão | FP8 (E4M3) |
| Download em FP8 | 755,7 GB em 141 partes |
| Download em BF16 | Cerca de 1,5 TB em 282 partes |
| Hardware mínimo | 8 GPUs da classe H200, H20 ou B200, com 141 a 180 GB de VRAM cada |
| Contexto completo de 1M | 8 × B200 de 180 GB, com cache chave-valor em FP8 |
A Kingy.ai resume essa tabela em uma frase: "It is not easy to run", não é fácil de rodar.
Todo o ganho veio do pós-treinamento
A afirmação técnica mais interessante está no próprio cartão do modelo. A Z.ai escreve: "GLM-5.3 uses the same base model as GLM-5.2 - every gain comes from post-training." O modelo base é o mesmo e todo ganho vem do pós-treinamento, o ajuste feito depois do caro pré-treinamento.
O cartão afirma 50% de melhora sobre o GLM-5.2 no Code Bench interno da Z.ai, e diz que o modelo mais que dobra as notas do GLM-5.2 em benchmarks de exploração. A Kingy.ai lista os números publicados.
| Benchmark | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Terminal-Bench 3.0 | 4,6 | 28,3 |
| DeepSWE | 46,2 | 66,9 |
| SWE-Marathon | 19,4 | 42,5 |
| CyberGym | 77,2 | 84,5 |
São números relatados pelo próprio laboratório que fez o modelo. Trate-os como afirmação a verificar, não como resultado.
O que isso significa para desenvolvedores
Leia a licença antes de planejar um produto em cima desse modelo. Aqui, "pesos abertos" e "código aberto" não são a mesma coisa, e a diferença agora é concreta. Se a sua empresa revende acesso ao modelo e passa da linha de receita, continuar usando depende de uma revisão feita pelo fornecedor.
Se você precisa de termos permissivos hoje, a escolha é explícita. GLM-5.3-Flash e GLM-5.2 são MIT, e o Flash tem um terço do tamanho, com 320 bilhões de parâmetros. Você troca as notas de código do modelo principal por termos que o seu jurídico não vai contestar.
Faça a conta de hardware antes de baixar qualquer coisa. Um checkpoint FP8 de 755,7 GB dividido em 141 partes não é projeto de estação de trabalho, e oito placas são o piso, não uma meta confortável. Alugue capacidade por hora para avaliar e só depois calcule o custo de ter as máquinas.
O resultado do pós-treinamento é a lição transferível. O mesmo modelo base, ajustado de outra forma, levou o Terminal-Bench 3.0 de 4,6 para 28,3. Se você está orçando o próprio trabalho com modelos, isso aponta para gastar em pós-treinamento e avaliação antes de buscar uma base maior.
Por fim, observe o padrão de licenciamento mais do que este documento específico. Um laboratório encontrou forte capacidade de achar vulnerabilidades no próprio modelo, atrasou o lançamento e depois entregou com uma cláusula de revisão. Espere mais pesos chegando com condições assim, e que "é MIT?" se torne a sua primeira pergunta.
Fontes
- zai-org/GLM-5.3 model card - Hugging Face
- GLM-5.3 specs, benchmarks, API and how to use it - Kingy.ai
- GLM-5.3 open weights delay: what happened - explainX
Artigos relacionados

Qwen3.8-Flash-Next tem 125 bilhões de parâmetros, mas roda só 6 bilhões
A Alibaba lançou o Qwen3.8-Flash-Next em 26 de agosto de 2026. Ele ativa 6 de 125 bilhões de parâmetros por token e custa US$ 0,16 por milhão de tokens de entrada.

Z.ai e IBM lançam modelos de raciocínio de pesos abertos com um dia de diferença
A Z.ai lançou o GLM-5.3-Flash sob licença MIT com 320B de parâmetros. A IBM lançou o Granite 4.2 sob Apache 2.0, de 3B a 30B. Eles servem hardwares muito diferentes.

Ollama 0.33 deixa o Claude Desktop rodar Qwen, DeepSeek e Kimi localmente
O Ollama 0.33.0 adiciona um proxy local que troca o modelo por trás do app Claude Desktop, da Anthropic, por um modelo aberto. Uma tentativa na primavera falhou em checagens de ID de modelo.