Skip to content
Tech AI Wire

Pesos do GLM-5.3 saem com licença própria e exigem oito GPUs

Os pesos do modelo principal GLM-5.3 da Z.ai estão no Hugging Face após atraso por revisão de segurança. A licença não é MIT e o modelo precisa de pelo menos oito GPUs de ponta.

Por Tech AI Wire Team

4 min de leitura

XLinkedIn
The Hugging Face page for zai-org/GLM-5.3, showing its glm-5.3 license and the 141 model shards that make up the 756 GB download.

Em números

total parameters, 40B active per token
753B
the FP8 download, in 141 shards
755.7 GB
minimum high-end GPUs needed to run it
8
revenue that triggers a Z.ai security review
$10B

Os pesos do GLM-5.3, o maior modelo aberto do laboratório chinês Z.ai, já estão publicados no Hugging Face. Dois detalhes importam mais que as notas de benchmark. A licença é um documento próprio da Z.ai e não MIT, e o modelo precisa de pelo menos oito GPUs de data center de ponta para funcionar.

O GLM-5.3 é um modelo de mistura de especialistas. Esse desenho divide a rede em muitas seções especializadas e acorda apenas algumas para cada palavra processada. A ficha técnica da Kingy.ai indica 753,3 bilhões de parâmetros no total e 40 bilhões ativos por token, tirados de 256 especialistas roteados, dos quais 8 são escolhidos por vez. A janela de contexto é de 1.048.576 tokens, ou seja, o texto que ele consegue segurar de uma vez.

A licença é a notícia de verdade

O GLM-5.2 saiu sob MIT, uma licença permissiva quase sem amarras. O GLM-5.3 não. Segundo a leitura dos termos feita pela Kingy.ai, os pesos do modelo principal trazem uma "GLM-5.3 License" própria, que permite uso comercial na maioria dos casos, mas acrescenta um gatilho.

O gatilho tem como alvo empresas que revendem acesso ao modelo. Qualquer operador de Model-as-a-Service cuja receita somada, incluindo licenciado e afiliadas, passe de 10 bilhões de dólares em 12 meses consecutivos precisa passar por uma revisão de segurança da Z.ai antes de continuar o uso comercial. Essa condição não existe no MIT, e ela escreve uma aprovação do fornecedor dentro da licença.

O irmão menor seguiu outro caminho. Segundo a explainX, o GLM-5.3-Flash saiu em 26 de agosto sob MIT. Ele tem 320 bilhões de parâmetros, com 18 bilhões ativos. Os pesos MIT do GLM-5.2 também seguem disponíveis.

Por que o lançamento atrasou

A Z.ai lançou o GLM-5.3 em 14 de agosto e prometeu os pesos em cerca de duas semanas, ou seja, por volta de 28 de agosto. Segundo a explainX, o prazo escorregou por causa de uma revisão de segurança.

A razão apresentada é incomum. Durante a avaliação, a Z.ai viu que a capacidade do modelo em segurança cibernética havia crescido mais rápido do que o esperado. Isso incluía raciocinar sobre cadeias de exploração em várias etapas. A mesma avaliação encontrou 2.436 vulnerabilidades em 269 projetos de código aberto, segundo a explainX. Dessas, 1.097 foram classificadas como críticas ou altas.

Quanto custa rodar

ItemNúmero
Parâmetros totais753,3 bilhões, 40 bilhões ativos por token
Especialistas256 roteados, 8 escolhidos por token
Janela de contexto1.048.576 tokens
Quantização padrãoFP8 (E4M3)
Download em FP8755,7 GB em 141 partes
Download em BF16Cerca de 1,5 TB em 282 partes
Hardware mínimo8 GPUs da classe H200, H20 ou B200, com 141 a 180 GB de VRAM cada
Contexto completo de 1M8 × B200 de 180 GB, com cache chave-valor em FP8

A Kingy.ai resume essa tabela em uma frase: "It is not easy to run", não é fácil de rodar.

Todo o ganho veio do pós-treinamento

A afirmação técnica mais interessante está no próprio cartão do modelo. A Z.ai escreve: "GLM-5.3 uses the same base model as GLM-5.2 - every gain comes from post-training." O modelo base é o mesmo e todo ganho vem do pós-treinamento, o ajuste feito depois do caro pré-treinamento.

O cartão afirma 50% de melhora sobre o GLM-5.2 no Code Bench interno da Z.ai, e diz que o modelo mais que dobra as notas do GLM-5.2 em benchmarks de exploração. A Kingy.ai lista os números publicados.

BenchmarkGLM-5.2GLM-5.3
Terminal-Bench 3.04,628,3
DeepSWE46,266,9
SWE-Marathon19,442,5
CyberGym77,284,5

São números relatados pelo próprio laboratório que fez o modelo. Trate-os como afirmação a verificar, não como resultado.

O que isso significa para desenvolvedores

Leia a licença antes de planejar um produto em cima desse modelo. Aqui, "pesos abertos" e "código aberto" não são a mesma coisa, e a diferença agora é concreta. Se a sua empresa revende acesso ao modelo e passa da linha de receita, continuar usando depende de uma revisão feita pelo fornecedor.

Se você precisa de termos permissivos hoje, a escolha é explícita. GLM-5.3-Flash e GLM-5.2 são MIT, e o Flash tem um terço do tamanho, com 320 bilhões de parâmetros. Você troca as notas de código do modelo principal por termos que o seu jurídico não vai contestar.

Faça a conta de hardware antes de baixar qualquer coisa. Um checkpoint FP8 de 755,7 GB dividido em 141 partes não é projeto de estação de trabalho, e oito placas são o piso, não uma meta confortável. Alugue capacidade por hora para avaliar e só depois calcule o custo de ter as máquinas.

O resultado do pós-treinamento é a lição transferível. O mesmo modelo base, ajustado de outra forma, levou o Terminal-Bench 3.0 de 4,6 para 28,3. Se você está orçando o próprio trabalho com modelos, isso aponta para gastar em pós-treinamento e avaliação antes de buscar uma base maior.

Por fim, observe o padrão de licenciamento mais do que este documento específico. Um laboratório encontrou forte capacidade de achar vulnerabilidades no próprio modelo, atrasou o lançamento e depois entregou com uma cláusula de revisão. Espere mais pesos chegando com condições assim, e que "é MIT?" se torne a sua primeira pergunta.

Fontes

  1. zai-org/GLM-5.3 model card - Hugging Face
  2. GLM-5.3 specs, benchmarks, API and how to use it - Kingy.ai
  3. GLM-5.3 open weights delay: what happened - explainX

Artigos relacionados