GLM 5.2 da Z.ai chega a US$ 3 por milhão de saída e encosta nos grandes
Modelo chinês de 753 bilhões de parâmetros tem nota de inteligência 52,6 e custa quase 17 vezes menos que o Claude Fable 5 no token de saída.
O que a Z.ai botou na mesa hoje
A conta da API vai te dar uma boa notícia hoje. A chinesa Z.ai colocou no catálogo o GLM 5.2, um modelo de raciocínio com 753 bilhões de parâmetros totais (40 bilhões ativos), contexto de 1 milhão de tokens e pesos abertos. O preço de saída é US$ 3,036 por milhão de tokens — e é isso que muda o jogo quando você olha para o topo da tabela de inteligência.
Para colocar em perspectiva: o Claude Fable 5, da Anthropic, lidera o índice de inteligência com 62,073 e cobra US$ 50 por milhão de tokens de saída. O GLM 5.2 não chega lá — fica em 52,641 —, mas custa quase 17 vezes menos no token que sai da API. É a diferença entre pagar uma conta de luz e pagar o aluguel.
Onde o GLM 5.2 se encaixa no tabuleiro
Olhando o ranking de hoje, o GLM 5.2 é o segundo colocado em inteligência entre os modelos listados, atrás apenas do Claude Fable 5 e à frente do Gemini 3.1 Pro Preview (47,738), do Gemini 3.5 Flash (46,673) e do GPT-5.3-Codex (45,512). Em outras palavras: para workloads que precisam de raciocínio forte mas não exigem o topo absoluto, ele entra como alternativa real.
A pontuação de coding do GLM 5.2 é 68,756 — acima do índice geral de inteligência, o que sugere que o modelo foi calibrado pensando em engenharia de software e fluxos agenticos longos. A nota agentic de 45,667 confirma o foco. A velocidade reportada é 70,1 tokens por segundo, número alto para um modelo desse porte.
A linha completa que a Z.ai soltou hoje
A Z.ai não lançou só o modelo principal. Vieram três variantes:
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| GLM 5.2 (batch) | 1.4 | 4.4 | 1.05M |
| GLM 5.2 (free) | 0 | 0 | 256k |
A versão :free zera o preço de entrada e saída, mas reduz o contexto para 256 mil tokens — útil para testar antes de colocar em produção. A versão :batch cobra US$ 1,40 por milhão de entrada e US$ 4,40 por milhão de saída, com contexto praticamente igual ao do modelo principal (1.048.575 tokens). É a opção para quem processa volume e pode esperar.
Para quem vale e para quem não muda nada
Vale para você se está rodando agentes longos, análise de código em projetos grandes ou qualquer workload que engula contexto de 1M tokens e precise de raciocínio acima de 50 no índice. O custo de saída sendo uma fração do Claude Fable 5 muda a conta em pipelines que processam muito texto gerado.
Não muda nada se você já está feliz com o Gemini 3.5 Flash ou com o DeepSeek V4 Pro. O Flash da Google custa US$ 9 por milhão de saída e tem 46,673 de inteligência; o DeepSeek V4 Pro custa US$ 1,74 e marca 45,268. Para tarefas mais simples, esses continuam fazendo o serviço por menos.
Como ele se compara com o que já estava disponível
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| GLM 5.2 (o novo) | 52.6 | 0.966 | 3.036 | 1.05M |
| Claude Fable 5 | 62.1 | 10 | 50 | 1M |
| Gemini 3.1 Pro Preview | 47.7 | 2 | 12 | 1.05M |
| Gemini 3.5 Flash | 46.7 | 1.5 | 9 | 1.05M |
| MiniMax M3 | 45.4 | 0.3 | 1.2 | 1.05M |
| DeepSeek V4 Pro 0423 | 45.3 | 1.0423 | 2.0845 | 1.05M |
A vantagem do GLM 5.2 sobre os concorrentes chineses mais baratos é a nota de inteligência — ele está quase 7 pontos acima do DeepSeek V4 Pro e 7,2 acima do MiniMax M3, cobrando US$ 1,30 a mais por milhão de saída que o DeepSeek. É o típico trade-off: paga um pouco mais, leva um salto de capacidade.
| Campo | Valor |
|---|---|
| Identificador | z-ai/glm-5.2 |
| Criador | z-ai |
| Preço de entrada | US$ 0.966 / M tokens |
| Preço de saída | US$ 3.04 / M tokens |
| Janela de contexto | 1.05M |
| Modalidade | text->text |
| Leitura de cache | US$ 0.193 / M (80% de desconto) |
| Índice de inteligência (AA) | 52.6 |
| Índice de código | 68.8 |
| Índice agêntico | 45.7 |
| Parâmetros | 753B (40B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 70 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
O que fazer com isso na prática
Se você tem um agente que hoje roda no Claude Fable 5 e a fatura incomoda, teste o GLM 5.2 no mesmo workload. A diferença de 9,4 pontos no índice de inteligência pode ou não aparecer no seu caso — em tarefas agenticas longas, raciocínio bruto pesa menos que a qualidade do tool use. Meça antes de migrar de vez. E se você ainda não usa nada acima de IQ 50, não há motivo para subir de faixa só porque o modelo é novo: o MiniMax M3 a US$ 1,20 por milhão de saída continua sendo o chão da categoria.
Teste o GLM 5.2 em workloads agenticos longos se a fatura do Claude Fable 5 incomoda — a diferença de preço é grande o suficiente para justificar o experimento, mas meça qualidade no seu caso antes de migrar.
Perguntas frequentes
Quanto custa o GLM 5.2 da Z.ai?
US$ 0,966 por milhão de tokens de entrada e US$ 3,036 por milhão de tokens de saída, com cache de leitura a US$ 0,1932 por milhão. Existe versão gratuita com contexto reduzido e versão batch a US$ 1,40/US$ 4,40.
O GLM 5.2 é melhor que o Claude Fable 5?
Não. O Claude Fable 5 lidera o índice de inteligência com 62,073 contra 52,641 do GLM 5.2. A vantagem do GLM 5.2 é o preço: custa cerca de 17 vezes menos no token de saída.
O GLM 5.2 tem pesos abertos?
Sim, é open weights, com 753 bilhões de parâmetros totais e 40 bilhões ativos, contexto de 1 milhão de tokens e suporte a raciocínio.