FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

GLM 5.2 da Z.ai chega a US$ 3 por milhão de saída e encosta nos grandes

Modelo chinês de 753 bilhões de parâmetros tem nota de inteligência 52,6 e custa quase 17 vezes menos que o Claude Fable 5 no token de saída.

Redação FalaVIP IA 3 min de leitura
US$ 3,036por milhão de tokens de saída
52,641de índice de inteligência
753 bilhõesde parâmetros totais (40 bilhões ativos)

O que a Z.ai botou na mesa hoje

A conta da API vai te dar uma boa notícia hoje. A chinesa Z.ai colocou no catálogo o GLM 5.2, um modelo de raciocínio com 753 bilhões de parâmetros totais (40 bilhões ativos), contexto de 1 milhão de tokens e pesos abertos. O preço de saída é US$ 3,036 por milhão de tokens — e é isso que muda o jogo quando você olha para o topo da tabela de inteligência.

Preço de saída (US$ por milhão de tokens)
GLM 5.23,036Claude Fable 550Gemini 3.1 Pro Preview12Gemini 3.5 Flash9MiniMax M31,2DeepSeek V4 Pro 04232,0845US$/M
Fonte: OpenRouter

Para colocar em perspectiva: o Claude Fable 5, da Anthropic, lidera o índice de inteligência com 62,073 e cobra US$ 50 por milhão de tokens de saída. O GLM 5.2 não chega lá — fica em 52,641 —, mas custa quase 17 vezes menos no token que sai da API. É a diferença entre pagar uma conta de luz e pagar o aluguel.

Onde o GLM 5.2 se encaixa no tabuleiro

Olhando o ranking de hoje, o GLM 5.2 é o segundo colocado em inteligência entre os modelos listados, atrás apenas do Claude Fable 5 e à frente do Gemini 3.1 Pro Preview (47,738), do Gemini 3.5 Flash (46,673) e do GPT-5.3-Codex (45,512). Em outras palavras: para workloads que precisam de raciocínio forte mas não exigem o topo absoluto, ele entra como alternativa real.

Índice de inteligência (Artificial Analysis)
GLM 5.252,6Claude Fable 562,1Gemini 3.1 Pro Preview47,7Gemini 3.5 Flash46,7MiniMax M345,4DeepSeek V4 Pro 042345,3índice
Fonte: Artificial Analysis

A pontuação de coding do GLM 5.2 é 68,756 — acima do índice geral de inteligência, o que sugere que o modelo foi calibrado pensando em engenharia de software e fluxos agenticos longos. A nota agentic de 45,667 confirma o foco. A velocidade reportada é 70,1 tokens por segundo, número alto para um modelo desse porte.

A linha completa que a Z.ai soltou hoje

A Z.ai não lançou só o modelo principal. Vieram três variantes:

Os outros modelos anunciados no mesmo dia
ModeloEntrada US$/MSaída US$/MContexto
GLM 5.2 (batch)1.44.41.05M
GLM 5.2 (free)00256k

A versão :free zera o preço de entrada e saída, mas reduz o contexto para 256 mil tokens — útil para testar antes de colocar em produção. A versão :batch cobra US$ 1,40 por milhão de entrada e US$ 4,40 por milhão de saída, com contexto praticamente igual ao do modelo principal (1.048.575 tokens). É a opção para quem processa volume e pode esperar.

Para quem vale e para quem não muda nada

Vale para você se está rodando agentes longos, análise de código em projetos grandes ou qualquer workload que engula contexto de 1M tokens e precise de raciocínio acima de 50 no índice. O custo de saída sendo uma fração do Claude Fable 5 muda a conta em pipelines que processam muito texto gerado.

Não muda nada se você já está feliz com o Gemini 3.5 Flash ou com o DeepSeek V4 Pro. O Flash da Google custa US$ 9 por milhão de saída e tem 46,673 de inteligência; o DeepSeek V4 Pro custa US$ 1,74 e marca 45,268. Para tarefas mais simples, esses continuam fazendo o serviço por menos.

Inteligência × preço de saída
GLM 5.2Claude Fable 5Gemini 3.1 Pro PreviewGemini 3.5 FlashMiniMax M3DeepSeek V4 Pro 0423US$ por milhão (saída, escala log)índice de inteligência

Como ele se compara com o que já estava disponível

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
GLM 5.2 (o novo)52.60.9663.0361.05M
Claude Fable 562.110501M
Gemini 3.1 Pro Preview47.72121.05M
Gemini 3.5 Flash46.71.591.05M
MiniMax M345.40.31.21.05M
DeepSeek V4 Pro 042345.31.04232.08451.05M
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

A vantagem do GLM 5.2 sobre os concorrentes chineses mais baratos é a nota de inteligência — ele está quase 7 pontos acima do DeepSeek V4 Pro e 7,2 acima do MiniMax M3, cobrando US$ 1,30 a mais por milhão de saída que o DeepSeek. É o típico trade-off: paga um pouco mais, leva um salto de capacidade.

Ficha técnica — GLM 5.2
CampoValor
Identificadorz-ai/glm-5.2
Criadorz-ai
Preço de entradaUS$ 0.966 / M tokens
Preço de saídaUS$ 3.04 / M tokens
Janela de contexto1.05M
Modalidadetext->text
Leitura de cacheUS$ 0.193 / M (80% de desconto)
Índice de inteligência (AA)52.6
Índice de código68.8
Índice agêntico45.7
Parâmetros753B (40B ativos por token)
Pesosabertos
Velocidade de saída70 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

O que fazer com isso na prática

Se você tem um agente que hoje roda no Claude Fable 5 e a fatura incomoda, teste o GLM 5.2 no mesmo workload. A diferença de 9,4 pontos no índice de inteligência pode ou não aparecer no seu caso — em tarefas agenticas longas, raciocínio bruto pesa menos que a qualidade do tool use. Meça antes de migrar de vez. E se você ainda não usa nada acima de IQ 50, não há motivo para subir de faixa só porque o modelo é novo: o MiniMax M3 a US$ 1,20 por milhão de saída continua sendo o chão da categoria.

Em uma frase

Teste o GLM 5.2 em workloads agenticos longos se a fatura do Claude Fable 5 incomoda — a diferença de preço é grande o suficiente para justificar o experimento, mas meça qualidade no seu caso antes de migrar.

Perguntas frequentes

Quanto custa o GLM 5.2 da Z.ai?

US$ 0,966 por milhão de tokens de entrada e US$ 3,036 por milhão de tokens de saída, com cache de leitura a US$ 0,1932 por milhão. Existe versão gratuita com contexto reduzido e versão batch a US$ 1,40/US$ 4,40.

O GLM 5.2 é melhor que o Claude Fable 5?

Não. O Claude Fable 5 lidera o índice de inteligência com 62,073 contra 52,641 do GLM 5.2. A vantagem do GLM 5.2 é o preço: custa cerca de 17 vezes menos no token de saída.

O GLM 5.2 tem pesos abertos?

Sim, é open weights, com 753 bilhões de parâmetros totais e 40 bilhões ativos, contexto de 1 milhão de tokens e suporte a raciocínio.

Leia também