FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

GLM 5.2 entra em segundo no ranking de inteligência custando 6% do líder

Modelo chinês de pesos abertos da Z.ai supera Gemini Pro e Flash em IQ e em preço por token de saída; veja quando migrar e quando o multimodal do Google ainda vale a fatura.

Redação FalaVIP IA 3 min de leitura
52,641índice de inteligência (2º do catálogo)
US$ 3,036por milhão de tokens de saída
1M tokensjanela de contexto

A conta de API que você paga tem uma nova linha que merece atenção nesta segunda-feira. O GLM 5.2, da chinesa Z.ai, estreou no catálogo ocupando o segundo lugar no índice de inteligência — logo atrás do Claude Fable 5, da Anthropic, que cobra US$ 50 por milhão de tokens de saída. O GLM 5.2 pede US$ 3,04 pelo mesmo milhão. Seis por cento do preço.

Índice de inteligência (Artificial Analysis)
GLM 5.252,6Gemini 3.5 Flash46,7Gemini 3.1 Pro Preview47,7índice
Fonte: Artificial Analysis

E não é só barateamento. O índice de 52,6 do GLM 5.2 é mais alto que o do Gemini 3.1 Pro Preview (47,7) e o do Gemini 3.5 Flash (46,7), os dois modelos do Google que aparecem em terceiro e quarto lugar no mesmo ranking. Em raciocínio geral, o chinês entrega mais que os dois melhores colocados americanos na faixa intermediária — cobrando menos.

O que US$ 3,04 por milhão de tokens significa na sua fatura

Vamos ao dinheiro. Se você consome 50 milhões de tokens de saída por mês numa operação típica de geração de código ou análise longa, a conta com Claude Fable 5 ficaria em US$ 2.500. Com GLM 5.2, cai para US$ 152. São mais de US$ 2.300 que sobram todo mês para o mesmo — ou superior — patamar de raciocínio.

Preço de saída (US$ por milhão de tokens)
GLM 5.23,036Gemini 3.5 Flash9Gemini 3.1 Pro Preview12US$/M
Fonte: OpenRouter

O preço de cache é outro detalhe que costuma passar batido: US$ 0,1932 por milhão de tokens, contra US$ 0,15 do Gemini 3.5 Flash. Mais caro no cache, sim, mas a diferença se dilui quando você observa que o GLM 5.2 entrega quase 6 pontos a mais de IQ.

Para quem vale migrar agora

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
GLM 5.2 (o novo)52.60.9663.0361.05M
Gemini 3.5 Flash46.71.591.05M
Gemini 3.1 Pro Preview47.72121.05M
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

O cenário onde o GLM 5.2 faz sentido é claro: tarefas longas de raciocínio com contexto grande. A janela é de 1 milhão de tokens — igual à dos dois pares do Google — e o foco declarado pela Z.ai é "workflows agênticos de horizonte longo" e "engenharia de software em nível de projeto".

Olhando o índice de codificação, o GLM 5.2 marca 68,756. O Gemini 3.1 Pro Preview, o melhor entre os pares do Google, marca 68,826. Empate técnico em código. A diferença está no preço: US$ 3,04 contra US$ 12 por milhão de tokens de saída.

Há ainda um ponto que pesa bastante: pesos abertos. O GLM 5.2 é distribuído como modelo aberto, ao contrário dos dois do Google. Quando o volume justifica, dá para tirar a fatura de API e levar a inferência para a sua própria infraestrutura. Você troca a dor de cabeça com a fatura pela dor de cabeça com GPUs — mas é uma opção real, não um placebo.

Inteligência × preço de saída
GLM 5.2Gemini 3.5 FlashGemini 3.1 Pro PreviewUS$ por milhão (saída, escala log)índice de inteligência

Para quem NÃO muda nada

Se você precisa de multimodalidade, o GLM 5.2 não serve. É text-to-text. O Gemini 3.5 Flash e o Gemini 3.1 Pro Preview aceitam imagem, arquivo, áudio e vídeo na entrada. Para fluxos que dependem de PDF, screenshot ou transcrição, os dois modelos do Google continuam sendo a referência nessa faixa de preço.

Se a sua latência é crítica, idem. A velocidade medida do GLM 5.2 é 70,1 tokens por segundo — menos da metade do Gemini 3.5 Flash, que marca 194,5. Em chat interativo, completions em tempo real ou UX onde o usuário espera, o Flash ainda reina.

E se você precisa do topo absoluto de inteligência — aquele caso em que cada ponto de IQ vale o custo extra —, o Claude Fable 5 continua na frente com 62,1. Mas aí o orçamento precisa ser outra conversa.

A geopolítica do token

Vale registrar de onde vem o modelo. Z.ai é uma empresa chinesa, e a família GLM vem fazendo o mesmo movimento há alguns ciclos: modelo grande, mixture-of-experts com 753 bilhões de parâmetros totais e 40 bilhões ativos, distribuído com pesos abertos. Esse desenho Mixture-of-Experts é o que permite entregar raciocínio forte sem inflar a conta de inferência do usuário final — é a engrenagem por trás do salto de IQ com preço baixo.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
GLM 5.252.63.036
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
GPT-5.3-Codex45.514
Entre os 472 modelos disponíveis no catálogo nesta data.

Com 29 modelos lançados nos últimos 30 dias e 472 listados no catálogo hoje, o mercado está mais concorrido do que nunca. Mas na prateleira específica de "raciocínio forte que não custa um rim por token", o GLM 5.2 entra hoje como a melhor razão para você repensar o que está pagando.

Em uma frase

Se você roda agentes longos em texto puro e paga mais que US$ 3 por milhão de tokens de saída, teste o GLM 5.2 agora — é o segundo em IQ do catálogo, empatado em código com o Gemini Pro, e tem pesos abertos para self-host quando o volume justificar.

Perguntas frequentes

GLM 5.2 é open source de verdade?

Os dados do catálogo indicam que o GLM 5.2 é distribuído com pesos abertos, o que permite self-host e ajuste fino. Isso não é sinônimo de open source completo — a licença具体的 dos pesos e do código precisa ser conferida no release oficial da Z.ai antes de qualquer uso comercial sensível.

Quando faz sentido escolher Gemini 3.5 Flash em vez de GLM 5.2?

Quando você precisa de entrada multimodal (imagem, áudio, vídeo, arquivos) ou de latência muito baixa — o Flash roda a 194,5 tokens por segundo contra 70,1 do GLM 5.2. Em tarefas puramente textuais de raciocínio, o chinês leva.

Por que o GLM 5.2 é tão mais barato que o Claude Fable 5?

O preço não é comparável no mesmo eixo de qualidade: o Fable 5 lidera o índice de inteligência (62,1) enquanto o GLM 5.2 vem logo atrás (52,6). Parte da diferença vem do desenho mixture-of-experts do chinês, que ativa só 40 bilhões dos 753 bilhões de parâmetros por inferência, segurando o custo de operação.

Leia também