FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

GLM 5.2 cobra 25% do Gemini 3.1 Pro e quase dobra nota em agente

Lançado há três dias, o modelo chinês da Z.ai empata em código e custa US$ 3 por milhão de tokens de saída — mas o Gemini ainda leva em multimodalidade, velocidade e recall.

Redação FalaVIP IA 3 min de leitura
US$ 3,04 vs US$ 12por milhão de tokens de saída
52,641 vs 47,738índice de inteligência Artificial Analysis
45,667 vs 23,045nota em agente

Três dias no mercado, segunda posição no ranking global de inteligência e token de saída a 25% do preço cobrado pelo Google. Esse é o Z.ai GLM 5.2, lançado na terça passada. A pergunta que fica é: vale trocar do Gemini 3.1 Pro Preview para ele?

A Z.ai chinesa colocou no ar um modelo de raciocínio com 753 bilhões de parâmetros totais — mas só 40 bilhões ativos por token, graças a uma arquitetura Mixture of Experts. Pense num galpão com 753 prateleiras, mas só 40 funcionários de plantão a cada chamada: cada especialista entra em ação no token em que manda bem, e os outros ficam dormindo. É por isso que a conta de VRAM e de FLOPs não explode, e o preço cai.

Inteligência e raciocínio

Índice de inteligência (Artificial Analysis)
GLM 5.252,6Gemini 3.1 Pro Preview47,7índice
Fonte: Artificial Analysis

No índice da Artificial Analysis, o GLM 5.2 marca 52,641 e o Gemini 3.1 Pro Preview marca 47,738 — diferença de 10% a favor do chinês. Em coding, empate técnico: 68,756 contra 68,826, separados por 0,07 ponto, dentro da margem de ruído. Onde o GLM 5.2 dispara é em agente: 45,667 contra 23,045. Em fluxos que encadeiam tool use, várias rodadas e correção de plano, o modelo novo resolve quase o dobro do que o Gemini alcança.

Preço

Preço de saída (US$ por milhão de tokens)
GLM 5.23,036Gemini 3.1 Pro Preview12US$/M
Fonte: OpenRouter

US$ 3,036 contra US$ 12 por milhão de tokens de saída. Para um time que cospe 100 milhões de tokens por mês, a fatura cai de US$ 1.200 para US$ 304 — quase US$ 900 de economia num único caso. O preço de entrada também é menor: US$ 0,966 contra US$ 2. O cache do GLM 5.2 fica em US$ 0,1932, contra US$ 0,20 do Gemini.

Onde cada um ganha

GLM 5.2 × Gemini 3.1 Pro Preview
CritérioGLM 5.2Gemini 3.1 Pro Preview
Índice de inteligência52.647.7
Entrada US$/M0.9662
Saída US$/M3.03612
Contexto1.05M1.05M
Pesos abertossimnão
Velocidade (tok/s)70103
Índice de código68.868.8
Índice agêntico45.723.0

O GLM 5.2 ganha em quatro frentes: preço (em entrada, saída e cache), agente, raciocínio bruto e a vantagem estrutural de ser open weights. Você baixa os 753 bilhões de parâmetros, hospeda em cluster próprio, ajusta, ou passa pelo seu gateway sem intermediário americano. Para times que operam em jurisdição onde soberania de dado pesa, isso é decisivo.

O Gemini 3.1 Pro Preview ganha em três: multimodalidade completa (texto, imagem, arquivo, áudio e vídeo na mesma chamada, coisa que o GLM 5.2 não faz), velocidade de primeira resposta (102,52 tokens/s contra 70,1, cerca de 46% mais rápido) e conhecimento enciclopédico medido pelo benchmark de omniscience — 31,883 contra 4,433, quase oito vezes mais.

Como decidir

Vá de GLM 5.2 se o seu pipeline é só texto→texto, se você roda agentes longos e a fatura do Gemini está mordendo, ou se compliance obriga self-host e os pesos abertos resolvem. É a escolha natural para times que já operam infraestrutura na China ou priorizam latência baixa em raciocínio encadeado.

Fique com o Gemini 3.1 Pro Preview se você precisa analisar vídeo, áudio ou imagem misturados com texto na mesma requisição, se latência de primeira resposta importa (chatbots de produção, busca conversacional) ou se o seu caso cruza muitas áreas de conhecimento — RAG pesado sobre bases heterogêneas, geração enciclopédica, tarefas que dependem de recall amplo.

Onde isso encaixa

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
GLM 5.252.63.036
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
GPT-5.3-Codex45.514
Entre os 475 modelos disponíveis no catálogo nesta data.

O topo do dia é o Claude Fable 5, com 62,073 de IQ e US$ 50 por milhão de saída. Logo abaixo vem o GLM 5.2 que estamos destrinchando, depois o Gemini 3.1 Pro Preview, e em quinto o GPT-5.3-Codex a US$ 14. Os dois mais baratos acima de 45 de IQ continuam sendo o MiniMax M3 (US$ 1,20) e o DeepSeek V4 Pro 0423 (US$ 1,74).

Se você está pagando US$ 12 por milhão de tokens de saída no Gemini e o seu workload é só texto, migre para o GLM 5.2 no próximo ciclo de cobrança. A economia financia o trabalho de ajustar prompt, e a única perda real — multimodalidade — raramente pesa o suficiente para justificar a diferença de quase quatro vezes no preço.

Em uma frase

Se seu pipeline é só texto, migre do Gemini 3.1 Pro Preview para o GLM 5.2 — a economia financia o retrabalho de ajustar prompt e a única perda real é multimodalidade.

Perguntas frequentes

GLM 5.2 é melhor que Gemini 3.1 Pro Preview em código?

Empate técnico. Os dois pontuam quase igual no benchmark de coding (68,756 contra 68,826), separados por 0,07 ponto. A diferença real aparece em agente, onde o GLM 5.2 quase dobra a nota do Gemini.

O que significa 40B ativos no GLM 5.2?

É Mixture of Experts. O modelo tem 753 bilhões de parâmetros no total, mas só 40 bilhões são acionados por token — cada especialista entra em ação no tipo de entrada em que manda bem. Isso reduz memória e custo sem abrir mão da capacidade total.

Posso rodar o GLM 5.2 localmente?

Sim, os pesos são abertos. Na prática, 753 bilhões de parâmetros exigem cluster multi-GPU de alto desempenho — não cabe em workstation comum nem em servidor único de 8 GPUs.

Leia também