GLM 5.2 cobra 25% do Gemini 3.1 Pro e quase dobra nota em agente
Lançado há três dias, o modelo chinês da Z.ai empata em código e custa US$ 3 por milhão de tokens de saída — mas o Gemini ainda leva em multimodalidade, velocidade e recall.
Três dias no mercado, segunda posição no ranking global de inteligência e token de saída a 25% do preço cobrado pelo Google. Esse é o Z.ai GLM 5.2, lançado na terça passada. A pergunta que fica é: vale trocar do Gemini 3.1 Pro Preview para ele?
A Z.ai chinesa colocou no ar um modelo de raciocínio com 753 bilhões de parâmetros totais — mas só 40 bilhões ativos por token, graças a uma arquitetura Mixture of Experts. Pense num galpão com 753 prateleiras, mas só 40 funcionários de plantão a cada chamada: cada especialista entra em ação no token em que manda bem, e os outros ficam dormindo. É por isso que a conta de VRAM e de FLOPs não explode, e o preço cai.
Inteligência e raciocínio
No índice da Artificial Analysis, o GLM 5.2 marca 52,641 e o Gemini 3.1 Pro Preview marca 47,738 — diferença de 10% a favor do chinês. Em coding, empate técnico: 68,756 contra 68,826, separados por 0,07 ponto, dentro da margem de ruído. Onde o GLM 5.2 dispara é em agente: 45,667 contra 23,045. Em fluxos que encadeiam tool use, várias rodadas e correção de plano, o modelo novo resolve quase o dobro do que o Gemini alcança.
Preço
US$ 3,036 contra US$ 12 por milhão de tokens de saída. Para um time que cospe 100 milhões de tokens por mês, a fatura cai de US$ 1.200 para US$ 304 — quase US$ 900 de economia num único caso. O preço de entrada também é menor: US$ 0,966 contra US$ 2. O cache do GLM 5.2 fica em US$ 0,1932, contra US$ 0,20 do Gemini.
Onde cada um ganha
| Critério | GLM 5.2 | Gemini 3.1 Pro Preview |
|---|---|---|
| Índice de inteligência | 52.6 | 47.7 |
| Entrada US$/M | 0.966 | 2 |
| Saída US$/M | 3.036 | 12 |
| Contexto | 1.05M | 1.05M |
| Pesos abertos | sim | não |
| Velocidade (tok/s) | 70 | 103 |
| Índice de código | 68.8 | 68.8 |
| Índice agêntico | 45.7 | 23.0 |
O GLM 5.2 ganha em quatro frentes: preço (em entrada, saída e cache), agente, raciocínio bruto e a vantagem estrutural de ser open weights. Você baixa os 753 bilhões de parâmetros, hospeda em cluster próprio, ajusta, ou passa pelo seu gateway sem intermediário americano. Para times que operam em jurisdição onde soberania de dado pesa, isso é decisivo.
O Gemini 3.1 Pro Preview ganha em três: multimodalidade completa (texto, imagem, arquivo, áudio e vídeo na mesma chamada, coisa que o GLM 5.2 não faz), velocidade de primeira resposta (102,52 tokens/s contra 70,1, cerca de 46% mais rápido) e conhecimento enciclopédico medido pelo benchmark de omniscience — 31,883 contra 4,433, quase oito vezes mais.
Como decidir
Vá de GLM 5.2 se o seu pipeline é só texto→texto, se você roda agentes longos e a fatura do Gemini está mordendo, ou se compliance obriga self-host e os pesos abertos resolvem. É a escolha natural para times que já operam infraestrutura na China ou priorizam latência baixa em raciocínio encadeado.
Fique com o Gemini 3.1 Pro Preview se você precisa analisar vídeo, áudio ou imagem misturados com texto na mesma requisição, se latência de primeira resposta importa (chatbots de produção, busca conversacional) ou se o seu caso cruza muitas áreas de conhecimento — RAG pesado sobre bases heterogêneas, geração enciclopédica, tarefas que dependem de recall amplo.
Onde isso encaixa
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| GLM 5.2 | 52.6 | 3.036 |
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
| GPT-5.3-Codex | 45.5 | 14 |
O topo do dia é o Claude Fable 5, com 62,073 de IQ e US$ 50 por milhão de saída. Logo abaixo vem o GLM 5.2 que estamos destrinchando, depois o Gemini 3.1 Pro Preview, e em quinto o GPT-5.3-Codex a US$ 14. Os dois mais baratos acima de 45 de IQ continuam sendo o MiniMax M3 (US$ 1,20) e o DeepSeek V4 Pro 0423 (US$ 1,74).
Se você está pagando US$ 12 por milhão de tokens de saída no Gemini e o seu workload é só texto, migre para o GLM 5.2 no próximo ciclo de cobrança. A economia financia o trabalho de ajustar prompt, e a única perda real — multimodalidade — raramente pesa o suficiente para justificar a diferença de quase quatro vezes no preço.
Se seu pipeline é só texto, migre do Gemini 3.1 Pro Preview para o GLM 5.2 — a economia financia o retrabalho de ajustar prompt e a única perda real é multimodalidade.
Perguntas frequentes
GLM 5.2 é melhor que Gemini 3.1 Pro Preview em código?
Empate técnico. Os dois pontuam quase igual no benchmark de coding (68,756 contra 68,826), separados por 0,07 ponto. A diferença real aparece em agente, onde o GLM 5.2 quase dobra a nota do Gemini.
O que significa 40B ativos no GLM 5.2?
É Mixture of Experts. O modelo tem 753 bilhões de parâmetros no total, mas só 40 bilhões são acionados por token — cada especialista entra em ação no tipo de entrada em que manda bem. Isso reduz memória e custo sem abrir mão da capacidade total.
Posso rodar o GLM 5.2 localmente?
Sim, os pesos são abertos. Na prática, 753 bilhões de parâmetros exigem cluster multi-GPU de alto desempenho — não cabe em workstation comum nem em servidor único de 8 GPUs.