FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

GLM 5.2 batch custa 45% menos que o Claude Fable 5 — vale trocar?

A versão assíncrona do modelo chinês chega uma semana depois do topo do catálogo e muda a conta de quem roda agente em escala.

Redação FalaVIP IA 3 min de leitura
US$ 4,40por milhão de tokens de saída
US$ 0,26por milhão de tokens em cache
1.048.575tokens de janela de contexto

Sete dias depois de virar o modelo mais inteligente do catálogo, o GLM 5.2 ganhou uma variante que interessa mais à planilha do que ao ranking: a versão batch. O preço de saída saltou de US$ 3,036 para US$ 4,40 por milhão de tokens, mas continua sendo a única opção acima de IQ 45 com janela de 1 milhão de tokens cobrada abaixo de US$ 5 por milhão de saída — e, na prática, é processada em fila assíncrona, o que muda a conta de quem roda agente.

O que mudou em relação ao GLM 5.2 normal

O GLM 5.2 "padrão" cobra US$ 3,036 por milhão de tokens de saída e ocupa o segundo lugar em inteligência do catálogo, atrás do Claude Fable 5 (IQ 62,073) e à frente do Gemini 3.1 Pro Preview (IQ 47,738). A edição batch mantém o mesmo modelo, a mesma janela de 1.048.575 tokens e a mesma proposta — raciocínio de longa duração, engenharia de software em nível de projeto, workflows agenticos — mas cobra US$ 4,40 por milhão de saída. Parece pior, e olhado de relance é. Só que batch não substitui o modo síncrono: serve para jobs que podem esperar horas, como varreduras longas de repositório, pipelines noturnos e processamento de bases inteiras de documentos.

A conta que ninguém te mostra no anúncio

O detalhe que muda tudo está no cache: US$ 0,26 por milhão de tokens cacheados. Quem repete o mesmo prompt de sistema em milhares de chamadas — exatamente o padrão de agentes e de pipelines RAG — paga uma fração do que pagaria em qualquer modelo acima de IQ 50. O Claude Fable 5, topo do ranking, cobra US$ 50 por milhão de saída. Em um job de 10 milhões de tokens de saída, a diferença entre US$ 50 e US$ 4,40 é de US$ 456 — e isso sem contar o cache.

Ficha técnica — GLM 5.2 (free)
CampoValor
Identificadorz-ai/glm-5.2:free
Criadorz-ai
Preço de entradaUS$ 0.000 / M tokens
Preço de saídaUS$ 0.000 / M tokens
Janela de contexto256k
Modalidadetext->text

Onde ele entra e onde ele não entra

Para quem roda agente em escala, com prompts grandes reutilizados e tolerância a latência de horas, o GLM 5.2 batch é o melhor custo-benefício acima de IQ 45 do catálogo hoje. Para quem precisa de resposta em menos de um segundo — chat em produção, autocompletar, ferramentas interativas — a versão síncrona do GLM 5.2 ou alternativas como o Gemini 3.5 Flash (IQ 46,673, US$ 9 por milhão de saída) fazem mais sentido. E para tarefas onde a margem de erro precisa ser mínima e o orçamento não é problema, o Claude Fable 5 continua reinando no topo.

O tabuleiro em 23 de junho de 2026

O catálogo tem 475 modelos listados, vindos de 61 criadores, e 28 deles foram lançados nos últimos 30 dias. O topo continua concentrado em três países: Estados Unidos (Anthropic, OpenAI, Google), China (Z.ai, DeepSeek) e uma presença menor de outros laboratórios. O GLM 5.2 batch não disputa a primeira posição em inteligência — essa cadeira é do Claude Fable 5 — mas disputa algo mais importante para quem paga a API: o canto inferior direito do gráfico, onde preço e capacidade se cruzam.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
GLM 5.252.63.036
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
GPT-5.3-Codex45.514
Entre os 475 modelos disponíveis no catálogo nesta data.

O que fazer com isso hoje

Se você já roda o GLM 5.2 síncrono e tem jobs que podem esperar, migre esses jobs para a versão batch e meça a economia no próximo ciclo. Se você está no Claude Fable 5 e o orçamento aperta, vale testar o GLM 5.2 batch em uma workload não-crítica antes de trocar de fornecedor. E se você está começando um projeto novo que vai processar muito texto com prompts repetidos, a combinação de 1M de contexto com cache a US$ 0,26 por milhão é, hoje, a mais agressiva do mercado acima de IQ 45.

Em uma frase

Migre jobs tolerantes a latência para o GLM 5.2 batch e use o cache de US$ 0,26 por milhão como alavanca de custo em pipelines agenticos.

Perguntas frequentes

Quanto custa o GLM 5.2 batch?

US$ 1,40 por milhão de tokens de entrada, US$ 4,40 por milhão de saída e US$ 0,26 por milhão de tokens em cache. A janela é de 1.048.575 tokens e o processamento é assíncrono.

GLM 5.2 batch é mais barato que o Claude Fable 5?

Sim, em preço de lista: o Claude Fable 5 cobra US$ 50 por milhão de saída, contra US$ 4,40 do GLM 5.2 batch. A diferença é de mais de dez vezes no token de saída, sem considerar o cache.

Quando NÃO vale usar o GLM 5.2 batch?

Quando a resposta precisa chegar em menos de um segundo — chat ao vivo, autocompletar, ferramentas interativas. Para esses casos, o modo síncrono do próprio GLM 5.2 ou modelos Flash são opções mais adequadas.

Leia também