FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

GLM 5 da Z.ai entra a US$ 1,92 sem nota de inteligência

Modelo flagship open-source da Z.ai chega com 204 mil tokens de contexto e preço intermediário; índice usado pelo catálogo ainda não tem medição para ele.

Redação FalaVIP IA 3 min de leitura
US$ 1,92por milhão de tokens de saída
US$ 0,12por milhão de tokens em cache
204.800tokens de contexto

US$ 1,92 por milhão de tokens de saída. É o número que o catálogo crava para o GLM 5 da Z.ai a partir de hoje, e também a única certeza que você leva pra casa se decidir testar agora. Inteligência, nota de código, score agentic: tudo em branco no índice usado pelo catálogo.

A Z.ai descreve o GLM 5 como flagship open-source foundation model engineered for complex systems design and long-horizon agent workflows — em bom português, um modelo aberto de ponta focado em programação pesada e agentes que rodam por horas. Para quem paga, marketing é o de menos; o que importa é a tabela de preço e onde ele se encaixa no que já roda.

Ficha técnica — GLM 5
CampoValor
Identificadorz-ai/glm-5
Criadorz-ai
Preço de entradaUS$ 0.600 / M tokens
Preço de saídaUS$ 1.92 / M tokens
Janela de contexto205k
Modalidadetext->text
Leitura de cacheUS$ 0.120 / M (80% de desconto)

Preço: meio de tabela, com truque no cache

Preço de saída (US$ por milhão de tokens)
GLM 51,92MiMo-V2-Flash0,3o38Claude Haiku 4.55US$/M
Fonte: OpenRouter

A conta do GLM 5 é assim: US$ 0,60 por milhão de tokens de entrada, US$ 1,92 por milhão de tokens de saída, e US$ 0,12 por milhão de tokens em cache. Comparado com o que está no topo do índice hoje, o modelo da Z.ai fica numa faixa intermediária — mais caro que o MiMo-V2-Flash da Xiaomi (US$ 0,30 de saída), mas quatro vezes mais barato que o o3 da OpenAI (US$ 8) e quase três vezes mais barato que o Haiku 4.5 da Anthropic (US$ 5).

O detalhe que vale olhar de perto é o cache a US$ 0,12. Pense assim: você paga o preço cheio pela primeira leitura de um PDF de 200 mil tokens, e quase nada cada vez que o agente reabre o mesmo arquivo para resolver a próxima task. Para pipelines que re-leem o mesmo contexto dezenas de vezes, isso muda a conta de TCO — e provavelmente explica por que a Z.ai precificou nesse ponto.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
GLM 5 (o novo)0.61.92205k
MiMo-V2-Flash34.00.10.3262k
o331.128200k
Claude Haiku 4.529.915200k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

O que o catálogo ainda não mediu

Aqui mora o ponto que o release não responde. O índice de inteligência, atualizado nesta data, lista o MiMo-V2-Flash da Xiaomi em 34.024, o o3 da OpenAI em 31.096 e o Haiku 4.5 da Anthropic em 29.892. O GLM 5 não tem nota — nem IQ geral, nem score de código, nem score agentic. A descrição da Z.ai diz que o modelo rivaliza com os principais em large-scale programming tasks; sem benchmark público, é promessa, não aferição.

204 mil tokens de contexto, código como tese

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Coder Next21.30.8
Entre os 332 modelos disponíveis no catálogo nesta data.

A janela de 204.800 tokens coloca o GLM 5 entre os modelos longos do mercado — espaço de sobra para engolir boa parte de uma base de código média inteira. A descrição insiste em expert developers e em performance de produção em tarefas de programação extensas, o mesmo terreno que o Qwen3 Coder Next (IQ 21.294, US$ 0,80 de saída) já vem disputando. A diferença é que o Qwen3 tem nota pública, o GLM 5 ainda não.

Para quem vale, para quem não muda nada

Vale testar agora se você já roda agente em produção e quer comparar uma alternativa de código aberto com 200K de contexto a um preço que não é o de topo — coloque-o numa fila de avaliação paralela, com cache habilitado, antes de mover qualquer carga crítica. Não muda nada se você precisa de benchmark antes de migrar: a referência barata medida continua sendo o MiMo-V2-Flash (US$ 0,30 de saída, IQ 34.024), e as premium continuam sendo o3 e Haiku 4.5.

Implicação prática: não migre hoje. Ponha o GLM 5 para rodar em paralelo ao seu modelo atual, meça latência e qualidade nas suas tarefas reais, e espere a primeira nota de inteligência aparecer no catálogo antes de decidir corte de custo.

Em uma frase

Não troque de modelo no dia do lançamento: rode o GLM 5 em paralelo com cache habilitado, meça nas suas tarefas reais e só mova carga quando a nota de inteligência aparecer no catálogo.

Perguntas frequentes

GLM 5 é gratuito?

Não. É um modelo pago, listado a US$ 0,60 por milhão de tokens de entrada e US$ 1,92 por milhão de tokens de saída. A Z.ai o apresenta como open-source, mas o acesso pelo catálogo desta data é via API paga.

Qual a nota de inteligência do GLM 5?

Ainda não foi medida pelo índice usado neste catálogo. Por isso não dá para compará-lo diretamente com Xiaomi MiMo-V2-Flash (34.024), OpenAI o3 (31.096) ou Claude Haiku 4.5 (29.892) até que uma nota apareça.

Vale trocar o o3 pelo GLM 5?

Não agora. O o3 custa US$ 8 por milhão de tokens de saída e tem IQ 31.096 medido. O GLM 5 custa quatro vezes menos, mas sem benchmark público, qualquer migração de carga real é um salto no escuro.

Leia também