GLM 5 da Z.ai entra a US$ 1,92 sem nota de inteligência
Modelo flagship open-source da Z.ai chega com 204 mil tokens de contexto e preço intermediário; índice usado pelo catálogo ainda não tem medição para ele.
US$ 1,92 por milhão de tokens de saída. É o número que o catálogo crava para o GLM 5 da Z.ai a partir de hoje, e também a única certeza que você leva pra casa se decidir testar agora. Inteligência, nota de código, score agentic: tudo em branco no índice usado pelo catálogo.
A Z.ai descreve o GLM 5 como flagship open-source foundation model engineered for complex systems design and long-horizon agent workflows — em bom português, um modelo aberto de ponta focado em programação pesada e agentes que rodam por horas. Para quem paga, marketing é o de menos; o que importa é a tabela de preço e onde ele se encaixa no que já roda.
| Campo | Valor |
|---|---|
| Identificador | z-ai/glm-5 |
| Criador | z-ai |
| Preço de entrada | US$ 0.600 / M tokens |
| Preço de saída | US$ 1.92 / M tokens |
| Janela de contexto | 205k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.120 / M (80% de desconto) |
Preço: meio de tabela, com truque no cache
A conta do GLM 5 é assim: US$ 0,60 por milhão de tokens de entrada, US$ 1,92 por milhão de tokens de saída, e US$ 0,12 por milhão de tokens em cache. Comparado com o que está no topo do índice hoje, o modelo da Z.ai fica numa faixa intermediária — mais caro que o MiMo-V2-Flash da Xiaomi (US$ 0,30 de saída), mas quatro vezes mais barato que o o3 da OpenAI (US$ 8) e quase três vezes mais barato que o Haiku 4.5 da Anthropic (US$ 5).
O detalhe que vale olhar de perto é o cache a US$ 0,12. Pense assim: você paga o preço cheio pela primeira leitura de um PDF de 200 mil tokens, e quase nada cada vez que o agente reabre o mesmo arquivo para resolver a próxima task. Para pipelines que re-leem o mesmo contexto dezenas de vezes, isso muda a conta de TCO — e provavelmente explica por que a Z.ai precificou nesse ponto.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| GLM 5 (o novo) | — | 0.6 | 1.92 | 205k |
| MiMo-V2-Flash | 34.0 | 0.1 | 0.3 | 262k |
| o3 | 31.1 | 2 | 8 | 200k |
| Claude Haiku 4.5 | 29.9 | 1 | 5 | 200k |
O que o catálogo ainda não mediu
Aqui mora o ponto que o release não responde. O índice de inteligência, atualizado nesta data, lista o MiMo-V2-Flash da Xiaomi em 34.024, o o3 da OpenAI em 31.096 e o Haiku 4.5 da Anthropic em 29.892. O GLM 5 não tem nota — nem IQ geral, nem score de código, nem score agentic. A descrição da Z.ai diz que o modelo rivaliza com os principais em large-scale programming tasks; sem benchmark público, é promessa, não aferição.
204 mil tokens de contexto, código como tese
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Coder Next | 21.3 | 0.8 |
A janela de 204.800 tokens coloca o GLM 5 entre os modelos longos do mercado — espaço de sobra para engolir boa parte de uma base de código média inteira. A descrição insiste em expert developers e em performance de produção em tarefas de programação extensas, o mesmo terreno que o Qwen3 Coder Next (IQ 21.294, US$ 0,80 de saída) já vem disputando. A diferença é que o Qwen3 tem nota pública, o GLM 5 ainda não.
Para quem vale, para quem não muda nada
Vale testar agora se você já roda agente em produção e quer comparar uma alternativa de código aberto com 200K de contexto a um preço que não é o de topo — coloque-o numa fila de avaliação paralela, com cache habilitado, antes de mover qualquer carga crítica. Não muda nada se você precisa de benchmark antes de migrar: a referência barata medida continua sendo o MiMo-V2-Flash (US$ 0,30 de saída, IQ 34.024), e as premium continuam sendo o3 e Haiku 4.5.
Implicação prática: não migre hoje. Ponha o GLM 5 para rodar em paralelo ao seu modelo atual, meça latência e qualidade nas suas tarefas reais, e espere a primeira nota de inteligência aparecer no catálogo antes de decidir corte de custo.
Não troque de modelo no dia do lançamento: rode o GLM 5 em paralelo com cache habilitado, meça nas suas tarefas reais e só mova carga quando a nota de inteligência aparecer no catálogo.
Perguntas frequentes
GLM 5 é gratuito?
Não. É um modelo pago, listado a US$ 0,60 por milhão de tokens de entrada e US$ 1,92 por milhão de tokens de saída. A Z.ai o apresenta como open-source, mas o acesso pelo catálogo desta data é via API paga.
Qual a nota de inteligência do GLM 5?
Ainda não foi medida pelo índice usado neste catálogo. Por isso não dá para compará-lo diretamente com Xiaomi MiMo-V2-Flash (34.024), OpenAI o3 (31.096) ou Claude Haiku 4.5 (29.892) até que uma nota apareça.
Vale trocar o o3 pelo GLM 5?
Não agora. O o3 custa US$ 8 por milhão de tokens de saída e tem IQ 31.096 medido. O GLM 5 custa quatro vezes menos, mas sem benchmark público, qualquer migração de carga real é um salto no escuro.