FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

GLM 5 Turbo da Z.ai cobra US$ 4 por milhão de saída e entra sem nota de inteligência

Modelo chinês focado em agentes chega a US$ 1,20 de entrada e US$ 0,24 de cache, mas o catálogo ainda não publicou índice de capacidade.

Redação FalaVIP IA 3 min de leitura
US$ 4,00por milhão de tokens de saída
US$ 1,20por milhão de tokens de entrada
US$ 0,24por milhão de tokens em cache

O que muda na fatura

Você olha o preço de saída do GLM 5 Turbo — US$ 4 por milhão de tokens — e a primeira reação é comparar com o topo da prateleira. O Gemini 3.1 Pro Preview cobra US$ 12 pelo mesmo milhão. O GPT-5.3-Codex, US$ 14. O Claude Sonnet 4.6, US$ 15. Em tese, o modelo da Z.ai chega custando um terço do mais barato entre os grandes. Mas existe uma diferença brutal entre o que o catálogo mostra e o que ele esconde: o índice de inteligência do GLM 5 Turbo ainda não foi publicado. Você está comprando pelo preço, não pela nota.

Preço de saída (US$ por milhão de tokens)
GLM 5 Turbo4Gemini 3.1 Pro Preview12GPT-5.3-Codex14Claude Sonnet 4.615US$/M
Fonte: OpenRouter

O que a Z.ai está vendendo, na prática

A descrição oficial fala em "fast inference" e em otimização para fluxos agenticos como o OpenClaw. Traduzindo: o modelo foi pensado para rodar em pipelines onde outro software chama a API dezenas de vezes em sequência — o tipo de carga que explode o consumo de tokens de saída e que paga caro quando cada milhão custa US$ 12 ou US$ 15. O preço de cache, US$ 0,24 por milhão, é o detalhe que mais importa nesse cenário: significa que reusar o mesmo contexto em chamadas repetidas custa cinco vezes menos do que pagar entrada cheia de novo.

A janela de contexto de 202.752 tokens é outro número que pesa em fluxos agenticos. Não é recorde, mas é folgado para a maioria das cadeias de ferramentas.

Ficha técnica — GLM 5 Turbo
CampoValor
Identificadorz-ai/glm-5-turbo
Criadorz-ai
Preço de entradaUS$ 1.20 / M tokens
Preço de saídaUS$ 4.00 / M tokens
Janela de contexto203k
Modalidadetext->text
Leitura de cacheUS$ 0.240 / M (80% de desconto)

Onde ele se encaixa no tabuleiro

O catálogo tem 363 modelos listados hoje, vindos de 53 criadores. Nos últimos 30 dias, 29 modelos novos apareceram — o GLM 5 Turbo é mais um nessa fila. O topo por inteligência segue firme: Gemini 3.1 Pro Preview com 47,7, GPT-5.3-Codex com 45,5, Claude Sonnet 4.6 com 35,1. Logo abaixo, Qwen3.5 397B A17B com 34,3 e Xiaomi MiMo-V2-Flash com 34,0. O GLM 5 Turbo entra sem nota, então não dá para colocá-lo nesse ranking hoje.

Índice de inteligência (Artificial Analysis)
Gemini 3.1 Pro Preview47,7GPT-5.3-Codex45,5Claude Sonnet 4.635,1índice
Fonte: Artificial Analysis

A comparação honesta é com os dois únicos modelos acima de IQ 45 que existem no catálogo: Gemini 3.1 Pro Preview e GPT-5.3-Codex. Eles custam US$ 12 e US$ 14 por milhão de saída, respectivamente. Se o GLM 5 Turbo entregar metade da capacidade deles, o custo por ponto de inteligência já seria melhor que qualquer opção acima de IQ 45. Se entregar menos que isso, é só um modelo barato a mais.

Inteligência × preço de saída
Gemini 3.1 Pro PreviewGPT-5.3-CodexClaude Sonnet 4.6US$ por milhão (saída, escala log)índice de inteligência

Para quem vale, para quem não muda nada

Vale para você se está queimando tokens de saída em workflows agenticos e o orçamento é o gargalo. Cache a US$ 0,24 e saída a US$ 4 são números que permitem dobrar o volume de chamadas sem dobrar a fatura — desde que o modelo entregue o mínimo de qualidade que sua cadeia precisa. Vale também se você quer diversificar fornecedor e tirar um pouco de dependência da OpenAI ou do Google em tarefas que não exigem o estado da arte.

Não muda nada para você se está rodando tarefas onde a diferença de dois ou três pontos de inteligência derruba a taxa de acerto do produto. Benchmarks de coding e agentic não foram publicados para o GLM 5 Turbo, então não dá para saber se ele segura workflows que dependem de planejamento longo ou de geração de código com cobertura alta. Para essas cargas, esperar a nota de inteligência aparecer é a decisão racional.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
GLM 5 Turbo (o novo)1.24203k
Gemini 3.1 Pro Preview47.72121.05M
GPT-5.3-Codex45.51.7514400k
Claude Sonnet 4.635.13151M
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

O que olhar nos próximos dias

A Z.ai é criador chinês, mas o catálogo não informa país de origem nem data de corte de conhecimento — campos que ficaram em branco. O que vai definir se o GLM 5 Turbo vira ferramenta do dia a dia ou só mais um item na lista de 363 é a chegada do índice de inteligência. Quando ele aparecer, a conta fica simples: pegue o preço de US$ 4 por milhão de saída, divida pelo IQ, e compare com o resultado do Gemini 3.1 Pro Preview. Se o número for melhor, vale testar em produção. Se for pior, fica como plano B para tarefas de baixo risco.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
MiMo-V2-Flash34.00.3
Entre os 363 modelos disponíveis no catálogo nesta data.
Em uma frase

Roteie chamadas agenticas de baixo risco para o GLM 5 Turbo e meça custo por tarefa completa antes de migrar cargas críticas; sem nota de inteligência, ele é aposta de preço, não de capacidade.

Perguntas frequentes

Quanto custa o GLM 5 Turbo da Z.ai?

Cobra US$ 1,20 por milhão de tokens de entrada, US$ 4,00 por milhão de tokens de saída e US$ 0,24 por milhão de tokens em cache. É cerca de um terço do preço de saída cobrado por Gemini 3.1 Pro Preview e GPT-5.3-Codex.

O GLM 5 Turbo tem nota de inteligência publicada?

Não. O índice de capacidade do catálogo ainda está vazio para esse modelo, então não dá para ranqueá-lo contra Gemini 3.1 Pro Preview ou GPT-5.3-Codex até a medição ser publicada.

Para que tipo de tarefa o GLM 5 Turbo foi otimizado?

A descrição oficial aponta inferência rápida e fluxos agenticos como OpenClaw, com janela de contexto de 202.752 tokens — um perfil pensado para pipelines que chamam a API muitas vezes em sequência e reusam contexto via cache.

Leia também