FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

GLM 5 Turbo chega a US$ 4 por milhão de saída, mas sem nota de IQ

Dez dias após o lançamento, o modelo da Z.ai aposta em preço baixo e janela de contexto grande — só que o catálogo ainda não tem benchmark para mostrar.

Redação FalaVIP IA 3 min de leitura
US$ 4por milhão de tokens de saída
US$ 1,20por milhão de tokens de entrada
202.752tokens de contexto

O que está em jogo aqui

Você viu o preço, viu a janela de contexto de 202 mil tokens e provavelmente pensou em testar. Antes de colocar a chave da API no gateway, vale parar e olhar o que o catálogo diz — e, principalmente, o que ele ainda não diz sobre o GLM 5 Turbo.

O modelo da Z.ai foi listado em 15 de março de 2026 e, dez dias depois, segue sem nota de inteligência no índice usado pelo catálogo. Isso não é defeito da Z.ai: é o estado da medição hoje. Mas muda completamente a conversa de compra.

O preço, traduzido

A conta é simples. Entrada custa US$ 1,20 por milhão de tokens. Saída, US$ 4. E tem cache a US$ 0,24 por milhão — o que é o detalhe que mais importa se você está montando um agente que repete system prompts enormes a cada chamada.

Colocando no mesmo balcão dos dois únicos modelos com IQ acima de 45 hoje — Gemini 3.1 Pro Preview e GPT-5.3-Codex — a saída do GLM 5 Turbo custa um terço do Gemini (US$ 12/M) e pouco menos de um terço do GPT-5.3-Codex (US$ 14/M). É o modelo mais barato da prateleira entre os que pedem entrada e saída separadas, e está longe do segundo colocado.

A diferença é grande o suficiente para fazer você repensar qualquer workload em que o GPT-5.3-Codex esteja sendo usado só porque "é o padrão". Se a tarefa não exige o topo da régua de inteligência, a conta cai de US$ 14 para US$ 4 por milhão de saída sem mudar de fornecedor.

Ficha técnica — GLM 5 Turbo
CampoValor
Identificadorz-ai/glm-5-turbo
Criadorz-ai
Preço de entradaUS$ 1.20 / M tokens
Preço de saídaUS$ 4.00 / M tokens
Janela de contexto203k
Modalidadetext->text
Leitura de cacheUS$ 0.240 / M (80% de desconto)

O que o catálogo não está te contando

Aqui mora o "se". O GLM 5 Turbo não tem IQ publicado, não tem nota de coding, não tem agentic, não tem blended, não tem velocidade em tokens por segundo, não tem país de origem confirmado e não tem contagem de parâmetros. É um buraco grande de informação para um modelo que já está há dez dias no ar.

A descrição oficial diz que ele foi otimizado para "fluxos agent-driven em cenários OpenClaw". Traduzindo: o argumento de venda é agente, não chat. Mas sem benchmark de agentic para comparar com o Claude Sonnet 4.6 (IQ 35,1, US$ 15/M de saída) ou com o Qwen3.5 397B A17B (IQ 34,3, US$ 2,34/M de saída), você está comprando no escuro.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
MiMo-V2-Omni35.92
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
Entre os 374 modelos disponíveis no catálogo nesta data.

Para quem vale — e para quem não muda nada

Vale a pena testar agora se você se encaixa em um destes três perfis:

  • Roda agente em loop com system prompt repetido e quer pagar cache de US$ 0,24/M em vez de US$ 1,20/M cheio a cada turno.
  • Tem workload de texto longo (a janela de 202.752 tokens é maior que a do Gemini 3.1 Pro Preview e do GPT-5.3-Codex nos números que o catálogo costuma publicar) e quer evitar pagar duas chamadas para caber em uma.
  • Está queimando fatura com GPT-5.3-Codex em tarefas que não precisam do topo da régua — e aceita rodar uma bateria interna de 50 prompts antes de migrar.

Não vale — ou pelo menos não muda nada — se:

  • Você precisa de benchmark publicado para fechar contrato com cliente enterprise. Sem IQ, sem coding, sem agentic, a conversa trava no jurídico.
  • Sua carga é dominada por raciocínio pesado e você já está pagando Gemini 3.1 Pro Preview. O salto de IQ de 47,7 para "não medido" é grande demais para apostar.
  • Você precisa de pesos abertos para rodar local. O dado de open_weights não está preenchido, então não há base para assumir.

A implicação prática

Não troque seu modelo principal ainda. Mas se você tem uma fila de tarefas de agente que hoje roda no GPT-5.3-Codex ou no Claude Sonnet 4.6,pare o pipeline por uma hora, monte 50 casos de teste representativos e rode o GLM 5 Turbo em paralelo. Se a taxa de sucesso ficar próxima da do seu modelo atual, a economia por milhão de tokens de saída é imediata — e o cache de US$ 0,24 é o tipo de detalhe que, multiplicado por milhões de chamadas, paga o resto do mês de API.

Em uma frase

Teste em workload de agente com system prompt repetido antes de migrar de GPT-5.3-Codex ou Claude Sonnet 4.6 — a economia é real, mas só se a qualidade aguentar o tranco.

Perguntas frequentes

Quanto custa o GLM 5 Turbo da Z.ai?

US$ 1,20 por milhão de tokens de entrada, US$ 4 por milhão de tokens de saída e US$ 0,24 por milhão em cache. É o modelo mais barato entre os listados no catálogo com precificação de entrada e saída separadas.

O GLM 5 Turbo tem benchmark de inteligência?

Não. Dez dias após o lançamento, o índice de IQ, coding e agentic seguem sem medição publicada no catálogo. Isso não significa que o modelo é fraco — significa que você não tem dado público para comparar antes de comprar.

GLM 5 Turbo serve para agente?

A descrição oficial posiciona o modelo para fluxos agent-driven em cenários OpenClaw, com janela de 202.752 tokens e cache barato. Sem nota de agentic publicada, vale rodar uma bateria interna antes de colocar em produção.

Leia também