GLM 5 Turbo chega a US$ 4 por milhão de saída, mas sem nota de IQ
Dez dias após o lançamento, o modelo da Z.ai aposta em preço baixo e janela de contexto grande — só que o catálogo ainda não tem benchmark para mostrar.
O que está em jogo aqui
Você viu o preço, viu a janela de contexto de 202 mil tokens e provavelmente pensou em testar. Antes de colocar a chave da API no gateway, vale parar e olhar o que o catálogo diz — e, principalmente, o que ele ainda não diz sobre o GLM 5 Turbo.
O modelo da Z.ai foi listado em 15 de março de 2026 e, dez dias depois, segue sem nota de inteligência no índice usado pelo catálogo. Isso não é defeito da Z.ai: é o estado da medição hoje. Mas muda completamente a conversa de compra.
O preço, traduzido
A conta é simples. Entrada custa US$ 1,20 por milhão de tokens. Saída, US$ 4. E tem cache a US$ 0,24 por milhão — o que é o detalhe que mais importa se você está montando um agente que repete system prompts enormes a cada chamada.
Colocando no mesmo balcão dos dois únicos modelos com IQ acima de 45 hoje — Gemini 3.1 Pro Preview e GPT-5.3-Codex — a saída do GLM 5 Turbo custa um terço do Gemini (US$ 12/M) e pouco menos de um terço do GPT-5.3-Codex (US$ 14/M). É o modelo mais barato da prateleira entre os que pedem entrada e saída separadas, e está longe do segundo colocado.
A diferença é grande o suficiente para fazer você repensar qualquer workload em que o GPT-5.3-Codex esteja sendo usado só porque "é o padrão". Se a tarefa não exige o topo da régua de inteligência, a conta cai de US$ 14 para US$ 4 por milhão de saída sem mudar de fornecedor.
| Campo | Valor |
|---|---|
| Identificador | z-ai/glm-5-turbo |
| Criador | z-ai |
| Preço de entrada | US$ 1.20 / M tokens |
| Preço de saída | US$ 4.00 / M tokens |
| Janela de contexto | 203k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.240 / M (80% de desconto) |
O que o catálogo não está te contando
Aqui mora o "se". O GLM 5 Turbo não tem IQ publicado, não tem nota de coding, não tem agentic, não tem blended, não tem velocidade em tokens por segundo, não tem país de origem confirmado e não tem contagem de parâmetros. É um buraco grande de informação para um modelo que já está há dez dias no ar.
A descrição oficial diz que ele foi otimizado para "fluxos agent-driven em cenários OpenClaw". Traduzindo: o argumento de venda é agente, não chat. Mas sem benchmark de agentic para comparar com o Claude Sonnet 4.6 (IQ 35,1, US$ 15/M de saída) ou com o Qwen3.5 397B A17B (IQ 34,3, US$ 2,34/M de saída), você está comprando no escuro.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
Para quem vale — e para quem não muda nada
Vale a pena testar agora se você se encaixa em um destes três perfis:
- Roda agente em loop com system prompt repetido e quer pagar cache de US$ 0,24/M em vez de US$ 1,20/M cheio a cada turno.
- Tem workload de texto longo (a janela de 202.752 tokens é maior que a do Gemini 3.1 Pro Preview e do GPT-5.3-Codex nos números que o catálogo costuma publicar) e quer evitar pagar duas chamadas para caber em uma.
- Está queimando fatura com GPT-5.3-Codex em tarefas que não precisam do topo da régua — e aceita rodar uma bateria interna de 50 prompts antes de migrar.
Não vale — ou pelo menos não muda nada — se:
- Você precisa de benchmark publicado para fechar contrato com cliente enterprise. Sem IQ, sem coding, sem agentic, a conversa trava no jurídico.
- Sua carga é dominada por raciocínio pesado e você já está pagando Gemini 3.1 Pro Preview. O salto de IQ de 47,7 para "não medido" é grande demais para apostar.
- Você precisa de pesos abertos para rodar local. O dado de open_weights não está preenchido, então não há base para assumir.
A implicação prática
Não troque seu modelo principal ainda. Mas se você tem uma fila de tarefas de agente que hoje roda no GPT-5.3-Codex ou no Claude Sonnet 4.6,pare o pipeline por uma hora, monte 50 casos de teste representativos e rode o GLM 5 Turbo em paralelo. Se a taxa de sucesso ficar próxima da do seu modelo atual, a economia por milhão de tokens de saída é imediata — e o cache de US$ 0,24 é o tipo de detalhe que, multiplicado por milhões de chamadas, paga o resto do mês de API.
Teste em workload de agente com system prompt repetido antes de migrar de GPT-5.3-Codex ou Claude Sonnet 4.6 — a economia é real, mas só se a qualidade aguentar o tranco.
Perguntas frequentes
Quanto custa o GLM 5 Turbo da Z.ai?
US$ 1,20 por milhão de tokens de entrada, US$ 4 por milhão de tokens de saída e US$ 0,24 por milhão em cache. É o modelo mais barato entre os listados no catálogo com precificação de entrada e saída separadas.
O GLM 5 Turbo tem benchmark de inteligência?
Não. Dez dias após o lançamento, o índice de IQ, coding e agentic seguem sem medição publicada no catálogo. Isso não significa que o modelo é fraco — significa que você não tem dado público para comparar antes de comprar.
GLM 5 Turbo serve para agente?
A descrição oficial posiciona o modelo para fluxos agent-driven em cenários OpenClaw, com janela de 202.752 tokens e cache barato. Sem nota de agentic publicada, vale rodar uma bateria interna antes de colocar em produção.