GLM 5V Turbo chegou há 12 dias e ainda não publicou nenhum benchmark
Z.ai diz que é o primeiro modelo agente multimodal nativo. A pergunta é se os US$ 4 por milhão de saída compensam a ausência de nota de IQ.
O marketing na frente, o benchmark atrás
Doze dias. Esse é o intervalo entre o lançamento do GLM 5V Turbo (1º de abril) e esta segunda-feira. Em duas semanas, o que a Z.ai publicou sobre o modelo? Um press release chamando-o de "primeiro modelo agente multimodal nativo" da casa, construído para coding baseado em visão e tarefas agent-driven. E uma página de preços.
Sem IQ. Sem nota de coding. Sem nota de agentic. Sem score blended. Os campos estão vazios no catálogo.
Você não está olhando para um mistério — está olhando para uma aposta. A Z.ai decidiu colocar o GLM 5V Turbo no mercado antes de produzir os números que a indústria usa para ranquear modelos. É uma escolha válida, mas recai sobre quem paga a fatura no fim do mês.
O preço conta metade da história
| Campo | Valor |
|---|---|
| Identificador | z-ai/glm-5v-turbo |
| Criador | z-ai |
| Preço de entrada | US$ 1.20 / M tokens |
| Preço de saída | US$ 4.00 / M tokens |
| Janela de contexto | 203k |
| Modalidade | text+image+video->text |
| Leitura de cache | US$ 0.240 / M (80% de desconto) |
A ficha técnica é o que se sabe. Entrada a US$ 1,20 por milhão de tokens, saída a US$ 4, e — o detalhe mais interessante — cache hit a US$ 0,24 por milhão. Para fluxos que repetem muito contexto (agentes que re-leem o mesmo código, screenshots ou documentos a cada turno), esse preço de cache é agressivo.
Onde ele se encaixa no tabuleiro desta segunda-feira? O topo do catálogo é ocupado pelo Gemini 3.1 Pro Preview da Google (US$ 12 de saída) e pelo GPT-5.3-Codex da OpenAI (US$ 14). O Claude Sonnet 4.6 da Anthropic cobra US$ 15. O GLM 5V Turbo, a US$ 4, custa um terço disso.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
Mas a comparação direta exige uma ginástica: ele não tem nota de IQ publicada, então ranquear preço é cego em qualidade. Modelos como o MiMo-V2-Omni da Xiaomi (US$ 2 de saída, IQ 35,8) e o Qwen3.5 397B (US$ 2,34, IQ 34,2) ocupam uma faixa parecida de preço — com benchmark.
O diferencial é multimodal nativo
A modalidade é o que separa o GLM 5V Turbo: text+image+video -> text. Vídeo entra como input de primeira classe, não como afterthought. Para pipelines de agentic coding em que o agente assiste a uma tela, lê um screenshot ou processa um frame, esse suporte nativo importa. É a especificação do contrato, não marketing.
A janela de contexto de 202.752 tokens é grande o bastante para carregar código, frames e histórico de agente sem precisar de malabarismos.
Para quem vale a pena — e para quem não
Vale a pena se você está montando pipeline agentic com visão computacional — QA visual, agents que operam interfaces, leitura de dashboards em vídeo — e já rodou seu próprio benchmark interno num conjunto pequeno de tarefas. O preço de cache (US$ 0,24/M) é o ponto: padrão de uso repetitivo derruba o custo efetivo.
Não muda nada se você precisa de uma referência pública antes de colocar um modelo em produção — para apresentar ao time, defender a escolha numa review, comparar com o que já roda. Dos 28 modelos lançados nos últimos 30 dias, este é o que chega com a ficha mais vazia. Pior: se seu uso é puramente textual, você paga pela stack multimodal que não vai usar. Há opções mais baratas e com nota publicada.
Implicação na sua decisão
O teste prático é direto: Z.ai publica benchmark ou não nas próximas duas semanas? Se aparecer IQ acima de 40 com nota de coding sólida, o argumento de preço vira irresistível. Se continuar vazio por mais uma quinzena, o "Turbo" vira sinônimo de "lançado antes da hora". Até lá, trate o GLM 5V Turbo como hipótese de custo, não como substituto do que já roda.
Rode seu próprio benchmark em uma amostra pequena de tarefas multimodais antes de migrar qualquer fluxo; o preço só faz sentido se o modelo entregar no seu caso de uso.
Perguntas frequentes
O GLM 5V Turbo é gratuito?
Não. O catálogo lista entrada a US$ 1,20 por milhão de tokens, saída a US$ 4 e cache hit a US$ 0,24 por milhão.
O GLM 5V Turbo já tem benchmark publicado?
Não, pelo menos não no catálogo consultado nesta data: IQ, coding, agentic e blended aparecem como nulos. Z.ai ainda não publicou números ranqueáveis.
Quando o GLM 5V Turbo foi lançado?
Em 1º de abril de 2026, segundo o catálogo. Este perfil foi escrito doze dias depois, em 13 de abril.