FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

GLM 5V Turbo chegou há 12 dias e ainda não publicou nenhum benchmark

Z.ai diz que é o primeiro modelo agente multimodal nativo. A pergunta é se os US$ 4 por milhão de saída compensam a ausência de nota de IQ.

Redação FalaVIP IA 3 min de leitura
US$ 4,00por milhão de tokens de saída
US$ 0,24por milhão de tokens em cache hit
12 diasdesde o lançamento, sem benchmark publicado

O marketing na frente, o benchmark atrás

Doze dias. Esse é o intervalo entre o lançamento do GLM 5V Turbo (1º de abril) e esta segunda-feira. Em duas semanas, o que a Z.ai publicou sobre o modelo? Um press release chamando-o de "primeiro modelo agente multimodal nativo" da casa, construído para coding baseado em visão e tarefas agent-driven. E uma página de preços.

Sem IQ. Sem nota de coding. Sem nota de agentic. Sem score blended. Os campos estão vazios no catálogo.

Você não está olhando para um mistério — está olhando para uma aposta. A Z.ai decidiu colocar o GLM 5V Turbo no mercado antes de produzir os números que a indústria usa para ranquear modelos. É uma escolha válida, mas recai sobre quem paga a fatura no fim do mês.

O preço conta metade da história

Ficha técnica — GLM 5V Turbo
CampoValor
Identificadorz-ai/glm-5v-turbo
Criadorz-ai
Preço de entradaUS$ 1.20 / M tokens
Preço de saídaUS$ 4.00 / M tokens
Janela de contexto203k
Modalidadetext+image+video->text
Leitura de cacheUS$ 0.240 / M (80% de desconto)

A ficha técnica é o que se sabe. Entrada a US$ 1,20 por milhão de tokens, saída a US$ 4, e — o detalhe mais interessante — cache hit a US$ 0,24 por milhão. Para fluxos que repetem muito contexto (agentes que re-leem o mesmo código, screenshots ou documentos a cada turno), esse preço de cache é agressivo.

Onde ele se encaixa no tabuleiro desta segunda-feira? O topo do catálogo é ocupado pelo Gemini 3.1 Pro Preview da Google (US$ 12 de saída) e pelo GPT-5.3-Codex da OpenAI (US$ 14). O Claude Sonnet 4.6 da Anthropic cobra US$ 15. O GLM 5V Turbo, a US$ 4, custa um terço disso.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
MiMo-V2-Omni35.92
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
Entre os 390 modelos disponíveis no catálogo nesta data.

Mas a comparação direta exige uma ginástica: ele não tem nota de IQ publicada, então ranquear preço é cego em qualidade. Modelos como o MiMo-V2-Omni da Xiaomi (US$ 2 de saída, IQ 35,8) e o Qwen3.5 397B (US$ 2,34, IQ 34,2) ocupam uma faixa parecida de preço — com benchmark.

O diferencial é multimodal nativo

A modalidade é o que separa o GLM 5V Turbo: text+image+video -> text. Vídeo entra como input de primeira classe, não como afterthought. Para pipelines de agentic coding em que o agente assiste a uma tela, lê um screenshot ou processa um frame, esse suporte nativo importa. É a especificação do contrato, não marketing.

A janela de contexto de 202.752 tokens é grande o bastante para carregar código, frames e histórico de agente sem precisar de malabarismos.

Para quem vale a pena — e para quem não

Vale a pena se você está montando pipeline agentic com visão computacional — QA visual, agents que operam interfaces, leitura de dashboards em vídeo — e já rodou seu próprio benchmark interno num conjunto pequeno de tarefas. O preço de cache (US$ 0,24/M) é o ponto: padrão de uso repetitivo derruba o custo efetivo.

Não muda nada se você precisa de uma referência pública antes de colocar um modelo em produção — para apresentar ao time, defender a escolha numa review, comparar com o que já roda. Dos 28 modelos lançados nos últimos 30 dias, este é o que chega com a ficha mais vazia. Pior: se seu uso é puramente textual, você paga pela stack multimodal que não vai usar. Há opções mais baratas e com nota publicada.

Implicação na sua decisão

O teste prático é direto: Z.ai publica benchmark ou não nas próximas duas semanas? Se aparecer IQ acima de 40 com nota de coding sólida, o argumento de preço vira irresistível. Se continuar vazio por mais uma quinzena, o "Turbo" vira sinônimo de "lançado antes da hora". Até lá, trate o GLM 5V Turbo como hipótese de custo, não como substituto do que já roda.

Em uma frase

Rode seu próprio benchmark em uma amostra pequena de tarefas multimodais antes de migrar qualquer fluxo; o preço só faz sentido se o modelo entregar no seu caso de uso.

Perguntas frequentes

O GLM 5V Turbo é gratuito?

Não. O catálogo lista entrada a US$ 1,20 por milhão de tokens, saída a US$ 4 e cache hit a US$ 0,24 por milhão.

O GLM 5V Turbo já tem benchmark publicado?

Não, pelo menos não no catálogo consultado nesta data: IQ, coding, agentic e blended aparecem como nulos. Z.ai ainda não publicou números ranqueáveis.

Quando o GLM 5V Turbo foi lançado?

Em 1º de abril de 2026, segundo o catálogo. Este perfil foi escrito doze dias depois, em 13 de abril.

Leia também