GLM 5V Turbo a US$ 4 por milhão, mas sem benchmark de inteligência
Modelo da Z.ai é o primeiro multimodal nativo da empresa e custa um terço do Gemini 3.1 Pro — só que o catálogo não publicou índice de inteligência para comparar.
US$ 4 por milhão — e só isso por enquanto
US$ 4 por milhão de tokens de saída. É o que a Z.ai está cobrando pelo GLM 5V Turbo, seu primeiro modelo multimodal nativo, que entrou no catálogo hoje. O problema é que esse é praticamente o único número que você consegue comparar: o catálogo não publicou índice de inteligência, nota de coding nem score agentic para o modelo.
A conta fica assim: entrada a US$ 1,20 por milhão, saída a US$ 4, cache de prompt a US$ 0,24 por milhão. Janela de contexto de 202.752 tokens. Entrada aceita texto, imagem e vídeo; saída é texto. É um perfil de agente com visão — o tipo de modelo que recebe um screenshot, planeja, executa código e repete.
O que cabe nessa conta
Para colocar o preço em perspectiva, o Gemini 3.1 Pro Preview cobra US$ 12 por milhão de saída e o GPT-5.3-Codex cobra US$ 14. O GLM 5V Turbo custa um terço do primeiro e menos de um terço do segundo. Se entregar metade da inteligência do Gemini, ainda assim sai mais barato por token útil.
A janela de 202.752 tokens também pesa. É mais do que o Gemini 3.1 Pro oferece e coloca o GLM 5V Turbo no mesmo patamar de modelos pensados para processar vídeos longos ou sessões inteiras de agente sem precisar truncar contexto. Para fluxos que precisam lembrar do início da conversa até o fim, isso importa.
| Campo | Valor |
|---|---|
| Identificador | z-ai/glm-5v-turbo |
| Criador | z-ai |
| Preço de entrada | US$ 1.20 / M tokens |
| Preço de saída | US$ 4.00 / M tokens |
| Janela de contexto | 203k |
| Modalidade | text+image+video->text |
| Leitura de cache | US$ 0.240 / M (80% de desconto) |
O cache a US$ 0,24 é onde mora a economia real para quem roda agentes. Pipelines que reenviam o mesmo contexto a cada chamada — sistemas de UI testing, automações que "veem" tela, fluxos de long-horizon planning — pagam uma fração do preço de entrada em todas as iterações depois da primeira. Multiplique isso por milhares de chamadas e a diferença aparece na fatura no fim do mês.
A descrição oficial fala em "vision-based coding" e "agent-driven tasks" com planejamento de longo horizonte. É o mesmo nicho que o Gemini 3.1 Pro e o GPT-5.3-Codex disputam — só que cobrando uma fração. A diferença é que a Z.ai está apostando que preço e multimodal nativo bastam para competir, mesmo sem benchmark publicado.
O ranking não mexeu
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
O topo do catálogo segue igual com a chegada do GLM 5V Turbo. Gemini 3.1 Pro Preview lidera com IQ 47,738. GPT-5.3-Codex vem logo atrás com IQ 45,512. O terceiro colocado é o Xiaomi MiMo-V2-Omni — multimodal como o GLM 5V Turbo — com IQ 35,866 e preço de US$ 2 por milhão de saída.
Aqui está o detalhe que importa: o MiMo-V2-Omni já entrega multimodal nativo por US$ 2, metade do preço do GLM 5V Turbo, e com índice de inteligência publicado. Se você precisa de multimodal barato e quer comparar antes de integrar, o Xiaomi é a referência óbvia até a Z.ai publicar os números do seu modelo.
No gráfico de inteligência versus preço, o GLM 5V Turbo aparece como um ponto sem coordenada vertical — porque o eixo de inteligência está vazio para ele. É a diferença entre comprar um carro com preço na etiqueta e sem ficha técnica, e outro com tudo publicado. Você até pode fazer o test drive, mas está assinando sem ler as especificações.
Para quem não muda nada
Se sua escolha é guiada por benchmark publicado, o GLM 5V Turbo não entra na conta hoje. Você está pagando barato, mas está apostando. O catálogo tem 382 modelos listados, 54 criadores, 32 lançamentos nos últimos 30 dias. A Z.ai agora tem um multimodal nativo no meio desse volume — só que, por enquanto, sem nota para comparar com o resto.
Para quem vale olhar agora
Se sua carga é agente com visão — screenshots de interface, vídeos curtos, automações que interpretam UI — o GLM 5V Turbo entra no radar pelo preço e pela janela de contexto de 202 mil tokens. É multimodal nativo, não um modelo de texto com visão colada por cima. Para quem roda loops longos de agente, isso pode significar menos alucinação na hora de "olhar" a tela.
Se você já roda o Gemini 3.1 Pro para esse tipo de tarefa e quer cortar custo, vale um teste A/B controlado antes de migrar de vez. Meça a mesma tarefa nos dois modelos, com o mesmo prompt, e compare taxa de acerto. Se o GLM 5V Turbo entregar perto de 80% da qualidade por um terço do preço, a conta fecha.
Se você roda agentes com visão e quer cortar custo, vale testar o GLM 5V Turbo em paralelo com o Gemini 3.1 Pro — mas só migre depois de medir taxa de acerto na sua tarefa, porque o catálogo ainda não publicou benchmark de inteligência.
Perguntas frequentes
O GLM 5V Turbo tem benchmark de inteligência publicado?
Não. O catálogo não publicou índice de inteligência, nota de coding nem score agentic para o GLM 5V Turbo. Por enquanto, dá para comparar preço e contexto, mas não dá para ranquear o modelo contra os demais.
Para que tipo de tarefa o GLM 5V Turbo foi feito?
Segundo a descrição oficial, para vision-based coding e tarefas agent-driven com planejamento de longo horizonte — fluxos em que um agente recebe imagens ou vídeo, decide o próximo passo e executa código.
Vale trocar o Gemini 3.1 Pro pelo GLM 5V Turbo?
Só se você não depender de benchmark de inteligência publicado. O Gemini custa três vezes mais por token de saída, mas tem IQ 47,738 no catálogo. O GLM 5V Turbo é mais barato, mas está sem nota — então teste A/B antes de migrar.