FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

GLM 4.6V custa barato, mas o catálogo ainda não tem nota de QI

Modelo multimodal da Z.ai entra com preço competitivo, 128K de contexto e benchmark em branco onze dias depois do lançamento.

Redação FalaVIP IA 3 min de leitura
US$ 0,90por milhão de tokens de saída
US$ 0,055por milhão de tokens em cache
128 miltokens de contexto

Onze dias após o lançamento, o GLM 4.6V ainda não tem nota de inteligência. Não é atraso da sua timeline — é o estado real do catálogo em 19 de dezembro. O modelo entrou multimodal, promete processar imagem, documento e vídeo num único contexto de 128 mil tokens, e o índice geral de QI simplesmente não tem medição. Em outras palavras: dá pra chamar a API, mas o gráfico que você normalmente consulta antes de escolher modelo está em branco.

Isso importa porque dezembro não está parado. Nos últimos 30 dias entraram 32 modelos novos no catálogo, que hoje soma 309 opções de 47 criadores. O topo da régua de inteligência tem Xiaomi MiMo-V2-Flash (QI 34,024, a US$ 0,30 o milhão de saída), OpenAI o3 (31,096, a US$ 8) e Anthropic Claude Haiku 4.5 (29,892, a US$ 5). O GLM 4.6V entra na prateleira ao lado desses — em preço.

O que é o GLM 4.6V

Modelo multimodal da Z.ai (criador chinês conhecido pela família GLM) que aceita texto, imagem e vídeo e devolve só texto. Contexto de 131.072 tokens, ou 128K — o suficiente para engolir PDFs inteiros, dashboards, contratos longos ou sequências de frames sem precisar particionar. A descrição oficial fala em "raciocínio de alta fidelidade visual" e em "layouts complexos de página", o vocabulário de quem mira OCR de documento bagunçado, leitura de relatório extenso e resumo de vídeo.

Ficha técnica — GLM 4.6V
CampoValor
Identificadorz-ai/glm-4.6v
Criadorz-ai
Preço de entradaUS$ 0.300 / M tokens
Preço de saídaUS$ 0.900 / M tokens
Janela de contexto131k
Modalidadetext+image+video->text
Leitura de cacheUS$ 0.055 / M (82% de desconto)

Preço e onde ele se encaixa hoje

A conta sai assim: US$ 0,30 por milhão de tokens de entrada, US$ 0,90 por milhão de saída e US$ 0,055 por milhão em cache. Três detalhes valem destaque.

O preço de cache é quase seis vezes menor que o de entrada. Se o seu workload repete o mesmo prefixo — o mesmo template de contrato, o mesmo manual, o mesmo conjunto de imagens — você paga para reusar em vez de reenviar a cada chamada. É onde a economia mensal aparece de verdade, não em demo.

A US$ 0,90 o milhão de saída, o GLM 4.6V custa menos de um oitavo do OpenAI o3 (US$ 8) e menos de um quinto do Claude Haiku 4.5 (US$ 5). Se o seu volume de tokens gerados é alto — descrição de imagem, extração estruturada, resposta longa — o fim do mês fica bem diferente.

O catálogo, porém, não publicou QI, nota de coding nem agentic. Comparar preço sem nota é comprar pela embalagem. Os concorrentes diretos que pontuam (o Xiaomi a US$ 0,30 de saída, o gpt-oss-120b a US$ 0,17) são text-only, então a comparação justa para multimodal ainda não existe.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 309 modelos disponíveis no catálogo nesta data.

Para quem vale (e para quem não muda nada)

Vale testar se você está em uma destas três frentes: extração de informação de PDFs e documentos longos com layout bagunçado, onde 128K de contexto muda a arquitetura da pipeline; leitura de vídeo frame a frame para resumo ou auditoria, algo que normalmente vira cascata de modelos; workload com prefixo repetido, onde o cache a US$ 0,055 é a economia real. Em qualquer uma dessas frentes, a ausência de benchmark público pesa menos do que a economia no token de saída.

Não muda nada para quem usa só texto puro e já tem alternativa mais barata e medida; mantém pipeline multimodal validado em GPT-4V, Claude ou Gemini e o custo marginal é irrelevante; precisa de SLA medido antes de produção — sem nota pública, sem reprodutibilidade, a homologação trava.

O que falta medir

Em onze dias, nem a régua geral, nem a de coding, nem a agentic publicou valor para o GLM 4.6V. Isso pode mudar rápido, porque o catálogo atualiza medições conforme os índices rodam. Mas em 19 de dezembro o cenário é claro: preço competitivo, multimodal raro, benchmark em branco. Quem for rodar piloto interno, avalie na sua carga. Quem for comprar pelo release, espere a régua encher.

Em uma frase

Pilote em workload multimodal com prefixo repetido para tirar proveito do cache a US$ 0,055, mas não migre produção sem benchmark próprio — o preço convida, a régua de QI ainda não mediu.

Perguntas frequentes

Quanto custa o GLM 4.6V na API?

US$ 0,30 por milhão de tokens de entrada, US$ 0,90 por milhão de saída e US$ 0,055 por milhão em cache. O preço de cache é cerca de seis vezes menor que o de entrada, então workloads com prefixo repetido são onde a conta mais muda.

O GLM 4.6V tem benchmark de inteligência?

Não no catálogo em 19 de dezembro de 2025. Os índices geral, de coding e agentic ainda não publicaram nota. Isso pode mudar conforme os índices rodam novas medições, mas hoje a régua está em branco.

Vale trocar o GPT-4V ou Claude Vision pelo GLM 4.6V?

Depende do workload. Para extração em PDFs longos e leitura de vídeo com prefixo repetido, o preço e o cache convidam a testar. Para produção com SLA medido, melhor rodar piloto interno antes de migrar a pipeline.

Leia também