GLM 4.6V custa barato, mas o catálogo ainda não tem nota de QI
Modelo multimodal da Z.ai entra com preço competitivo, 128K de contexto e benchmark em branco onze dias depois do lançamento.
Onze dias após o lançamento, o GLM 4.6V ainda não tem nota de inteligência. Não é atraso da sua timeline — é o estado real do catálogo em 19 de dezembro. O modelo entrou multimodal, promete processar imagem, documento e vídeo num único contexto de 128 mil tokens, e o índice geral de QI simplesmente não tem medição. Em outras palavras: dá pra chamar a API, mas o gráfico que você normalmente consulta antes de escolher modelo está em branco.
Isso importa porque dezembro não está parado. Nos últimos 30 dias entraram 32 modelos novos no catálogo, que hoje soma 309 opções de 47 criadores. O topo da régua de inteligência tem Xiaomi MiMo-V2-Flash (QI 34,024, a US$ 0,30 o milhão de saída), OpenAI o3 (31,096, a US$ 8) e Anthropic Claude Haiku 4.5 (29,892, a US$ 5). O GLM 4.6V entra na prateleira ao lado desses — em preço.
O que é o GLM 4.6V
Modelo multimodal da Z.ai (criador chinês conhecido pela família GLM) que aceita texto, imagem e vídeo e devolve só texto. Contexto de 131.072 tokens, ou 128K — o suficiente para engolir PDFs inteiros, dashboards, contratos longos ou sequências de frames sem precisar particionar. A descrição oficial fala em "raciocínio de alta fidelidade visual" e em "layouts complexos de página", o vocabulário de quem mira OCR de documento bagunçado, leitura de relatório extenso e resumo de vídeo.
| Campo | Valor |
|---|---|
| Identificador | z-ai/glm-4.6v |
| Criador | z-ai |
| Preço de entrada | US$ 0.300 / M tokens |
| Preço de saída | US$ 0.900 / M tokens |
| Janela de contexto | 131k |
| Modalidade | text+image+video->text |
| Leitura de cache | US$ 0.055 / M (82% de desconto) |
Preço e onde ele se encaixa hoje
A conta sai assim: US$ 0,30 por milhão de tokens de entrada, US$ 0,90 por milhão de saída e US$ 0,055 por milhão em cache. Três detalhes valem destaque.
O preço de cache é quase seis vezes menor que o de entrada. Se o seu workload repete o mesmo prefixo — o mesmo template de contrato, o mesmo manual, o mesmo conjunto de imagens — você paga para reusar em vez de reenviar a cada chamada. É onde a economia mensal aparece de verdade, não em demo.
A US$ 0,90 o milhão de saída, o GLM 4.6V custa menos de um oitavo do OpenAI o3 (US$ 8) e menos de um quinto do Claude Haiku 4.5 (US$ 5). Se o seu volume de tokens gerados é alto — descrição de imagem, extração estruturada, resposta longa — o fim do mês fica bem diferente.
O catálogo, porém, não publicou QI, nota de coding nem agentic. Comparar preço sem nota é comprar pela embalagem. Os concorrentes diretos que pontuam (o Xiaomi a US$ 0,30 de saída, o gpt-oss-120b a US$ 0,17) são text-only, então a comparação justa para multimodal ainda não existe.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Para quem vale (e para quem não muda nada)
Vale testar se você está em uma destas três frentes: extração de informação de PDFs e documentos longos com layout bagunçado, onde 128K de contexto muda a arquitetura da pipeline; leitura de vídeo frame a frame para resumo ou auditoria, algo que normalmente vira cascata de modelos; workload com prefixo repetido, onde o cache a US$ 0,055 é a economia real. Em qualquer uma dessas frentes, a ausência de benchmark público pesa menos do que a economia no token de saída.
Não muda nada para quem usa só texto puro e já tem alternativa mais barata e medida; mantém pipeline multimodal validado em GPT-4V, Claude ou Gemini e o custo marginal é irrelevante; precisa de SLA medido antes de produção — sem nota pública, sem reprodutibilidade, a homologação trava.
O que falta medir
Em onze dias, nem a régua geral, nem a de coding, nem a agentic publicou valor para o GLM 4.6V. Isso pode mudar rápido, porque o catálogo atualiza medições conforme os índices rodam. Mas em 19 de dezembro o cenário é claro: preço competitivo, multimodal raro, benchmark em branco. Quem for rodar piloto interno, avalie na sua carga. Quem for comprar pelo release, espere a régua encher.
Pilote em workload multimodal com prefixo repetido para tirar proveito do cache a US$ 0,055, mas não migre produção sem benchmark próprio — o preço convida, a régua de QI ainda não mediu.
Perguntas frequentes
Quanto custa o GLM 4.6V na API?
US$ 0,30 por milhão de tokens de entrada, US$ 0,90 por milhão de saída e US$ 0,055 por milhão em cache. O preço de cache é cerca de seis vezes menor que o de entrada, então workloads com prefixo repetido são onde a conta mais muda.
O GLM 4.6V tem benchmark de inteligência?
Não no catálogo em 19 de dezembro de 2025. Os índices geral, de coding e agentic ainda não publicaram nota. Isso pode mudar conforme os índices rodam novas medições, mas hoje a régua está em branco.
Vale trocar o GPT-4V ou Claude Vision pelo GLM 4.6V?
Depende do workload. Para extração em PDFs longos e leitura de vídeo com prefixo repetido, o preço e o cache convidam a testar. Para produção com SLA medido, melhor rodar piloto interno antes de migrar a pipeline.