GLM 4.6V chega multimodal a US$ 0,90 o milhão de tokens de saída
É quase nove vezes mais barata que o3 no preço de saída, mas sem índice de inteligência publicado a comparação ainda para na fatura.
A Z.ai listou hoje no catálogo a GLM 4.6V, e o primeiro número que chama atenção não é de capacidade — é de conta. O modelo aceita texto, imagem e vídeo como entrada e devolve texto por US$ 0,90 por milhão de tokens de saída. Para colocar em perspectiva: o3, que lidera o índice de inteligência do catálogo, cobra US$ 8 pela mesma unidade. São quase nove vezes mais caro para a mesma quantidade de texto gerado.
| Campo | Valor |
|---|---|
| Identificador | z-ai/glm-4.6v |
| Criador | z-ai |
| Preço de entrada | US$ 0.300 / M tokens |
| Preço de saída | US$ 0.900 / M tokens |
| Janela de contexto | 131k |
| Modalidade | text+image+video->text |
| Leitura de cache | US$ 0.055 / M (82% de desconto) |
Só que essa comparação exige uma ressalva honesta. O3 e Claude Haiku 4.5 são modelos de texto — o que a GLM 4.6V entrega de diferente é justamente a parte multimodal. Quando você envia uma imagem, um frame de vídeo ou um PDF com layout complexo para um modelo de texto puro, ou você não consegue, ou está pagando por um pré-processamento em outro lugar. Por isso o número promocional sozinho não resolve: vale pagar barato por uma capacidade que de outro modo custaria mais (ou nem existiria) no seu pipeline.
O que a GLM 4.6V entrega de fato
A ficha técnica diz o suficiente para entender onde o modelo se encaixa. São 131.072 tokens de contexto — bastante para vídeo, documentos longos e qualquer coisa que você jogue como sequência de frames misturados. A modalidade é text+image+video->text: ele lê, não gera imagem. Pense em análise, extração, sumarização, OCR pesado e raciocínio sobre conteúdo visual misto — não em geração de figuras.
O preço de entrada é US$ 0,30 por milhão de tokens, e o cache fica em US$ 0,055. Esse último é o que paga quem repete o mesmo prompt com frequência — útil em pipelines de classificação ou extração que rodam o mesmo contexto mil vezes por dia.
Onde ela se posiciona no tabuleiro
O catálogo reúne hoje mais de 298 modelos de 46 criadores, com 28 lançamentos nos últimos 30 dias. O topo de inteligência segue com o3 (31,096) e Claude Haiku 4.5 (29,892), seguido de gpt-oss-120b (24,126) a US$ 0,17 por milhão de tokens de saída — o mais barato entre os modelos com nota.
Em preço de saída, a GLM 4.6V está mais cara que o gpt-oss-120b, mas entrega multimodal, que nenhum dos dois do topo faz nessa faixa. Comparada a outras multimodais fora do comparativo, US$ 0,90 é competitivo — o problema é que o catálogo não traz hoje outra multimodal barata com benchmark medido para confronto direto.
O que ainda não dá para saber
Aqui mora a honestidade que você precisa antes de mover carga de produção. A GLM 4.6V entrou no catálogo sem índice de inteligência publicado. Não há nota de raciocínio, coding, agentic, nem custo-benefício calculado pelo agregador. Você consegue saber o preço e a modalidade; não consegue saber, com os dados públicos de hoje, se o modelo resolve uma tarefa complexa tão bem quanto custaria mais caro em outro lugar.
Isso muda o que vale a pena fazer. Se sua tarefa depende de qualidade comprovada em benchmark, ainda não é prudente trocar o3 ou Claude Haiku 4.5 pela GLM 4.6V só pelo número da fatura. Se a tarefa é alto volume de análise multimodal onde alguns pontos percentuais de acurácia não matam o caso de uso, o custo começa a pesar.
Para quem vale e para quem não muda nada
Vale para você se já roda análise de imagem ou vídeo, gasta em pipelines multimodais mais caros e pode rodar um A/B pequeno com 50 a 100 amostras antes de comprometer volume. O cache a US$ 0,055 é o que sustenta a economia real para quem repete contexto.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| GLM 4.6V (o novo) | — | 0.3 | 0.9 | 131k |
| o3 | 31.1 | 2 | 8 | 200k |
| Claude Haiku 4.5 | 29.9 | 1 | 5 | 200k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
Não muda nada se você trabalha 100% com texto, depende de benchmark de raciocínio forte, ou já tem um modelo multimodal consolidado com SLA e suporte. A economia de quase nove vezes sobre o3 só faz sentido se a diferença de qualidade não for o gargalo do seu produto.
A implicação prática: trate a GLM 4.6V como uma nova ferramenta multimodal barata no cinto, e não como a substituta do seu modelo principal. A vantagem de custo existe; o placar de inteligência, ainda não.
Trate a GLM 4.6V como mais uma ferramenta multimodal barata no cinto, e não como substituta do seu modelo principal — a economia existe, o placar de inteligência ainda não.
Perguntas frequentes
O GLM 4.6V é gratuito?
Não. É modelo pago, com entrada a US$ 0,30 e saída a US$ 0,90 por milhão de tokens. O cache sai por US$ 0,055 por milhão.
Qual o contexto máximo do GLM 4.6V?
131.072 tokens (128K), suficiente para documentos longos e sequências extensas de frames de vídeo em uma única chamada.
O GLM 4.6V já tem benchmark de inteligência?
Não no catálogo até a data de hoje. Não há nota de raciocínio, coding ou agentic publicada, então a comparação direta com o3 ou Claude Haiku 4.5 só rola com teste próprio em uma amostra do seu problema real.