FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

GLM 4.6 cobra US$ 1,75 por milhão de saída e mira o topo da Z.ai

Cinco dias após o lançamento, o modelo chinês de 200K de contexto entra num catálogo onde o3 lidera disparado — e a conta precisa fazer sentido.

Redação FalaVIP IA 3 min de leitura
US$ 1,75por milhão de tokens de saída
US$ 0,43por milhão de tokens de entrada
US$ 0,08por milhão de tokens em cache

Você viu o lançamento, olhou o preço e pensou: "mais um modelo chinês brigando por token barato". Faz sentido. Mas a conta do GLM 4.6 tem uma anatomia específica que muda o cálculo dependendo do seu uso — e é isso que vamos dissecar.

O preço não é um número só, são três

A Z.ai publicou três valores diferentes para o mesmo modelo: US$ 0,43 por milhão de tokens de entrada, US$ 1,75 por milhão de tokens de saída e US$ 0,08 por milhão de tokens em cache. Quem só lê o número de entrada acha que está olhando para um modelo baratíssimo. Quem só lê o de saída acha outra coisa. A diferença de quase 4x entre entrada e saída não é detalhe — é o sinal de que o modelo foi desenhado para workloads onde você envia muito e recebe pouco: classificação, extração, embedding-like tarefas, sumarização de documentos longos.

Para comparar: o OpenAI o3, que hoje lidera o índice de inteligência do catálogo com nota 31,096, cobra US$ 8 por milhão de tokens de saída. São mais de 4,5x o preço do GLM 4.6 na mesma métrica. Em workload de raciocínio pesado, essa diferença pesa. Em workload de leitura e resumo, nem tanto.

O contexto de 200K muda o tipo de problema que cabe nele

A janela subiu de 128K para 200K tokens na comparação com o GLM 4.5. Em prática, isso significa que um documento jurídico denso, uma base de código inteira ou um dump de log extenso passam a caber numa única chamada sem precisar de estratégia de chunking. Para quem está construindo agente que ingere repositório ou que precisa fazer RAG sem partir o documento, esse número é o que decide.

Ficha técnica — GLM 4.6
CampoValor
Identificadorz-ai/glm-4.6
Criadorz-ai
Preço de entradaUS$ 0.550 / M tokens
Preço de saídaUS$ 2.20 / M tokens
Janela de contexto205k
Modalidadetext->text
Leitura de cacheUS$ 0.110 / M (80% de desconto)

Onde ele se encaixa no tabuleiro de hoje

O catálogo tem hoje 244 modelos listados de 40 criadores diferentes, e 22 deles foram lançados nos últimos 30 dias. O GLM 4.6 está nesse bolo de novidades. No topo do índice de inteligência, o o3 da OpenAI aparece com 31,096, seguido do gpt-oss-120b com 24,126 e do Qwen3 Next 80B A3B Thinking com 16,867 — todos com notas substancialmente acima do que o GLM 4.6 entrega, considerando que o índice atual é a régua de hoje e a nota do GLM 4.6 não consta no dado fornecido.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 244 modelos disponíveis no catálogo nesta data.

Isso importa porque coloca o GLM 4.6 numa posição clara: ele não está brigando pelo topo de capacidade. Está brigando por custo-benefício em tarefas onde a régua de inteligência já passa do suficiente. Se o seu problema exige o melhor raciocínio disponível, o o3 continua sendo o padrão. Se exige processar muito texto com qualidade aceitável e pagar menos por isso, o GLM 4.6 entra na conta.

Para quem vale — e para quem não muda nada

Vale para você se: está construindo pipeline de ingestão de documentos grandes e o custo por milhão de tokens de saída é o gargalo da planilha; está rodando classificação ou extração em volume onde a diferença entre o o3 e um modelo de tier intermediário não aparece no resultado final; já tem infra multilíngue e o fornecedor chinês não é problema contratual.

Não muda nada para você se: precisa do melhor raciocínio disponível para matemática, código complexo ou pesquisa multi-step — o o3 lidera por margem grande e o preço se justifica; trabalha com dados sensíveis que têm restrição geográfica ou regulatória que impeça fornecedor chinês; já está rodando Qwen3 ou outro modelo aberto com custo similar e o switching cost não compensa.

A implicação na fatura

O dado concreto: numa chamada típica de 10K tokens de entrada e 2K de saída, o GLM 4.6 custa cerca de US$ 0,0079. A mesma chamada no o3 custa cerca de US$ 0,0204. Em volume de 1 milhão de chamadas por mês, são US$ 7.900 contra US$ 20.400 — diferença de US$ 12.500 que paga um engenheiro júnior. Mas só se a qualidade do o3 não for necessária para o que você está fazendo.

Em uma frase

Teste o GLM 4.6 em workload de leitura e extração onde o custo de saída domina a fatura; mantenha o o3 para tarefas onde a diferença de raciocínio se traduz em resultado melhor.

Perguntas frequentes

Quanto custa o GLM 4.6 da Z.ai?

O modelo cobra US$ 0,43 por milhão de tokens de entrada, US$ 1,75 por milhão de tokens de saída e US$ 0,08 por milhão de tokens em cache. A diferença de quase 4x entre entrada e saída indica foco em tarefas de ingestão e resumo.

GLM 4.6 é melhor que o OpenAI o3?

Não segundo o índice de inteligência atual do catálogo, onde o o3 lidera com 31,096 contra a ausência de nota publicada para o GLM 4.6. O GLM 4.6 compete por custo-benefício, não por capacidade bruta.

Qual o tamanho do contexto do GLM 4.6?

A janela de contexto é de 200K tokens, expandida dos 128K da geração anterior. Cabe documento jurídico denso, repositório de código ou dump de log extenso numa única chamada.

Leia também