GLM 4.6 cobra US$ 1,75 por milhão de saída e mira o topo da Z.ai
Cinco dias após o lançamento, o modelo chinês de 200K de contexto entra num catálogo onde o3 lidera disparado — e a conta precisa fazer sentido.
Você viu o lançamento, olhou o preço e pensou: "mais um modelo chinês brigando por token barato". Faz sentido. Mas a conta do GLM 4.6 tem uma anatomia específica que muda o cálculo dependendo do seu uso — e é isso que vamos dissecar.
O preço não é um número só, são três
A Z.ai publicou três valores diferentes para o mesmo modelo: US$ 0,43 por milhão de tokens de entrada, US$ 1,75 por milhão de tokens de saída e US$ 0,08 por milhão de tokens em cache. Quem só lê o número de entrada acha que está olhando para um modelo baratíssimo. Quem só lê o de saída acha outra coisa. A diferença de quase 4x entre entrada e saída não é detalhe — é o sinal de que o modelo foi desenhado para workloads onde você envia muito e recebe pouco: classificação, extração, embedding-like tarefas, sumarização de documentos longos.
Para comparar: o OpenAI o3, que hoje lidera o índice de inteligência do catálogo com nota 31,096, cobra US$ 8 por milhão de tokens de saída. São mais de 4,5x o preço do GLM 4.6 na mesma métrica. Em workload de raciocínio pesado, essa diferença pesa. Em workload de leitura e resumo, nem tanto.
O contexto de 200K muda o tipo de problema que cabe nele
A janela subiu de 128K para 200K tokens na comparação com o GLM 4.5. Em prática, isso significa que um documento jurídico denso, uma base de código inteira ou um dump de log extenso passam a caber numa única chamada sem precisar de estratégia de chunking. Para quem está construindo agente que ingere repositório ou que precisa fazer RAG sem partir o documento, esse número é o que decide.
| Campo | Valor |
|---|---|
| Identificador | z-ai/glm-4.6 |
| Criador | z-ai |
| Preço de entrada | US$ 0.550 / M tokens |
| Preço de saída | US$ 2.20 / M tokens |
| Janela de contexto | 205k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.110 / M (80% de desconto) |
Onde ele se encaixa no tabuleiro de hoje
O catálogo tem hoje 244 modelos listados de 40 criadores diferentes, e 22 deles foram lançados nos últimos 30 dias. O GLM 4.6 está nesse bolo de novidades. No topo do índice de inteligência, o o3 da OpenAI aparece com 31,096, seguido do gpt-oss-120b com 24,126 e do Qwen3 Next 80B A3B Thinking com 16,867 — todos com notas substancialmente acima do que o GLM 4.6 entrega, considerando que o índice atual é a régua de hoje e a nota do GLM 4.6 não consta no dado fornecido.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Isso importa porque coloca o GLM 4.6 numa posição clara: ele não está brigando pelo topo de capacidade. Está brigando por custo-benefício em tarefas onde a régua de inteligência já passa do suficiente. Se o seu problema exige o melhor raciocínio disponível, o o3 continua sendo o padrão. Se exige processar muito texto com qualidade aceitável e pagar menos por isso, o GLM 4.6 entra na conta.
Para quem vale — e para quem não muda nada
Vale para você se: está construindo pipeline de ingestão de documentos grandes e o custo por milhão de tokens de saída é o gargalo da planilha; está rodando classificação ou extração em volume onde a diferença entre o o3 e um modelo de tier intermediário não aparece no resultado final; já tem infra multilíngue e o fornecedor chinês não é problema contratual.
Não muda nada para você se: precisa do melhor raciocínio disponível para matemática, código complexo ou pesquisa multi-step — o o3 lidera por margem grande e o preço se justifica; trabalha com dados sensíveis que têm restrição geográfica ou regulatória que impeça fornecedor chinês; já está rodando Qwen3 ou outro modelo aberto com custo similar e o switching cost não compensa.
A implicação na fatura
O dado concreto: numa chamada típica de 10K tokens de entrada e 2K de saída, o GLM 4.6 custa cerca de US$ 0,0079. A mesma chamada no o3 custa cerca de US$ 0,0204. Em volume de 1 milhão de chamadas por mês, são US$ 7.900 contra US$ 20.400 — diferença de US$ 12.500 que paga um engenheiro júnior. Mas só se a qualidade do o3 não for necessária para o que você está fazendo.
Teste o GLM 4.6 em workload de leitura e extração onde o custo de saída domina a fatura; mantenha o o3 para tarefas onde a diferença de raciocínio se traduz em resultado melhor.
Perguntas frequentes
Quanto custa o GLM 4.6 da Z.ai?
O modelo cobra US$ 0,43 por milhão de tokens de entrada, US$ 1,75 por milhão de tokens de saída e US$ 0,08 por milhão de tokens em cache. A diferença de quase 4x entre entrada e saída indica foco em tarefas de ingestão e resumo.
GLM 4.6 é melhor que o OpenAI o3?
Não segundo o índice de inteligência atual do catálogo, onde o o3 lidera com 31,096 contra a ausência de nota publicada para o GLM 4.6. O GLM 4.6 compete por custo-benefício, não por capacidade bruta.
Qual o tamanho do contexto do GLM 4.6?
A janela de contexto é de 200K tokens, expandida dos 128K da geração anterior. Cabe documento jurídico denso, repositório de código ou dump de log extenso numa única chamada.