FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

GLM 4.6 entra no catálogo a US$ 1,75 por milhão de saída — e muda o cálculo da Z.ai

Janela de contexto salta de 128K para 200K tokens, mas preço de entrada subiu e o índice de inteligência continua sem medição pública.

Redação FalaVIP IA 3 min de leitura
US$ 1,75por milhão de tokens de saída
US$ 0,43por milhão de tokens de entrada
200Ktokens de janela de contexto

O que muda (e o que não muda) na conta

A Z.ai publicou hoje o GLM 4.6, sucessor do GLM-4.5, e o detalhe que vai aparecer primeiro na sua planilha é o preço de saída: US$ 1,75 por milhão de tokens. Em relação ao modelo anterior da casa, é um salto — o GLM-4.5 cobrava US$ 1,10 pelo mesmo item. Em relação ao topo do catálogo, continua barato: o OpenAI o3, que lidera o índice de inteligência hoje, cobra US$ 8,00 pelo milhão de saída, ou seja, 4,6 vezes mais.

Preço de saída (US$ por milhão de tokens)
GLM 4.62,2o38gpt-oss-120b0,17Qwen3 Next 80B A3B Thinking1,2US$/M
Fonte: OpenRouter

A entrada também subiu, de US$ 0,30 para US$ 0,43 por milhão de tokens. Para workloads com muito prompt e pouca resposta — RAG massivo, sumarização de documentos — esse reajuste pesa mais do que a saída. Já quem usa o modelo para gerar código ou texto longo sente o impacto no output.

A janela de 200K é o chamariz real

O release da Z.ai destaca a expansão da janela de contexto de 128K para 200K tokens como a melhoria mais visível. Em termos práticos, é a diferença entre colar um repositório médio inteiro num único prompt e ter que fragmentar em vários. Para quem faz análise de código ou revisão de contratos longos, isso muda o fluxo de trabalho.

Ficha técnica — GLM 4.6
CampoValor
Identificadorz-ai/glm-4.6
Criadorz-ai
Preço de entradaUS$ 0.550 / M tokens
Preço de saídaUS$ 2.20 / M tokens
Janela de contexto205k
Modalidadetext->text
Leitura de cacheUS$ 0.110 / M (80% de desconto)

O corte de conhecimento está em março de 2025, o que coloca o GLM 4.6 seis meses atrás do calendário — relevante se você precisa de eventos recentes sem RAG por cima.

Onde ele se encaixa no tabuleiro

O catálogo tem hoje 244 modelos listados, vindos de 40 criadores, e 25 deles foram lançados nos últimos 30 dias. Mesmo sem o índice de inteligência do GLM 4.6 publicado, dá para posicionar pelo preço.

Inteligência × preço de saída
o3gpt-oss-120bQwen3 Next 80B A3B ThinkingUS$ por milhão (saída, escala log)índice de inteligência

Olhando os rivais diretos da Z.ai em faixa de preço parecido:

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
GLM 4.6 (o novo)0.552.2205k
o331.128200k
gpt-oss-120b24.10.0370.17131k
Qwen3 Next 80B A3B Thinking16.90.151.2262k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.
  • OpenAI o3: US$ 8,00 de saída, índice de inteligência 31,1. É a referência de capacidade, não de economia.
  • OpenAI gpt-oss-120b: US$ 0,17 de saída, índice 24,1. Custa uma fração, mas é um modelo aberto com perfil diferente.
  • Qwen3 Next 80B A3B Thinking: US$ 1,20 de saída, índice 16,9. Concorrente chinês direto, mais barato e com benchmark medido.
Índice de inteligência (Artificial Analysis)
o331,1gpt-oss-120b24,1Qwen3 Next 80B A3B Thinking16,9índice
Fonte: Artificial Analysis

O GLM 4.6 entra entre o Qwen3 e o o3 em preço, mas sem nota pública de inteligência — o que significa que, por enquanto, a comparação é só de cotação.

Para quem vale — e para quem não muda nada

Vale para quem já usa GLM-4.5 em produção e quer dobrar a janela de contexto sem trocar de fornecedor. Vale também para times que precisam de contexto longo e estão dispostos a pagar um pouco mais pela flexibilidade — o cache hit a US$ 0,08 por milhão continua entre os mais baratos do catálogo, então prompts repetidos continuam baratos.

Não muda nada para quem roda o o3 da OpenAI por causa de raciocínio pesado e mede resultado por benchmark — o GLM 4.6 não traz número de inteligência publicado, e o o3 lidera o índice com folga. Também não muda para quem já encontrou no gpt-oss-120b um modelo aberto suficiente por uma fração do preço.

O que fazer agora

Se você tem uma fila de jobs esperando por contexto maior, teste o GLM 4.6 hoje: a janela de 200K é o argumento mais concreto do lançamento. Se o seu gargalo é custo de saída em alto volume, o Qwen3 Next 80B e o gpt-oss-120b seguem como referência de economia. E se você precisa de capacidade bruta de raciocínio, o o3 continua sozinho no topo — até a Z.ai (ou alguém) publicar um número.

Em uma frase

Troque para o GLM 4.6 se você precisa de 200K de contexto e já está no ecossistema Z.ai; para economia pura, o Qwen3 e o gpt-oss-120b seguem mais vantajosos.

Perguntas frequentes

Quanto custa o GLM 4.6?

US$ 0,43 por milhão de tokens de entrada e US$ 1,75 por milhão de tokens de saída, com cache hit a US$ 0,08 por milhão. É mais caro que o GLM-4.5, mas ainda uma fração do preço do OpenAI o3.

Qual a janela de contexto do GLM 4.6?

200K tokens, contra 128K do GLM-4.5. Permite colar documentos longos ou repositórios inteiros num único prompt sem fragmentação.

O GLM 4.6 tem benchmark de inteligência publicado?

Não. O índice de inteligência do modelo não foi divulgado pela Z.ai nem medido por agregadores até esta data, então a comparação com o3, gpt-oss-120b e Qwen3 é só por preço.

Leia também