GLM 4.6 entra no catálogo a US$ 1,75 por milhão de saída — e muda o cálculo da Z.ai
Janela de contexto salta de 128K para 200K tokens, mas preço de entrada subiu e o índice de inteligência continua sem medição pública.
O que muda (e o que não muda) na conta
A Z.ai publicou hoje o GLM 4.6, sucessor do GLM-4.5, e o detalhe que vai aparecer primeiro na sua planilha é o preço de saída: US$ 1,75 por milhão de tokens. Em relação ao modelo anterior da casa, é um salto — o GLM-4.5 cobrava US$ 1,10 pelo mesmo item. Em relação ao topo do catálogo, continua barato: o OpenAI o3, que lidera o índice de inteligência hoje, cobra US$ 8,00 pelo milhão de saída, ou seja, 4,6 vezes mais.
A entrada também subiu, de US$ 0,30 para US$ 0,43 por milhão de tokens. Para workloads com muito prompt e pouca resposta — RAG massivo, sumarização de documentos — esse reajuste pesa mais do que a saída. Já quem usa o modelo para gerar código ou texto longo sente o impacto no output.
A janela de 200K é o chamariz real
O release da Z.ai destaca a expansão da janela de contexto de 128K para 200K tokens como a melhoria mais visível. Em termos práticos, é a diferença entre colar um repositório médio inteiro num único prompt e ter que fragmentar em vários. Para quem faz análise de código ou revisão de contratos longos, isso muda o fluxo de trabalho.
| Campo | Valor |
|---|---|
| Identificador | z-ai/glm-4.6 |
| Criador | z-ai |
| Preço de entrada | US$ 0.550 / M tokens |
| Preço de saída | US$ 2.20 / M tokens |
| Janela de contexto | 205k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.110 / M (80% de desconto) |
O corte de conhecimento está em março de 2025, o que coloca o GLM 4.6 seis meses atrás do calendário — relevante se você precisa de eventos recentes sem RAG por cima.
Onde ele se encaixa no tabuleiro
O catálogo tem hoje 244 modelos listados, vindos de 40 criadores, e 25 deles foram lançados nos últimos 30 dias. Mesmo sem o índice de inteligência do GLM 4.6 publicado, dá para posicionar pelo preço.
Olhando os rivais diretos da Z.ai em faixa de preço parecido:
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| GLM 4.6 (o novo) | — | 0.55 | 2.2 | 205k |
| o3 | 31.1 | 2 | 8 | 200k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
| Qwen3 Next 80B A3B Thinking | 16.9 | 0.15 | 1.2 | 262k |
- OpenAI o3: US$ 8,00 de saída, índice de inteligência 31,1. É a referência de capacidade, não de economia.
- OpenAI gpt-oss-120b: US$ 0,17 de saída, índice 24,1. Custa uma fração, mas é um modelo aberto com perfil diferente.
- Qwen3 Next 80B A3B Thinking: US$ 1,20 de saída, índice 16,9. Concorrente chinês direto, mais barato e com benchmark medido.
O GLM 4.6 entra entre o Qwen3 e o o3 em preço, mas sem nota pública de inteligência — o que significa que, por enquanto, a comparação é só de cotação.
Para quem vale — e para quem não muda nada
Vale para quem já usa GLM-4.5 em produção e quer dobrar a janela de contexto sem trocar de fornecedor. Vale também para times que precisam de contexto longo e estão dispostos a pagar um pouco mais pela flexibilidade — o cache hit a US$ 0,08 por milhão continua entre os mais baratos do catálogo, então prompts repetidos continuam baratos.
Não muda nada para quem roda o o3 da OpenAI por causa de raciocínio pesado e mede resultado por benchmark — o GLM 4.6 não traz número de inteligência publicado, e o o3 lidera o índice com folga. Também não muda para quem já encontrou no gpt-oss-120b um modelo aberto suficiente por uma fração do preço.
O que fazer agora
Se você tem uma fila de jobs esperando por contexto maior, teste o GLM 4.6 hoje: a janela de 200K é o argumento mais concreto do lançamento. Se o seu gargalo é custo de saída em alto volume, o Qwen3 Next 80B e o gpt-oss-120b seguem como referência de economia. E se você precisa de capacidade bruta de raciocínio, o o3 continua sozinho no topo — até a Z.ai (ou alguém) publicar um número.
Troque para o GLM 4.6 se você precisa de 200K de contexto e já está no ecossistema Z.ai; para economia pura, o Qwen3 e o gpt-oss-120b seguem mais vantajosos.
Perguntas frequentes
Quanto custa o GLM 4.6?
US$ 0,43 por milhão de tokens de entrada e US$ 1,75 por milhão de tokens de saída, com cache hit a US$ 0,08 por milhão. É mais caro que o GLM-4.5, mas ainda uma fração do preço do OpenAI o3.
Qual a janela de contexto do GLM 4.6?
200K tokens, contra 128K do GLM-4.5. Permite colar documentos longos ou repositórios inteiros num único prompt sem fragmentação.
O GLM 4.6 tem benchmark de inteligência publicado?
Não. O índice de inteligência do modelo não foi divulgado pela Z.ai nem medido por agregadores até esta data, então a comparação com o3, gpt-oss-120b e Qwen3 é só por preço.