GLM 4.7 chega a US$ 1,75 por milhão, entre o o3 e o MiMo
Novo flagship da Z.ai entra sem nota de inteligência publicada no catálogo — a decisão sobre a qualidade fica para o seu próprio teste em pipelines de agente.
O lançamento e o que ele tem
US$ 1,75 por milhão de tokens de saída. É o preço que a Z.ai está cobrando hoje pelo GLM 4.7, novo flagship da empresa. Está mais barato que o OpenAI o3 e o Claude Haiku 4.5, mais caro que o Xiaomi MiMo-V2-Flash, e — por enquanto — sem nota de inteligência publicada no catálogo. Esse último ponto é o que torna este lançamento um caso de olho aberto e guarda no bolso.
O GLM 4.7 é um modelo texto-para-texto com janela de 200 mil tokens. O pacote completo de preços: US$ 0,40 por milhão de tokens de entrada, US$ 0,08 por milhão para leitura em cache, e os US$ 1,75 que abrem este texto. Esses três números, juntos, definem a jogada comercial.
A descrição oficial do lançamento menciona dois focos: programação e raciocínio/execução multi-etapas estáveis. A Z.ai destaca "melhorias significativas em tarefas de agente complexas". É exatamente o terreno em que a briga de API mais tem esquentado nos últimos meses, com cada fornecedor tentando virar padrão de fato para automação que escreve código, executa e itera.
| Campo | Valor |
|---|---|
| Identificador | z-ai/glm-4.7 |
| Criador | z-ai |
| Preço de entrada | US$ 0.400 / M tokens |
| Preço de saída | US$ 1.75 / M tokens |
| Janela de contexto | 205k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.080 / M (80% de desconto) |
A conta, em comparação
Para colocar o preço em perspectiva, vale olhar quem está na faixa acima e abaixo. O OpenAI o3, referência do mercado para raciocínio, cobra US$ 8 por milhão de tokens de saída — 4,6 vezes mais caro que o GLM 4.7. O Claude Haiku 4.5, da Anthropic, cobra US$ 5, ou 2,9 vezes o preço. São dois pesos-pesados que continuam caros.
Abaixo, o Xiaomi MiMo-V2-Flash, que hoje lidera o índice de inteligência do catálogo, cobra US$ 0,30 por milhão de tokens de saída. Isso é 5,8 vezes mais barato que o GLM 4.7. O Mistral Devstral 2 2512, focado em desenvolvimento, cobra US$ 2 — ligeiramente acima do GLM 4.7.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| GLM 4.7 (o novo) | — | 0.4 | 1.75 | 205k |
| MiMo-V2-Flash | 34.0 | 0.1 | 0.3 | 262k |
| o3 | 31.1 | 2 | 8 | 200k |
| Claude Haiku 4.5 | 29.9 | 1 | 5 | 200k |
Ou seja: o GLM 4.7 entra num ponto intermediário raro. Mais barato que os modelos de raciocínio estabelecidos, mas bem mais caro que o líder atual de IQ por token. Para fluxos que já estão consumindo o orçamento todo com o3 ou Haiku 4.5, é um alívio. Para quem está olhando custo por ponto de inteligência, o MiMo-V2-Flash segue imbatível até segunda ordem.
O elefante na sala: ainda não tem IQ
Aqui está o ponto que o release da Z.ai não resolve. O índice de inteligência do catálogo — o mesmo que põe o Xiaomi MiMo-V2-Flash lá em cima com 34 pontos — está vazio para o GLM 4.7. Sem nota, não dá para afirmar que ele é mais ou menos capaz que qualquer outro modelo da lista. Não dá nem para dizer se ele entra no top 5.
Isso importa porque o índice virou o atalho que muita gente usa para decidir. Quem está escolhendo modelo hoje olha a barra, vê a posição relativa e cruza com o preço. Para o GLM 4.7, esse cruzamento só é possível quando a medição sair. Até lá, a decisão fica por conta da descrição do fabricante — programação e agentes — e do seu próprio teste no workload real.
Para quem vale e para quem não muda nada
Vale a pena olhar o GLM 4.7 se: você roda pipelines de agente que consomem muito o3 ou Haiku 4.5 e a conta dói; você já confia na linha GLM e quer um upgrade de mesma família; ou você está montando um stack multi-modelo e quer mais uma opção de meio-termo no menu.
Não muda nada se: você já mediu o Xiaomi MiMo-V2-Flash no seu workload e ele passou — a conta vai continuar melhor; você prefere um vendor com SLA de empresa americana; ou você só fecha contrato com base em números públicos de benchmark.
O ritmo do catálogo
Vale registrar o contexto mais amplo. O catálogo tem hoje mais de 310 modelos listados, 47 criadores diferentes, e 31 novos modelos entraram nos últimos 30 dias. É um mercado que não para de receber lançamentos. O GLM 4.7 é só o de hoje — e amanhã tem mais.
Para quem paga a conta, isso significa uma coisa prática: o catálogo não para de receber lançamentos, e a única defesa real é manter a suíte de testes rodando, não casar o produto com um só fornecedor, e olhar preço por ponto de inteligência toda vez que um lançamento novo entra. O lançamento de hoje é um ótimo motivo para você revalidar o que está rodando — não para trocar cego pelo mais novo.
Rode o GLM 4.7 em paralelo com o o3 ou o Haiku 4.5 no seu workload de agente por uma a duas semanas — a economia de até 4,6x na saída só vira economia real se a qualidade da execução aguentar o tranco.
Perguntas frequentes
Quanto custa o GLM 4.7 da Z.ai?
O GLM 4.7 cobra US$ 0,40 por milhão de tokens de entrada, US$ 1,75 por milhão de tokens de saída e US$ 0,08 por milhão para leitura em cache, com janela de 200 mil tokens.
O GLM 4.7 é mais inteligente que o Claude Haiku 4.5?
Não dá para afirmar. O índice de inteligência do GLM 4.7 ainda não foi publicado no catálogo, então a comparação só é possível via teste próprio no seu workload real.
Vale trocar o o3 pelo GLM 4.7 em pipeline de agente?
Pode valer: o GLM 4.7 custa 4,6 vezes menos na saída e foi posicionado pela Z.ai para execução multi-etapas. A recomendação é rodar os dois em paralelo por uma a duas semanas antes de migrar.