FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

GLM 4.7 chega a US$ 1,75 por milhão, entre o o3 e o MiMo

Novo flagship da Z.ai entra sem nota de inteligência publicada no catálogo — a decisão sobre a qualidade fica para o seu próprio teste em pipelines de agente.

Redação FalaVIP IA 3 min de leitura
US$ 1,75por milhão de tokens de saída
4,6xmais barato que o OpenAI o3 por token de saída
200 miltokens de janela de contexto

O lançamento e o que ele tem

US$ 1,75 por milhão de tokens de saída. É o preço que a Z.ai está cobrando hoje pelo GLM 4.7, novo flagship da empresa. Está mais barato que o OpenAI o3 e o Claude Haiku 4.5, mais caro que o Xiaomi MiMo-V2-Flash, e — por enquanto — sem nota de inteligência publicada no catálogo. Esse último ponto é o que torna este lançamento um caso de olho aberto e guarda no bolso.

O GLM 4.7 é um modelo texto-para-texto com janela de 200 mil tokens. O pacote completo de preços: US$ 0,40 por milhão de tokens de entrada, US$ 0,08 por milhão para leitura em cache, e os US$ 1,75 que abrem este texto. Esses três números, juntos, definem a jogada comercial.

A descrição oficial do lançamento menciona dois focos: programação e raciocínio/execução multi-etapas estáveis. A Z.ai destaca "melhorias significativas em tarefas de agente complexas". É exatamente o terreno em que a briga de API mais tem esquentado nos últimos meses, com cada fornecedor tentando virar padrão de fato para automação que escreve código, executa e itera.

Ficha técnica — GLM 4.7
CampoValor
Identificadorz-ai/glm-4.7
Criadorz-ai
Preço de entradaUS$ 0.400 / M tokens
Preço de saídaUS$ 1.75 / M tokens
Janela de contexto205k
Modalidadetext->text
Leitura de cacheUS$ 0.080 / M (80% de desconto)

A conta, em comparação

Para colocar o preço em perspectiva, vale olhar quem está na faixa acima e abaixo. O OpenAI o3, referência do mercado para raciocínio, cobra US$ 8 por milhão de tokens de saída — 4,6 vezes mais caro que o GLM 4.7. O Claude Haiku 4.5, da Anthropic, cobra US$ 5, ou 2,9 vezes o preço. São dois pesos-pesados que continuam caros.

Preço de saída (US$ por milhão de tokens)
GLM 4.71,75MiMo-V2-Flash0,3o38Claude Haiku 4.55US$/M
Fonte: OpenRouter

Abaixo, o Xiaomi MiMo-V2-Flash, que hoje lidera o índice de inteligência do catálogo, cobra US$ 0,30 por milhão de tokens de saída. Isso é 5,8 vezes mais barato que o GLM 4.7. O Mistral Devstral 2 2512, focado em desenvolvimento, cobra US$ 2 — ligeiramente acima do GLM 4.7.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
GLM 4.7 (o novo)0.41.75205k
MiMo-V2-Flash34.00.10.3262k
o331.128200k
Claude Haiku 4.529.915200k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Ou seja: o GLM 4.7 entra num ponto intermediário raro. Mais barato que os modelos de raciocínio estabelecidos, mas bem mais caro que o líder atual de IQ por token. Para fluxos que já estão consumindo o orçamento todo com o3 ou Haiku 4.5, é um alívio. Para quem está olhando custo por ponto de inteligência, o MiMo-V2-Flash segue imbatível até segunda ordem.

O elefante na sala: ainda não tem IQ

Aqui está o ponto que o release da Z.ai não resolve. O índice de inteligência do catálogo — o mesmo que põe o Xiaomi MiMo-V2-Flash lá em cima com 34 pontos — está vazio para o GLM 4.7. Sem nota, não dá para afirmar que ele é mais ou menos capaz que qualquer outro modelo da lista. Não dá nem para dizer se ele entra no top 5.

Índice de inteligência (Artificial Analysis)
MiMo-V2-Flash34o331,1Claude Haiku 4.529,9índice
Fonte: Artificial Analysis

Isso importa porque o índice virou o atalho que muita gente usa para decidir. Quem está escolhendo modelo hoje olha a barra, vê a posição relativa e cruza com o preço. Para o GLM 4.7, esse cruzamento só é possível quando a medição sair. Até lá, a decisão fica por conta da descrição do fabricante — programação e agentes — e do seu próprio teste no workload real.

Para quem vale e para quem não muda nada

Vale a pena olhar o GLM 4.7 se: você roda pipelines de agente que consomem muito o3 ou Haiku 4.5 e a conta dói; você já confia na linha GLM e quer um upgrade de mesma família; ou você está montando um stack multi-modelo e quer mais uma opção de meio-termo no menu.

Não muda nada se: você já mediu o Xiaomi MiMo-V2-Flash no seu workload e ele passou — a conta vai continuar melhor; você prefere um vendor com SLA de empresa americana; ou você só fecha contrato com base em números públicos de benchmark.

O ritmo do catálogo

Vale registrar o contexto mais amplo. O catálogo tem hoje mais de 310 modelos listados, 47 criadores diferentes, e 31 novos modelos entraram nos últimos 30 dias. É um mercado que não para de receber lançamentos. O GLM 4.7 é só o de hoje — e amanhã tem mais.

Para quem paga a conta, isso significa uma coisa prática: o catálogo não para de receber lançamentos, e a única defesa real é manter a suíte de testes rodando, não casar o produto com um só fornecedor, e olhar preço por ponto de inteligência toda vez que um lançamento novo entra. O lançamento de hoje é um ótimo motivo para você revalidar o que está rodando — não para trocar cego pelo mais novo.

Em uma frase

Rode o GLM 4.7 em paralelo com o o3 ou o Haiku 4.5 no seu workload de agente por uma a duas semanas — a economia de até 4,6x na saída só vira economia real se a qualidade da execução aguentar o tranco.

Perguntas frequentes

Quanto custa o GLM 4.7 da Z.ai?

O GLM 4.7 cobra US$ 0,40 por milhão de tokens de entrada, US$ 1,75 por milhão de tokens de saída e US$ 0,08 por milhão para leitura em cache, com janela de 200 mil tokens.

O GLM 4.7 é mais inteligente que o Claude Haiku 4.5?

Não dá para afirmar. O índice de inteligência do GLM 4.7 ainda não foi publicado no catálogo, então a comparação só é possível via teste próprio no seu workload real.

Vale trocar o o3 pelo GLM 4.7 em pipeline de agente?

Pode valer: o GLM 4.7 custa 4,6 vezes menos na saída e foi posicionado pela Z.ai para execução multi-etapas. A recomendação é rodar os dois em paralelo por uma a duas semanas antes de migrar.

Leia também