FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

GLM 4.7 Flash da Z.ai entra a US$ 0,40 por milhão de tokens de saída

Modelo de 30B parâmetros chega ao catálogo hoje mirando uso em agentes de código; preço de saída é o mais barato entre os rivais diretos, mas o índice de inteligência ainda não foi medido.

Redação FalaVIP IA 3 min de leitura
US$ 0,40por milhão de tokens de saída
US$ 0,06por milhão de tokens de entrada
US$ 0,01por milhão de tokens em cache

O que a Z.ai colocou na mesa hoje

Você paga a conta da API e está acostumado a ver a fatura explodir no fim do mês quando o agente entra em loop. Pois a Z.ai, criadora chinesa que você talvez ainda não tenha no radar, acabou de listar o GLM 4.7 Flash no catálogo com uma proposta que mira exatamente esse problema: 30 bilhões de parâmetros, otimização declarada para coding agêntico e, principalmente, um preço de saída de US$ 0,40 por milhão de tokens. É o modelo novo mais barato entre os concorrentes diretos que aparecem no topo do índice de inteligência hoje.

Ficha técnica — GLM 4.7 Flash
CampoValor
Identificadorz-ai/glm-4.7-flash
Criadorz-ai
Preço de entradaUS$ 0.060 / M tokens
Preço de saídaUS$ 0.400 / M tokens
Janela de contexto203k
Modalidadetext->text
Leitura de cacheUS$ 0.010 / M (83% de desconto)

O que o release diz vs. o que a fatura mostra

O comunicado da Z.ai repete a fórmula conhecida: "equilíbrio entre performance e eficiência". Traduzindo para quem olha planilha: o GLM 4.7 Flash custa US$ 0,06 para entrar (input) e US$ 0,40 para sair (output), com cache a US$ 0,01. A diferença entre o que entra e o que sai é de quase 7x — padrão de mercado, mas vale lembrar porque é a saída que come a fatura em fluxos agentic, onde o modelo devolve blocos enormes de código, logs e tool calls.

Para colocar em perspectiva, o catálogo tem hoje mais de 318 modelos distribuídos por 48 criadores, e nove deles foram lançados nos últimos 30 dias. O GLM 4.7 Flash entra nesse bolo com a janela de contexto de 202.752 tokens — uma das maiores disponíveis para a faixa de preço.

Quem ele tenta destronar

O rival natural é o Xiaomi MiMo-V2-Flash, que lidera o índice de inteligência entre os modelos "flash" com IQ 34,024 e cobra US$ 0,30 por milhão de tokens de saída. O GLM 4.7 Flash chega mais caro na saída (US$ 0,40), mas com a vantagem de uma janela de contexto quase 4x maior.

Preço de saída (US$ por milhão de tokens)
GLM 4.7 Flash0,4MiMo-V2-Flash0,3o38Claude Haiku 4.55US$/M
Fonte: OpenRouter

Olhando para cima da régua, o Claude Haiku 4.5 da Anthropic cobra US$ 5,00 por milhão de tokens de saída — 12,5 vezes mais caro que o GLM 4.7 Flash. O OpenAI o3, voltado a raciocínio, sai a US$ 8,00. São modelos de outra categoria de preço, mas é a referência que aparece quando o cliente pergunta "por que não uso o Haiku?".

Índice de inteligência (Artificial Analysis)
MiMo-V2-Flash34o331,1Claude Haiku 4.529,9índice
Fonte: Artificial Analysis

O ponto cego: inteligência ainda não medida

Aqui está o porém que ninguém no release vai te contar: o índice de inteligência do GLM 4.7 Flash ainda não foi publicado no catálogo. Os campos de coding, agentic e raciocínio também estão vazios. Você está comprando um modelo cujo desempenho em benchmarks públicos ainda não foi auditado de forma independente pela Artificial Analysis.

Inteligência × preço de saída
MiMo-V2-Flasho3Claude Haiku 4.5US$ por milhão (saída, escala log)índice de inteligência

Isso não significa que o modelo é ruim — significa que, até saírem os números, o cálculo de "inteligência por dólar" não fecha. O MiMo-V2-Flash tem IQ 34,024 medido; o Haiku 4.5 tem 29,892; o o3 tem 31,096. Qualquer um desses três dá uma referência verificável antes de você colocar em produção.

Para quem vale e para quem não muda nada

Vale para você se: roda agentes de código que devolve muito token de saída por chamada, precisa de janela de contexto grande (acima de 100k) e está disposto a testar um modelo chinês sem benchmark externo publicado — a Z.ai não declarou open weights nem país de origem no cadastro.

Não muda nada se: você já tem o MiMo-V2-Flash no pipeline e mediu IQ real, ou se o seu fluxo depende de latência determinística em região específica (o GLM 4.7 Flash não traz dado de velocidade no catálogo).

O que fazer agora

A implicação prática é direta: adicione o GLM 4.7 Flash como candidato em testes A/B ao lado do MiMo-V2-Flash e do Haiku 4.5, meça custo por tarefa concluída (não por token), e espere a publicação do IQ antes de migrar cargas críticas. Em agentic coding, a diferença entre US$ 0,30 e US$ 0,40 por milhão de saída parece pequena — multiplicada por 100 milhões de tokens no mês, são US$ 10 a mais. Mas se a taxa de tarefas completas for pior, esse "barato" sai caro.

Em uma frase

Teste o GLM 4.7 Flash em agentic coding como alternativa barata ao Haiku 4.5, mas espere o índice de inteligência sair antes de mover produção crítica.

Perguntas frequentes

Quanto custa o GLM 4.7 Flash da Z.ai?

US$ 0,06 por milhão de tokens de entrada, US$ 0,40 por milhão de tokens de saída e US$ 0,01 por milhão de tokens em cache. É mais barato na saída que o Claude Haiku 4.5 (US$ 5,00) e o OpenAI o3 (US$ 8,00), mas mais caro que o Xiaomi MiMo-V2-Flash (US$ 0,30).

O GLM 4.7 Flash tem pesos abertos?

O catálogo não informa. A Z.ai não declarou open_weights, nem país de origem, nem data de corte de conhecimento no cadastro do modelo.

GLM 4.7 Flash serve para agentes de código?

É o caso de uso declarado pela Z.ai no release, com janela de contexto de 202.752 tokens. Mas os benchmarks de agentic e coding ainda não foram publicados, então o teste empírico no seu próprio pipeline é obrigatório antes de adotar.

Leia também