FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

GLM 4.7 Flash custa US$ 0,40/M de saída sem nota de QI

Modelo de 30B da Z.ai aposta em coding agentic com cache de US$ 0,01, mas o catálogo ainda não publicou benchmark de inteligência nem de código.

Redação FalaVIP IA 3 min de leitura
US$ 0,40por milhão de tokens de saída
US$ 0,06por milhão de tokens de entrada
US$ 0,01cache por milhão de tokens

A Z.ai colocou no ar o GLM 4.7 Flash no domingo passado — três dias atrás. O preço de entrada é agressivo: US$ 0,06 por milhão de tokens. O de saída, US$ 0,40. O de cache, US$ 0,01. Se você roda pipeline de coding agentic com system prompt repetido, esse último número é o que vai chamar sua atenção. Um centavo por milhão de tokens em cache é o tipo de preço que muda a conta de quem faz milhares de chamadas por dia.

Ficha técnica — GLM 4.7 Flash
CampoValor
Identificadorz-ai/glm-4.7-flash
Criadorz-ai
Preço de entradaUS$ 0.060 / M tokens
Preço de saídaUS$ 0.400 / M tokens
Janela de contexto203k
Modalidadetext->text
Leitura de cacheUS$ 0.010 / M (83% de desconto)

O que a Z.ai está vendendo

O release descreve o GLM 4.7 Flash como um "modelo 30B-class SOTA" que equilibra performance e eficiência. A otimização declarada é para coding agentic: capacidades de código reforçadas, planejamento de tarefas de longo horizonte. O contexto é de 202.752 tokens — sólido para workflows que precisam carregar repositórios ou históricos longos sem truncar.

A questão é: "30B-class" é a classificação da própria Z.ai. É o fabricante dizendo que o modelo compete nessa faixa. Não temos como verificar se entrega o que promete porque o catálogo não publicou benchmark nenhum. Nem IQ, nem coding, nem agentic. Tudo null.

O vazio de dados que importa

Você está comprando um modelo sem saber onde ele se encaixa no ranking de inteligência. Em um catálogo com mais de 320 modelos e 50 criadores, isso é um problema real. O mercado lançou 8 modelos nos últimos 30 dias — a diferenciação está ficando mais difícil, e benchmark é o atalho que todo mundo usa para decidir rápido.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 321 modelos disponíveis no catálogo nesta data.

Compare com o topo do catálogo hoje. O Xiaomi MiMo-V2-Flash lidera com IQ 34 a US$ 0,30 por milhão de saída. O gpt-oss-120b da OpenAI marca 24 de IQ a US$ 0,17. O GLM 4.7 Flash, a US$ 0,40 de saída, é mais caro que os dois no output. Se for menos capaz que o gpt-oss-120b — um modelo de 120B de parâmetros — a conta não fecha. Se for mais capaz, é uma pechincha. Não dá para saber.

O Claude Haiku 4.5, a US$ 5/M de saída, tem IQ 29. É 12 vezes mais caro que o GLM 4.7 Flash no output. Se o modelo da Z.ai entregar metade da capacidade do Haiku nesse preço, já vale o teste. Mas é um "se" grande, e por enquanto não tem número que sustente.

Para quem vale a pena

O caso de uso claro é volume alto com contexto longo. Se você tem um agente que faz muitas chamadas com o mesmo system prompt, o cache a US$ 0,01/M transforma o custo fixo em quase zero. Combinado com os 200K de contexto, dá para montar pipelines de coding agentic que carregam documentação inteira, histórico de conversas e instruções de tool use sem estourar o orçamento.

Outro caso: prototipagem rápida. Se você está testando uma ideia de agente e não quer queimar caixa com o3 a US$ 8/M de saída, o GLM 4.7 Flash dá para rodar milhares de chamadas e ver se a arquitetura funciona antes de comprometer budget. O pior que acontece é você gastar alguns dólares para descobrir que não serve — e aí migra para o gpt-oss-120b ou para o Haiku.

Para quem não muda nada

Se você precisa de raciocínio de ponta — análise jurídica, revisão de código complexa, planejamento multi-etapa com validação — um modelo sem benchmark publicado não é a escolha certa. Você não sabe o que está comprando. O catálogo tem opções com IQ medido e preço parecido, como o gpt-oss-120b, que pelo menos tem nota 24 para você comparar.

Se qualidade de saída é o que importa e volume é baixo, a economia de US$ 0,30 por milhão some no ruído. Pega o Claude Haiku 4.5 a US$ 5/M e dorme tranquilo. A diferença de custo é irrelevante quando você faz cem chamadas por dia.

O que fazer agora

Espere. Três dias é pouco tempo para um modelo novo, mas o silêncio de benchmarks é um sinal. Se a Z.ai publicar números de coding e agentic nas próximas semanas, o GLM 4.7 Flash pode virar uma opção séria na faixa dos US$ 0,40/M de saída. Até lá, trate como experimento de baixo risco — não como substituição do que já está funcionando no seu stack. O cache a um centavo é tentador, mas não justifica trocar um modelo com benchmark conhecido por um que ainda não mostrou as notas.

Em uma frase

Trate o GLM 4.7 Flash como experimento de baixo risco até a Z.ai publicar benchmarks — o preço do cache é o argumento mais forte, mas sem nota de IQ você não sabe onde ele se encaixa.

Perguntas frequentes

GLM 4.7 Flash tem benchmark de inteligência?

Não. O catálogo lista IQ, coding e agentic como null — nenhum benchmark foi publicado até agora para esse modelo.

Quanto custa o GLM 4.7 Flash na API?

US$ 0,06 por milhão de tokens de entrada, US$ 0,40 por milhão de saída e US$ 0,01 por milhão em cache. O cache é o preço mais agressivo do catálogo.

Para que tipo de tarefa o GLM 4.7 Flash é indicado?

A Z.ai posiciona o modelo como otimizado para coding agentic e planejamento de tarefas de longo horizonte, com 200K de contexto. O caso de uso ideal é volume alto com system prompt repetido.

Leia também