GLM 4.7 Flash custa US$ 0,40/M de saída sem nota de QI
Modelo de 30B da Z.ai aposta em coding agentic com cache de US$ 0,01, mas o catálogo ainda não publicou benchmark de inteligência nem de código.
A Z.ai colocou no ar o GLM 4.7 Flash no domingo passado — três dias atrás. O preço de entrada é agressivo: US$ 0,06 por milhão de tokens. O de saída, US$ 0,40. O de cache, US$ 0,01. Se você roda pipeline de coding agentic com system prompt repetido, esse último número é o que vai chamar sua atenção. Um centavo por milhão de tokens em cache é o tipo de preço que muda a conta de quem faz milhares de chamadas por dia.
| Campo | Valor |
|---|---|
| Identificador | z-ai/glm-4.7-flash |
| Criador | z-ai |
| Preço de entrada | US$ 0.060 / M tokens |
| Preço de saída | US$ 0.400 / M tokens |
| Janela de contexto | 203k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.010 / M (83% de desconto) |
O que a Z.ai está vendendo
O release descreve o GLM 4.7 Flash como um "modelo 30B-class SOTA" que equilibra performance e eficiência. A otimização declarada é para coding agentic: capacidades de código reforçadas, planejamento de tarefas de longo horizonte. O contexto é de 202.752 tokens — sólido para workflows que precisam carregar repositórios ou históricos longos sem truncar.
A questão é: "30B-class" é a classificação da própria Z.ai. É o fabricante dizendo que o modelo compete nessa faixa. Não temos como verificar se entrega o que promete porque o catálogo não publicou benchmark nenhum. Nem IQ, nem coding, nem agentic. Tudo null.
O vazio de dados que importa
Você está comprando um modelo sem saber onde ele se encaixa no ranking de inteligência. Em um catálogo com mais de 320 modelos e 50 criadores, isso é um problema real. O mercado lançou 8 modelos nos últimos 30 dias — a diferenciação está ficando mais difícil, e benchmark é o atalho que todo mundo usa para decidir rápido.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Compare com o topo do catálogo hoje. O Xiaomi MiMo-V2-Flash lidera com IQ 34 a US$ 0,30 por milhão de saída. O gpt-oss-120b da OpenAI marca 24 de IQ a US$ 0,17. O GLM 4.7 Flash, a US$ 0,40 de saída, é mais caro que os dois no output. Se for menos capaz que o gpt-oss-120b — um modelo de 120B de parâmetros — a conta não fecha. Se for mais capaz, é uma pechincha. Não dá para saber.
O Claude Haiku 4.5, a US$ 5/M de saída, tem IQ 29. É 12 vezes mais caro que o GLM 4.7 Flash no output. Se o modelo da Z.ai entregar metade da capacidade do Haiku nesse preço, já vale o teste. Mas é um "se" grande, e por enquanto não tem número que sustente.
Para quem vale a pena
O caso de uso claro é volume alto com contexto longo. Se você tem um agente que faz muitas chamadas com o mesmo system prompt, o cache a US$ 0,01/M transforma o custo fixo em quase zero. Combinado com os 200K de contexto, dá para montar pipelines de coding agentic que carregam documentação inteira, histórico de conversas e instruções de tool use sem estourar o orçamento.
Outro caso: prototipagem rápida. Se você está testando uma ideia de agente e não quer queimar caixa com o3 a US$ 8/M de saída, o GLM 4.7 Flash dá para rodar milhares de chamadas e ver se a arquitetura funciona antes de comprometer budget. O pior que acontece é você gastar alguns dólares para descobrir que não serve — e aí migra para o gpt-oss-120b ou para o Haiku.
Para quem não muda nada
Se você precisa de raciocínio de ponta — análise jurídica, revisão de código complexa, planejamento multi-etapa com validação — um modelo sem benchmark publicado não é a escolha certa. Você não sabe o que está comprando. O catálogo tem opções com IQ medido e preço parecido, como o gpt-oss-120b, que pelo menos tem nota 24 para você comparar.
Se qualidade de saída é o que importa e volume é baixo, a economia de US$ 0,30 por milhão some no ruído. Pega o Claude Haiku 4.5 a US$ 5/M e dorme tranquilo. A diferença de custo é irrelevante quando você faz cem chamadas por dia.
O que fazer agora
Espere. Três dias é pouco tempo para um modelo novo, mas o silêncio de benchmarks é um sinal. Se a Z.ai publicar números de coding e agentic nas próximas semanas, o GLM 4.7 Flash pode virar uma opção séria na faixa dos US$ 0,40/M de saída. Até lá, trate como experimento de baixo risco — não como substituição do que já está funcionando no seu stack. O cache a um centavo é tentador, mas não justifica trocar um modelo com benchmark conhecido por um que ainda não mostrou as notas.
Trate o GLM 4.7 Flash como experimento de baixo risco até a Z.ai publicar benchmarks — o preço do cache é o argumento mais forte, mas sem nota de IQ você não sabe onde ele se encaixa.
Perguntas frequentes
GLM 4.7 Flash tem benchmark de inteligência?
Não. O catálogo lista IQ, coding e agentic como null — nenhum benchmark foi publicado até agora para esse modelo.
Quanto custa o GLM 4.7 Flash na API?
US$ 0,06 por milhão de tokens de entrada, US$ 0,40 por milhão de saída e US$ 0,01 por milhão em cache. O cache é o preço mais agressivo do catálogo.
Para que tipo de tarefa o GLM 4.7 Flash é indicado?
A Z.ai posiciona o modelo como otimizado para coding agentic e planejamento de tarefas de longo horizonte, com 200K de contexto. O caso de uso ideal é volume alto com system prompt repetido.