FalaVIP IA quinta-feira, 03 de setembro de 2026
Benchmarks

GLM-5.3-Flash estreia com 57,4 de IQ custando 105x menos que o topo

Seis modelos entraram no índice da Artificial Analysis hoje. O destaque é da Z.ai, que colocou um flash quase no top 5 por menos de um quarto de dólar por milhão de tokens de saída.

Redação FalaVIP IA 3 min de leitura
US$ 0,2375por milhão de tokens de saída do GLM-5.3-Flash
57.459de IQ do GLM-5.3-Flash (5,6 pontos abaixo do líder)
~105xmais barato que o Claude Opus 5 para o mesmo volume de saída

Você está olhando para o topo do índice da Artificial Analysis e vendo Claude Opus 5 a US$ 25 por milhão de tokens de saída. Agora olha para o que entrou hoje: o GLM-5.3-Flash, da Z.ai, com 57.459 de IQ, cobrando US$ 0,2375 pelo mesmo milhão. Isso é cerca de 105 vezes mais barato, e o IQ fica a menos de 5,6 pontos do líder. A conta, de repente, ficou muito diferente.

Índice de inteligência das estreias
GLM-5.3-Flash57,5Qwen3.8-Flash-Next55,8Agnes 2.5 Pro Beta49,1Granite 4.2 30B23,7Granite 4.2 8B19,6Granite 4.2 3B14,3índice

Seis modelos entraram no índice hoje (27 de agosto de 2026). Os números vêm da própria régua da Artificial Analysis, que acompanha mais de 562 modelos de 70 criadores — o número é um piso, já que o catálogo só guarda modelos ainda listados. Entre os novatos, o que mais chama atenção não é o mais inteligente — esse continua sendo o Claude Opus 5, com 63.053. É o que chega mais perto do topo custando quase nada.

O flash da Z.ai no detalhe

O GLM-5.3-Flash fechou o dia com 57.459 de IQ. Acima dele, no recorte geral, só aparecem Claude Opus 5, Claude Fable 5, GPT-5.6 Sol e Grok 4.6 — todos pagando mais de US$ 6 por milhão de tokens de saída. A US$ 0,2375, o flash chinês entra na prateleira de "barato acima de IQ 45" ao lado do DeepSeek V4 Flash 0731, que cobra US$ 0,18 e marca 51.767. A diferença entre os dois é de quase 5,7 pontos de IQ a favor do GLM, por cerca de cinco centavos a mais por milhão.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Opus 563.125
Claude Fable 562.150
GPT-5.6 Sol60.910
Grok 4.660.96
Kimi K359.715
Entre os 562 modelos disponíveis no catálogo nesta data.

Para quem paga a API, a pergunta prática é direta: vale trocar Opus 5 por GLM-5.3-Flash em uma fila de tarefas longas? Em volume, 100 milhões de tokens de saída no Opus 5 custam US$ 2.500. No GLM-5.3-Flash, US$ 23,75. Você perde 5,6 pontos de IQ. Em classificação, extração, resumo e código de baixa complexidade, a conta quase sempre fecha a favor do mais barato.

O caso estranho: Qwen3.8-Flash-Next sem preço

A Alibaba também estreou modelo hoje: o Qwen3.8-Flash-Next, com 55.814 de IQ, sentado entre o GLM-5.3-Flash e o DeepSeek V4 Flash. Só tem um porém — o catálogo da Artificial Analysis não publicou preço para esse modelo. Sem número, não dá para colocar na régua custo/benefício. Vale ficar de olho: a família Qwen costuma ser agressiva em preço, e o sufixo "Flash-Next" sugere mais um corte fino na família.

Agnes 2.5 Pro Beta e o nicho abaixo de US$ 0,20

O Agnes 2.5 Pro Beta entrou com IQ 49.095 e US$ 0,15 por milhão de tokens de saída. É mais barato que o DeepSeek V4 Flash 0731 (US$ 0,18) e mais barato que o GLM-5.3-Flash (US$ 0,2375). O custo por ponto de IQ aqui é o melhor do índice acima da linha de IQ 45. Se você tem uma tarefa em que 49 de IQ resolve e o preço importa mais que a régua, Agnes é a escolha de hoje.

Modelos que estrearam no índice
ModeloÍndice de inteligênciaPreço combinado US$/M
GLM-5.3-Flash57.50.24
Qwen3.8-Flash-Next55.8
Agnes 2.5 Pro Beta49.10.15
Granite 4.2 30B23.70.28
Granite 4.2 8B19.60.11
Granite 4.2 3B14.30.05

Granite 4.2: a IBM jogando outro jogo

Os outros três estreantes são da IBM: Granite 4.2 em versões 30B, 8B e 3B. Os IQs são 23.739, 19.612 e 14.276 — muito abaixo do resto do índice. Isso não é acidente nem falha: são modelos pequenos, pensados para rodar localmente, em laptop ou servidor próprio, não para você pagar por inferência na nuvem. O preço de tabela publicado pela Artificial Analysis (US$ 0,2825, US$ 0,1075 e US$ 0,0525 por milhão de tokens de saída) é o que a IBM divulga, mas o uso típico é outro — baixar o peso e rodar on-prem, onde a régua de preço por token não se aplica.

Comparar Granite 4.2 3B com Claude Opus 5 é comparar patins com carro de Fórmula 1. São produtos para problemas diferentes.

O que muda na sua fila de tarefas

Se você roda tarefas em escala, o GLM-5.3-Flash de hoje é o novo padrão de "bom o suficiente, barato sempre". Para filas que já aceitam IQ 55–58, a migração de Opus 5 para o flash da Z.ai corta cerca de 99% do custo sem mexer na qualidade percebida. Para tarefas onde 49 de IQ resolve, Agnes 2.5 Pro Beta vira a referência abaixo de US$ 0,20. Qwen3.8-Flash-Next fica em compasso de espera até a Artificial Analysis publicar o preço. E Granite 4.2 não entra nessa conta — é outro produto, para outro cenário.

Em uma frase

Se a sua fila aceita IQ em torno de 57, troque Opus 5 por GLM-5.3-Flash hoje e corte ~99% do custo de saída; para tarefas que aceitam IQ 49, Agnes 2.5 Pro Beta a US$ 0,15/M é a nova referência barata.

Perguntas frequentes

Quanto custa o GLM-5.3-Flash por milhão de tokens?

A Artificial Analysis publicou US$ 0,2375 por milhão de tokens de saída. É cerca de 105 vezes mais barato que o Claude Opus 5, com IQ 57,459 contra 63,053 do líder.

O GLM-5.3-Flash substitui o Claude Opus 5?

Depende da tarefa. Para classificação, extração, resumo e código de baixa complexidade, a diferença de 5,6 pontos de IQ raramente compensa pagar US$ 25 em vez de US$ 0,2375 por milhão. Para raciocínio pesado, geração longa ou tarefas que exigem o topo da régua, Opus 5 segue sendo a referência.

Por que o Qwen3.8-Flash-Next não tem preço no índice?

Porque a própria Artificial Analysis não publicou valor de tabela para esse modelo no momento da estreia. Sem preço, ele não entra na régua custo/benefício até que o catálogo seja atualizado.

Leia também