FalaVIP IA o que os modelos custam,
medido todo dia
Benchmarks

Agnes 3.0 Flash estreia com IQ 35,5 e custa US$ 0,075

O modelo aparece no Artificial Analysis com desempenho inferior ao DeepSeek V4.1 Flash, mas por uma fração do preço. Para quem paga por volume, a diferença pode importar mais que a liderança no benchmark.

Redação FalaVIP IA 3 min de leitura
35,5IQ do Agnes 3.0 Flash no Artificial Analysis
US$ 0,075preço por milhão de tokens no índice
US$ 0,525preço por milhão de tokens do DeepSeek V4.1 Flash (max)

O Agnes 3.0 Flash estreou no Artificial Analysis com IQ de 35,5 e preço de US$ 0,075 por milhão de tokens. A combinação coloca o modelo como uma alternativa barata para aplicações que precisam de mais capacidade que modelos básicos, mas não podem absorver o custo dos líderes de desempenho.

A ressalva é importante: o Agnes não liderou as estreias do dia. O DeepSeek V4.1 Flash (max) marcou IQ de 39,5 e apareceu com preço de US$ 0,525 por milhão de tokens. O Agnes custa uma fração desse valor, mas também entrega uma pontuação inferior no índice.

O que mudou para quem escolhe modelo

A novidade não é uma liderança absoluta em inteligência. É a entrada de uma opção intermediária com preço baixo e uma pontuação que supera outras estreias recentes no mesmo recorte.

O Ling-3.0-flash-VL estreou com IQ de 24,8 e preço de US$ 0 por milhão de tokens. O DeepSeek V4 Flash (Non-reasoning), que entrou no índice em 2026-09-10, marcou 18,9 e custou US$ 0,119 por milhão de tokens. Nesse grupo, o Agnes combina a maior pontuação depois do DeepSeek V4.1 Flash com preço inferior ao do DeepSeek não orientado a raciocínio.

Os números de preço são os praticados no OpenRouter, enquanto as notas de inteligência vêm do Artificial Analysis. Essa distinção importa porque o valor de uma API não pode ser lido apenas como uma classificação de benchmark: o custo efetivo depende de quanto a aplicação envia e recebe, além do comportamento do modelo em produção.

A conta favorece o Agnes em alto volume

Se você usa o modelo em tarefas repetitivas, como classificação, extração de dados, roteamento de solicitações ou respostas curtas, US$ 0,075 por milhão de tokens muda a equação. Uma pontuação de IQ de 35,5 pode ser suficiente para reduzir a necessidade de revisão humana em fluxos que antes exigiam um modelo mais caro.

O DeepSeek V4.1 Flash (max) continua sendo a opção mais forte entre as estreias do dia pelo critério do Artificial Analysis. A diferença de preço, porém, é grande: US$ 0,525 contra US$ 0,075 por milhão de tokens. Para uma operação que prioriza qualidade máxima em cada resposta, o DeepSeek tem vantagem no benchmark. Para quem multiplica o volume por milhões de tokens, o Agnes merece teste antes de uma decisão baseada apenas na nota.

Essa comparação não prova que o Agnes será melhor em código, uso de ferramentas ou tarefas agênticas. O recorte disponível informa a nota de inteligência e o preço, mas não apresenta notas de código, desempenho agêntico ou janela de contexto para o modelo. Portanto, não há base para prometer desempenho equivalente em fluxos complexos.

Para quem vale — e para quem não muda nada

O Agnes 3.0 Flash vale para equipes que precisam controlar a fatura, aceitam validar qualidade com seus próprios prompts e trabalham com tarefas de volume. Também pode fazer sentido como modelo padrão, deixando opções mais caras para casos que falharem na primeira tentativa.

Para quem precisa do melhor resultado possível em raciocínio ou usa agentes com ferramentas, a estreia não muda a escolha por si só. O topo de inteligência listado pelo Artificial Analysis chega a IQ de 53,4 e preço de US$ 20 por milhão de tokens. A distância mostra que o Agnes está em outra faixa de custo e capacidade.

O modelo também não deve ser tratado como substituto automático de qualquer modelo caro. A nota de benchmark serve como sinal inicial, não como garantia de precisão, latência ou estabilidade na sua aplicação. Antes de migrar, compare respostas reais, taxa de falha e custo total por tarefa.

O teste que decide a migração

A decisão prática é colocar o Agnes em uma rota controlada da produção. Separe solicitações de baixo risco, meça quantas respostas exigem nova tentativa e compare o custo com o modelo atual.

Se a perda de qualidade ficar dentro do limite aceitável, a economia por milhão de tokens pode justificar o uso do Agnes como primeira tentativa. Se o fluxo exigir raciocínio mais consistente, código ou agentes, a pontuação de 35,5 não basta para concluir que o modelo atende ao caso.

A estreia, portanto, muda mais o cardápio de custo do que o ranking de inteligência: você ganha uma opção barata para testar, não uma prova de que pode aposentar os modelos mais fortes.

Em uma frase

O Agnes 3.0 Flash é uma aposta de baixo custo para tarefas de alto volume, mas precisa vencer seus testes de produção antes de substituir modelos mais capazes.

Perguntas frequentes

Qual é o IQ do Agnes 3.0 Flash?

O Agnes 3.0 Flash estreou no Artificial Analysis com IQ de 35,5. A pontuação ficou abaixo dos 39,5 do DeepSeek V4.1 Flash (max), que também estreou no índice.

Quanto custa o Agnes 3.0 Flash por milhão de tokens?

O preço listado no OpenRouter é de US$ 0,075 por milhão de tokens. O dado de estreia não separa valores de entrada e saída.

O Agnes 3.0 Flash é melhor que o DeepSeek V4.1 Flash?

Não pelo benchmark de inteligência: o DeepSeek V4.1 Flash (max) marcou 39,5, contra 35,5 do Agnes. O Agnes leva vantagem no preço, com US$ 0,075 por milhão de tokens ante US$ 0,525.

Leia também