FalaVIP IA quinta-feira, 03 de setembro de 2026
Benchmarks

Cinco modelos reavaliados hoje, quatro perderam nota

Só o MiMo-V2-Flash subiu na revisão do catálogo; Gemini 2.5 Pro, Magistral e Nova Lite saíram mais fracos sem mudar de versão.

Redação FalaVIP IA 3 min de leitura
US$ 3,4375por milhão de tokens de saída do Gemini 2.5 Pro, que caiu de nota
US$ 0,15por milhão de tokens de saída do MiMo-V2-Flash, único que subiu
-2,332 pontosqueda do Nova 2.0 Lite (high), o maior tombo da leva

Quatro de cinco modelos reavaliados hoje pelo catálogo saíram com nota menor do que tinham ontem. O quinto, o mais barato da lista, subiu. Em todos os cinco casos a nota mudou no mesmo dia — sinal de que a régua, não os modelos, é que se mexeu.

Para quem tinha escolhido modelo pelo índice de inteligência, comparando custo e nota antes de colocar em produção, é o tipo de notícia que obriga uma releitura de planilha. Não porque o desempenho real tenha mudado da noite para o dia, mas porque a régua que define "qual é o bom" mudou.

Notas revisadas pelo Artificial Analysis
ModeloAntesDepoisDiferença
Nova 2.0 Lite (high)20.518.2-2.3
Magistral Medium 1.220.117.9-2.2
MiMo-V2-Flash (Non-reasoning23.124.7+1.6
Gemini 2.5 Pro27.025.8-1.2
Claude 3.5 Haiku12.412.3-0.1

O que exatamente mudou

Pense na régua do catálogo como uma prova escolar com peso variável: de tempos em tempos, o catálogo ajusta o conjunto de testes ou a forma de somar pontos, e recalcula retroativamente as notas dos modelos já listados. O aluno não estudou mais nem menos — o exame, simplesmente, mudou.

Foi o que aconteceu hoje com cinco modelos:

  • Nova 2.0 Lite (high) caiu de 20,5 para 18,168. Preço: US$ 0,85 por milhão de tokens de saída.
  • Magistral Medium 1.2 caiu de 20,113 para 17,874. Preço: US$ 2,75.
  • Gemini 2.5 Pro caiu de 26,982 para 25,818. Preço: US$ 3,4375.
  • Claude 3.5 Haiku mal se moveu: de 12,408 para 12,261. Preço: US$ 1,60.
  • MiMo-V2-Flash (Non-reasoning) foi de 23,075 para 24,67. Preço: US$ 0,15.

Os dados são do próprio catálogo e foram revisados na data de hoje, 27 de junho de 2026.

Quem sai pior

Três dos quatro rebaixados estavam na faixa "barata" — Nova Lite, Magistral Medium e Claude 3.5 Haiku. Para projetos que escolheram esses modelos justamente para economizar em atendimento automático, classificação e sumarização de baixo risco, perder 1 a 2 pontos no índice é o suficiente para questionar a escolha.

O caso mais desconfortável é o Gemini 2.5 Pro. Custa US$ 3,4375 por milhão de tokens de saída — entre os mais caros da lista — e perdeu 1,16 ponto na reavaliação. Não é desastre, mas é o tipo de movimento que aparece quando alguém na empresa pergunta "por que a fatura não baixou mesmo com o modelo caindo de nota?".

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
GLM 5.252.63.036
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
GPT-5.3-Codex45.514
Entre os 477 modelos disponíveis no catálogo nesta data.

Para efeito de comparação: o topo do catálogo hoje pertence ao Anthropic Claude Fable 5, com 62,073 no índice, ao preço de US$ 50 por milhão de tokens de saída. Os modelos da faixa barata vivem em outro universo de pontuação, mas a diferença entre um e outro dentro dessa faixa importa.

A exceção da leva

MiMo-V2-Flash é o único da lista que subiu, e subiu sem estardalhaço: 1,6 ponto a mais, saindo de 23,075 para 24,67. O detalhe importante é o preço — US$ 0,15 por milhão de tokens de saída, o mais barato entre os cinco reavaliados.

Se você já usava MiMo para tarefas de baixo custo, hoje é um dia bom. Se não usava e procurava um modelo barato acima de IQ 20, vale colocar no radar. O catálogo tem hoje mais de 477 modelos ativos, e essa faixa de preço é onde a régua mexe mais.

O que fazer agora

Releia qual modelo está rodando em cada fluxo que você paga. Se o nome está na lista dos quatro rebaixados, vale fazer dois movimentos concretos: comparar o índice novo com alternativas do mesmo tier de preço — o catálogo tem hoje, por exemplo, MiniMax M3 a US$ 1,20 e DeepSeek V4 Pro a US$ 1,74, ambos imunes a esta reavaliação porque não estavam na leva — e repensar prompts que assumiam nota maior do que a nova.

Se o modelo em produção não está na lista, não mexa em nada. A reavaliação de hoje só mexeu na régua dos cinco citados; para o resto, o índice continua o mesmo.

Em uma frase

Quem tem Nova Lite, Magistral, Gemini 2.5 Pro ou Claude 3.5 Haiku em produção precisa refazer a conta de custo por ponto hoje; quem usa MiMo-V2-Flash ganhou folga na régua sem pagar nada por isso.

Perguntas frequentes

O que significa "modelo reavaliado" no catálogo?

Significa que o catálogo recalculou a nota do modelo porque ajustou o conjunto de testes ou a forma de somar pontos. O modelo em si não mudou; a régua é que mudou. O índice pode subir ou cair sem que tenha havido nova versão.

Meu modelo perdeu nota hoje. Preciso trocar?

Não obrigatoriamente. Se o fluxo em produção continua entregando o resultado que você precisa, a nota do catálogo é só um referencial. Mas se você escolheu aquele modelo comparando custo e nota, vale refazer a conta com o índice novo e ver se ainda faz sentido.

Por que o MiMo-V2-Flash subiu enquanto os outros quatro caíram?

A revisão do catálogo mexeu na régua e, ao recalcular os pontos, MiMo ganhou 1,6 ponto enquanto os outros quatro perderam. O modelo em si não mudou — a régua, sim.

Leia também

Benchmarks

Quatro modelos do catálogo tiveram a nota de benchmark revisada; um deles caiu quase 26%,Quatro notas de benchmark foram revisadas em um dia: o que muda na sua escolha,Quatro modelos reavaliados: Trinity Large Thinking perdeu 6,3 pontos de IQ,Reavaliação do dia derruba nota do Trinity Large Thinking em quase 26%,Quatro modelos reavaliados pelo Artificial Analysis em 22 de julho de 2026,Trinity Large Thinking cai de 24,5 para 18,2 na reavaliação do Artificial Analysis,Quatro notas de benchmark revisadas: Trinity Large Thinking foi o que mais caiu,Reavaliação do Artificial Analysis mexe em quatro modelos do catálogo,Quatro modelos tiveram a régua de benchmark movida pelo Artificial Analysis,Quatro reavaliações do Artificial Analysis em um só dia: o que muda na sua pilha

Trinity Large Thinking perdeu quase 26% da nota em uma só revisão; Gemma 4 E4B e DeepSeek V4 Flash também foram recalibrados.

Benchmarks

Qwen3.5 perde ponto no índice da Artificial Analysis

Versão de 0,8B cai quase um ponto de IQ; a de 35B A3B sobe pouco. Quem já tinha escolhido pelo número precisa reabrir a planilha.

Benchmarks

Dois modelos abertos perdem nota de inteligência na régua de julho

Gemma 4 31B e MiMo-V2.5 caem cerca de 3 pontos no índice do catálogo; o preço não mudou e o custo-benefício continua de pé.

Benchmarks

Seis modelos tiveram a nota mexida — e dois deles você provavelmente já usa

Reavaliação do Artificial Analysis reposiciona Phi-4 Mini, Ling 2.6 Flash e Kimi K2.6; para quem escolheu pelo preço, a régua mudou.