FalaVIP IA quinta-feira, 03 de setembro de 2026
Benchmarks

Dois modelos abertos perdem nota de inteligência na régua de julho

Gemma 4 31B e MiMo-V2.5 caem cerca de 3 pontos no índice do catálogo; o preço não mudou e o custo-benefício continua de pé.

Redação FalaVIP IA 3 min de leitura
-3,08pontos de IQ do Gemma 4 31B (de 24,85 para 21,77)
-2,93pontos de IQ do MiMo-V2.5 (de 40,14 para 37,20)
US$ 0,205preço por milhão de tokens de saída do Gemma 4 31B (sem alteração)

Você escolheu o modelo, fechou o prompt, mandou pra produção — e, sem aviso, a régua se mexeu. É exatamente isso que aconteceu hoje com dois modelos abertos que já estavam no seu shortlist: o Gemma 4 31B (Non-reasoning), do Google, e o MiMo-V2.5, da Xiaomi. Os dois tiveram a nota de inteligência revisada para baixo no catálogo. O preço, esse ficou onde estava.

O que mudou, em números crus

O Gemma 4 31B caiu de 24,85 para 21,77 — uma perda de 3,08 pontos. O MiMo-V2.5 foi de 40,14 para 37,20, recuo de 2,93 pontos. Nenhum dos dois mudou de faixa dramática: o Gemma segue abaixo dos 25 e o MiMo continua na casa dos 37. Mas, em benchmark, três pontos é três pontos — é a diferença entre aparecer numa lista de "modelos acima de 40" e ficar de fora dela.

Notas revisadas pelo Artificial Analysis
ModeloAntesDepoisDiferença
Gemma 4 31B (Non-reasoning)24.821.8-3.1
MiMo-V2.540.137.2-2.9

Por que isso importa se o preço não mudou

Aqui está o detalhe que confunde: a fatura continua igual. O Gemma 4 31B segue em US$ 0,205 por milhão de tokens de saída; o MiMo-V2.5, em US$ 0,175. Reavaliar nota não é reavaliar preço. Quem contratou o serviço pelo custo continua pagando o mesmo. Quem contratou pela nota — porque precisava de um modelo com IQ acima de certo limiar para uma tarefa específica — acordou hoje com um produto diferente do que assinou ontem.

Pense assim: é como comprar um vinho pela denominação. O rótulo não mudou, o preço não mudou, mas a classificação na prateleira foi rebaixada. Você não perdeu dinheiro; perdeu argumento para servir aquele vinho na mesa.

Onde eles ficam no tabuleiro de julho

Para situar a queda, vale olhar quem está no topo hoje. A régua é liderada pelo Claude Fable 5, da Anthropic, com IQ 62,07 e preço de US$ 50 por milhão de tokens de saída — o topo absoluto. Logo abaixo vem o GPT-5.6 Sol, da OpenAI, com 60,93 e US$ 10. O Grok 4.5, da SpaceXAI, aparece em 55,76 por US$ 6. E o Claude Sonnet 5 fecha o top 5 com 55,26 e US$ 10.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
GPT-5.6 Sol60.910
GPT-5.6 Terra56.612
Grok 4.555.86
Claude Sonnet 555.310
Entre os 502 modelos disponíveis no catálogo nesta data.

Ou seja: o Gemma 4 31B e o MiMo-V2.5 não disputam o topo — disputam o chão de fábrica. Ambos ficam bem abaixo dos 45 pontos, a fronteira que o próprio catálogo usa para separar "barato com nota" de "barato porque é barato". O MiMo-V2.5, aos 37,2, está mais perto desse corte do que o Gemma, aos 21,8.

Para quem isso muda alguma coisa

Se você usa o MiMo-V2.5 numa tarefa que exige nota acima de 40 — classificação fina, extração estruturada em casos de borda, geração com约束 forte —, vale revalidar o pipeline. A nota caiu, mas a queda foi de quase 3 pontos; dependendo do seu caso de uso, isso pode ser ruído ou pode ser a diferença entre o sistema passar e falhar num teste de regressão. A recomendação honesta é rodar o mesmo eval de antes e comparar.

Se você usa o Gemma 4 31B, a conversa é diferente. Com 21,77, o modelo já estava abaixo do que a maioria dos times aceita para produção séria. A reavaliação só torna mais nítido o que já era visível: ele é uma opção para prototipagem barata, não para o caminho crítico. Não há motivo para trocar de fornecedor por causa da nota — mas também não há motivo para defendê-lo numa reunião de arquitetura.

Se você não usa nenhum dos dois, siga em frente. A régua se mexeu, mas não o suficiente para redesenhar pipeline.

O que fazer agora

Pegue os evals internos que justificaram a escolha do MiMo-V2.5 e rode de novo. Se passaram,恭喜 — a nota é só um número. Se falharam, você tem duas opções: subir para um modelo acima de 45 (o GPT-5.6 Luna, da OpenAI, está em 52,32 por US$ 1,20 por milhão de tokens de saída e é o melhor custo-benefício nessa faixa) ou aceitar que a tarefa não precisa de tanta inteligência e descer para o DeepSeek V4 Pro 0423, em 45,27 por US$ 1,74. Para o Gemma 4 31B, a decisão é mais simples: só mantenha se o preço for o único critério.

Em uma frase

Reavalie o MiMo-V2.5 com seu próprio eval antes de mexer no pipeline; o Gemma 4 31B perdeu nota mas continua sendo o que sempre foi — barato e limitado.

Perguntas frequentes

O que é uma reavaliação de benchmark no catálogo?

É quando o provedor do índice (no caso, o Artificial Analysis) recalcula a nota de inteligência de um modelo já listado, sem mudar o preço nem a API. O modelo continua disponível, mas a régua foi reajustada — e o número que você consultou ontem pode não ser o mesmo de hoje.

Por que o preço dos modelos não mudou junto com a nota?

Porque nota e preço são variáveis independentes. O índice mede capacidade; o preço é definido pelo criador do modelo. Uma queda de nota não implica desconto nem aumento — apenas reposiciona o modelo na curva de custo-benefício.

Vale trocar de modelo depois de uma reavaliação negativa?

Depende do seu caso de uso. Se você escolheu o modelo por nota (e não por preço), rode seu eval interno de novo e compare com alternativas na mesma faixa — como o GPT-5.6 Luna ou o DeepSeek V4 Pro 0423. Se a escolha foi puramente financeira, não há motivo para trocar.

Leia também