Dois modelos abertos perdem nota de inteligência na régua de julho
Gemma 4 31B e MiMo-V2.5 caem cerca de 3 pontos no índice do catálogo; o preço não mudou e o custo-benefício continua de pé.
Você escolheu o modelo, fechou o prompt, mandou pra produção — e, sem aviso, a régua se mexeu. É exatamente isso que aconteceu hoje com dois modelos abertos que já estavam no seu shortlist: o Gemma 4 31B (Non-reasoning), do Google, e o MiMo-V2.5, da Xiaomi. Os dois tiveram a nota de inteligência revisada para baixo no catálogo. O preço, esse ficou onde estava.
O que mudou, em números crus
O Gemma 4 31B caiu de 24,85 para 21,77 — uma perda de 3,08 pontos. O MiMo-V2.5 foi de 40,14 para 37,20, recuo de 2,93 pontos. Nenhum dos dois mudou de faixa dramática: o Gemma segue abaixo dos 25 e o MiMo continua na casa dos 37. Mas, em benchmark, três pontos é três pontos — é a diferença entre aparecer numa lista de "modelos acima de 40" e ficar de fora dela.
| Modelo | Antes | Depois | Diferença |
|---|---|---|---|
| Gemma 4 31B (Non-reasoning) | 24.8 | 21.8 | -3.1 |
| MiMo-V2.5 | 40.1 | 37.2 | -2.9 |
Por que isso importa se o preço não mudou
Aqui está o detalhe que confunde: a fatura continua igual. O Gemma 4 31B segue em US$ 0,205 por milhão de tokens de saída; o MiMo-V2.5, em US$ 0,175. Reavaliar nota não é reavaliar preço. Quem contratou o serviço pelo custo continua pagando o mesmo. Quem contratou pela nota — porque precisava de um modelo com IQ acima de certo limiar para uma tarefa específica — acordou hoje com um produto diferente do que assinou ontem.
Pense assim: é como comprar um vinho pela denominação. O rótulo não mudou, o preço não mudou, mas a classificação na prateleira foi rebaixada. Você não perdeu dinheiro; perdeu argumento para servir aquele vinho na mesa.
Onde eles ficam no tabuleiro de julho
Para situar a queda, vale olhar quem está no topo hoje. A régua é liderada pelo Claude Fable 5, da Anthropic, com IQ 62,07 e preço de US$ 50 por milhão de tokens de saída — o topo absoluto. Logo abaixo vem o GPT-5.6 Sol, da OpenAI, com 60,93 e US$ 10. O Grok 4.5, da SpaceXAI, aparece em 55,76 por US$ 6. E o Claude Sonnet 5 fecha o top 5 com 55,26 e US$ 10.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| GPT-5.6 Sol | 60.9 | 10 |
| GPT-5.6 Terra | 56.6 | 12 |
| Grok 4.5 | 55.8 | 6 |
| Claude Sonnet 5 | 55.3 | 10 |
Ou seja: o Gemma 4 31B e o MiMo-V2.5 não disputam o topo — disputam o chão de fábrica. Ambos ficam bem abaixo dos 45 pontos, a fronteira que o próprio catálogo usa para separar "barato com nota" de "barato porque é barato". O MiMo-V2.5, aos 37,2, está mais perto desse corte do que o Gemma, aos 21,8.
Para quem isso muda alguma coisa
Se você usa o MiMo-V2.5 numa tarefa que exige nota acima de 40 — classificação fina, extração estruturada em casos de borda, geração com约束 forte —, vale revalidar o pipeline. A nota caiu, mas a queda foi de quase 3 pontos; dependendo do seu caso de uso, isso pode ser ruído ou pode ser a diferença entre o sistema passar e falhar num teste de regressão. A recomendação honesta é rodar o mesmo eval de antes e comparar.
Se você usa o Gemma 4 31B, a conversa é diferente. Com 21,77, o modelo já estava abaixo do que a maioria dos times aceita para produção séria. A reavaliação só torna mais nítido o que já era visível: ele é uma opção para prototipagem barata, não para o caminho crítico. Não há motivo para trocar de fornecedor por causa da nota — mas também não há motivo para defendê-lo numa reunião de arquitetura.
Se você não usa nenhum dos dois, siga em frente. A régua se mexeu, mas não o suficiente para redesenhar pipeline.
O que fazer agora
Pegue os evals internos que justificaram a escolha do MiMo-V2.5 e rode de novo. Se passaram,恭喜 — a nota é só um número. Se falharam, você tem duas opções: subir para um modelo acima de 45 (o GPT-5.6 Luna, da OpenAI, está em 52,32 por US$ 1,20 por milhão de tokens de saída e é o melhor custo-benefício nessa faixa) ou aceitar que a tarefa não precisa de tanta inteligência e descer para o DeepSeek V4 Pro 0423, em 45,27 por US$ 1,74. Para o Gemma 4 31B, a decisão é mais simples: só mantenha se o preço for o único critério.
Reavalie o MiMo-V2.5 com seu próprio eval antes de mexer no pipeline; o Gemma 4 31B perdeu nota mas continua sendo o que sempre foi — barato e limitado.
Perguntas frequentes
O que é uma reavaliação de benchmark no catálogo?
É quando o provedor do índice (no caso, o Artificial Analysis) recalcula a nota de inteligência de um modelo já listado, sem mudar o preço nem a API. O modelo continua disponível, mas a régua foi reajustada — e o número que você consultou ontem pode não ser o mesmo de hoje.
Por que o preço dos modelos não mudou junto com a nota?
Porque nota e preço são variáveis independentes. O índice mede capacidade; o preço é definido pelo criador do modelo. Uma queda de nota não implica desconto nem aumento — apenas reposiciona o modelo na curva de custo-benefício.
Vale trocar de modelo depois de uma reavaliação negativa?
Depende do seu caso de uso. Se você escolheu o modelo por nota (e não por preço), rode seu eval interno de novo e compare com alternativas na mesma faixa — como o GPT-5.6 Luna ou o DeepSeek V4 Pro 0423. Se a escolha foi puramente financeira, não há motivo para trocar.