Cinco modelos tiveram nota revisada hoje — e o Nemotron caiu
Devstral 2 e os três Ministral 3 subiram no índice; o Nemotron 3 Nano perdeu quase 20% da nota. A régua mexeu debaixo de quem já tinha comparado.
Você comparou dois modelos pequenos na semana passada, fechou a escolha, e hoje a régua diz outra coisa. É esse o tipo de dor de cabeça que cinco reavaliações publicadas nesta sexta-feira trazem para quem escolhe modelo olhando benchmark.
O que mudou, em uma olhada
O catálogo atualizou hoje o índice de inteligência de cinco modelos. Quatro subiram, um despencou. A diferença entre o maior salto e a maior queda é de quase 7 pontos — em uma escala em que o topo do mercado gira em torno de 62.
| Modelo | Antes | Depois | Diferença |
|---|---|---|---|
| Devstral 2 | 15.5 | 19.2 | +3.7 |
| NVIDIA Nemotron 3 Nano 30B A | 17.5 | 14.2 | -3.4 |
| Ministral 3 3B | 5.6 | 6.8 | +1.1 |
| Ministral 3 14B | 10.0 | 11.1 | +1.1 |
| Ministral 3 8B | 8.9 | 9.0 | +0.0 |
Quem subiu (e quem subiu de verdade)
O Devstral 2 foi o que mais ganhou em termos absolutos: saltou de 15,49 para 19,16, um aumento de 3,67 pontos no índice. É o maior movimento da leva. O preço listado no catálogo é zero, o que significa que o publicador não divulgou valor de referência — então não dá para cravar o custo por token sem consultar a API do provedor.
Os três Ministral 3 também subiram, mas em proporções bem diferentes. O Ministral 3 14B foi de 9,96 para 11,05 (+1,09). O Ministral 3 3B foi de 5,63 para 6,77 (+1,14). O Ministral 3 8B mal se mexeu: de 8,92 para 8,96, uma variação de 0,04 ponto — tecnicamente uma reavaliação, praticamente um empate com a nota anterior.
Em outras palavras: se você estava olhando para o Ministral 3 8B, hoje não mudou nada. Se estava olhando para o Devstral 2 ou para o 14B, a régua subiu.
Quem caiu
O NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) é o único que perdeu nota nesta leva. Foi de 17,53 para 14,18 — uma queda de 3,35 pontos, o equivalente a quase 20% do valor anterior. É o movimento mais doloroso do dia, porque pega um modelo que já não estava no topo e o empurra ainda mais para baixo.
O detalhe relevante: ele custa US$ 0,09625 por milhão de tokens de saída. Não é caro, mas também não é o mais barato da faixa — o Devstral 2 e o DeepSeek V4 Pro custam menos e, depois desta reavaliação, estão acima dele no índice.
O que isso diz sobre o resto do mercado
Para situar o tamanho do estrago, vale olhar quem está no topo hoje. O Claude Fable 5, da Anthropic, lidera com 62,07 no índice e custa US$ 50 por milhão de tokens de saída. O Z.ai GLM 5.2 vem em segundo com 52,64 e sai por US$ 3,04. O Gemini 3.1 Pro Preview, da Google, está em 47,74 a US$ 12. O Gemini 3.5 Flash marca 46,67 a US$ 9. O GPT-5.3-Codex, da OpenAI, fecha o top 5 com 45,51 a US$ 14.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| GLM 5.2 | 52.6 | 3.036 |
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
| GPT-5.3-Codex | 45.5 | 14 |
Repare: nenhum dos modelos reavaliados hoje está perto desse grupo. Todos vivem na faixa de um dígito ou início de dois dígitos, e o melhor deles (Devstral 2, com 19,16) ainda está a mais de 40 pontos do líder. Estamos falando de modelos pequenos, de baixo custo, voltados para tarefas onde cada centavo de token conta.
Para quem isso importa — e para quem não
Se você roda o Nemotron 3 Nano em produção, vale rodar a mesma suíte de testes que usou para adotá-lo e ver se a percepção de qualidade mudou junto com o número. Benchmark é uma régua, não é a obra final — mas uma queda de 20% costuma aparecer no uso.
Se você estava avaliando o Devstral 2 ou o Ministral 3 14B, a nota nova reforça a leitura anterior, não muda o veredito. Você só tem um número mais honesto para colocar na planilha.
Se você nunca ouviu falar desses cinco modelos, esta notícia provavelmente não é para você. A reavaliação mexeu em modelos de nicho, não no topo do mercado.
O que fazer com isso na segunda-feira
Trate o índice como uma foto, não como um retrato permanente. O catálogo hoje tem mais de 477 modelos listados, vindos de 62 criadores, e 27 foram lançados nos últimos 30 dias. Em um mercado desse tamanho, reavaliações como a de hoje vão acontecer — e vão continuar acontecendo. O trabalho de quem escolhe modelo é comparar preço e qualidade na data da decisão, não três meses antes.
Reavalie o Nemotron 3 Nano antes de renovar qualquer contrato; o Devstral 2 e os Ministral 3 só confirmaram o que já eram.
Perguntas frequentes
O que é uma reavaliação de benchmark?
É quando o catálogo recalcula a nota de inteligência de um modelo já listado, geralmente porque a metodologia mudou ou porque há novos dados. A nota antiga deixa de ser a referência oficial e a nova passa a valer para comparações.
Por que o Nemotron 3 Nano caiu tanto de uma vez?
Os dados mostram uma queda de 17,53 para 14,18 no índice — uma variação de 3,35 pontos. O motivo técnico exato não está publicado; o que importa para o usuário é que a nota nova é a que vale a partir de hoje.
Devstral 2 e Ministral 3 ficaram melhores de verdade?
Os números subiram, então no índice atual eles pontuam mais. Mas benchmark é uma régua, não uma garantia de qualidade no seu caso específico — vale rodar seus próprios testes antes de migrar.