FalaVIP IA quinta-feira, 03 de setembro de 2026
Benchmarks

Cinco modelos tiveram nota revisada hoje — e o Nemotron caiu

Devstral 2 e os três Ministral 3 subiram no índice; o Nemotron 3 Nano perdeu quase 20% da nota. A régua mexeu debaixo de quem já tinha comparado.

Redação FalaVIP IA 3 min de leitura
+3,67 pontosganho do Devstral 2 (de 15,49 para 19,16)
−3,35 pontosqueda do Nemotron 3 Nano 30B A3B (de 17,53 para 14,18)
US$ 0,09625por milhão de tokens de saída do Nemotron 3 Nano

Você comparou dois modelos pequenos na semana passada, fechou a escolha, e hoje a régua diz outra coisa. É esse o tipo de dor de cabeça que cinco reavaliações publicadas nesta sexta-feira trazem para quem escolhe modelo olhando benchmark.

O que mudou, em uma olhada

O catálogo atualizou hoje o índice de inteligência de cinco modelos. Quatro subiram, um despencou. A diferença entre o maior salto e a maior queda é de quase 7 pontos — em uma escala em que o topo do mercado gira em torno de 62.

Notas revisadas pelo Artificial Analysis
ModeloAntesDepoisDiferença
Devstral 215.519.2+3.7
NVIDIA Nemotron 3 Nano 30B A17.514.2-3.4
Ministral 3 3B5.66.8+1.1
Ministral 3 14B10.011.1+1.1
Ministral 3 8B8.99.0+0.0

Quem subiu (e quem subiu de verdade)

O Devstral 2 foi o que mais ganhou em termos absolutos: saltou de 15,49 para 19,16, um aumento de 3,67 pontos no índice. É o maior movimento da leva. O preço listado no catálogo é zero, o que significa que o publicador não divulgou valor de referência — então não dá para cravar o custo por token sem consultar a API do provedor.

Os três Ministral 3 também subiram, mas em proporções bem diferentes. O Ministral 3 14B foi de 9,96 para 11,05 (+1,09). O Ministral 3 3B foi de 5,63 para 6,77 (+1,14). O Ministral 3 8B mal se mexeu: de 8,92 para 8,96, uma variação de 0,04 ponto — tecnicamente uma reavaliação, praticamente um empate com a nota anterior.

Em outras palavras: se você estava olhando para o Ministral 3 8B, hoje não mudou nada. Se estava olhando para o Devstral 2 ou para o 14B, a régua subiu.

Quem caiu

O NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) é o único que perdeu nota nesta leva. Foi de 17,53 para 14,18 — uma queda de 3,35 pontos, o equivalente a quase 20% do valor anterior. É o movimento mais doloroso do dia, porque pega um modelo que já não estava no topo e o empurra ainda mais para baixo.

O detalhe relevante: ele custa US$ 0,09625 por milhão de tokens de saída. Não é caro, mas também não é o mais barato da faixa — o Devstral 2 e o DeepSeek V4 Pro custam menos e, depois desta reavaliação, estão acima dele no índice.

O que isso diz sobre o resto do mercado

Para situar o tamanho do estrago, vale olhar quem está no topo hoje. O Claude Fable 5, da Anthropic, lidera com 62,07 no índice e custa US$ 50 por milhão de tokens de saída. O Z.ai GLM 5.2 vem em segundo com 52,64 e sai por US$ 3,04. O Gemini 3.1 Pro Preview, da Google, está em 47,74 a US$ 12. O Gemini 3.5 Flash marca 46,67 a US$ 9. O GPT-5.3-Codex, da OpenAI, fecha o top 5 com 45,51 a US$ 14.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
GLM 5.252.63.036
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
GPT-5.3-Codex45.514
Entre os 477 modelos disponíveis no catálogo nesta data.

Repare: nenhum dos modelos reavaliados hoje está perto desse grupo. Todos vivem na faixa de um dígito ou início de dois dígitos, e o melhor deles (Devstral 2, com 19,16) ainda está a mais de 40 pontos do líder. Estamos falando de modelos pequenos, de baixo custo, voltados para tarefas onde cada centavo de token conta.

Para quem isso importa — e para quem não

Se você roda o Nemotron 3 Nano em produção, vale rodar a mesma suíte de testes que usou para adotá-lo e ver se a percepção de qualidade mudou junto com o número. Benchmark é uma régua, não é a obra final — mas uma queda de 20% costuma aparecer no uso.

Se você estava avaliando o Devstral 2 ou o Ministral 3 14B, a nota nova reforça a leitura anterior, não muda o veredito. Você só tem um número mais honesto para colocar na planilha.

Se você nunca ouviu falar desses cinco modelos, esta notícia provavelmente não é para você. A reavaliação mexeu em modelos de nicho, não no topo do mercado.

O que fazer com isso na segunda-feira

Trate o índice como uma foto, não como um retrato permanente. O catálogo hoje tem mais de 477 modelos listados, vindos de 62 criadores, e 27 foram lançados nos últimos 30 dias. Em um mercado desse tamanho, reavaliações como a de hoje vão acontecer — e vão continuar acontecendo. O trabalho de quem escolhe modelo é comparar preço e qualidade na data da decisão, não três meses antes.

Em uma frase

Reavalie o Nemotron 3 Nano antes de renovar qualquer contrato; o Devstral 2 e os Ministral 3 só confirmaram o que já eram.

Perguntas frequentes

O que é uma reavaliação de benchmark?

É quando o catálogo recalcula a nota de inteligência de um modelo já listado, geralmente porque a metodologia mudou ou porque há novos dados. A nota antiga deixa de ser a referência oficial e a nova passa a valer para comparações.

Por que o Nemotron 3 Nano caiu tanto de uma vez?

Os dados mostram uma queda de 17,53 para 14,18 no índice — uma variação de 3,35 pontos. O motivo técnico exato não está publicado; o que importa para o usuário é que a nota nova é a que vale a partir de hoje.

Devstral 2 e Ministral 3 ficaram melhores de verdade?

Os números subiram, então no índice atual eles pontuam mais. Mas benchmark é uma régua, não uma garantia de qualidade no seu caso específico — vale rodar seus próprios testes antes de migrar.

Leia também