FalaVIP IA quinta-feira, 03 de setembro de 2026
Benchmarks

Cinco modelos pequenos reavaliados hoje — a régua dos baratos mexeu

Qwen3.5, Gemma 4 e Ministral 3 tiveram as notas revisadas pelo catálogo nesta segunda. Para quem escolhe pelo custo por chamada, a fila entre os modelos pequenos mexeu.

Redação FalaVIP IA 3 min de leitura
5modelos reavaliados em 28/07/2026
IQ 7,057nova nota do Qwen3.5 2B (Reasoning)
US$ 0,04por milhão de tokens de saída do Gemma 4 E4B

A régua mexeu, e o ranking dos pequenos junto com ela

Você escolheu o modelo olhando o número. Leu o benchmark, comparou, fechou a decisão. Aí o catálogo recalibra — e a nota de hoje não é mais a de ontem. Foi o que aconteceu nesta segunda com cinco modelos pequenos do Artificial Analysis, todos abaixo de 12 de IQ. As variações são modestas no papel, mas mexem com quem escolhe pelo custo por ponto de capacidade.

O que mudou nas notas

Cinco reavaliações saíram no mesmo dia. A maior subida em valor absoluto ficou com o Qwen3.5 2B (Reasoning), que foi de 6,855 para 7,057 — pouco mais de dois décimos. Na direção oposta, o Qwen3.5 0.8B (Reasoning) caiu de 5,515 para 5,347. O Ministral 3 3B também cedeu: de 6,462 para 6,309. O Gemma 4 E2B (Reasoning) perdeu cinco centésimos (9,494 → 9,439). E o Gemma 4 E4B (Reasoning) ficou praticamente parado: 11,889 para 11,9.

Notas revisadas pelo Artificial Analysis
ModeloAntesDepoisDiferença
Qwen3.5 2B (Reasoning)6.97.1+0.2
Qwen3.5 0.8B (Reasoning)5.55.3-0.2
Ministral 3 3B6.56.3-0.2
Gemma 4 E2B (Reasoning)9.59.4-0.1
Gemma 4 E4B (Reasoning)11.911.9+0.0

Nenhum desses cinco disputa a ponta do mercado. Eles vivem em outra faixa — a do cents por milhão de tokens, da inferência barata, do trabalho de rotina. O Ministral 3 3B tem preço publicado de US$ 0,10 por milhão de tokens de saída. O Gemma 4 E4B sai por US$ 0,04. Para os dois Qwen3.5 e o Gemma 4 E2B, o catálogo não publicou preço nesta listagem, então não dá para cravar o custo por chamada — só a nova nota.

Onde está o topo, para dimensionar

Para situar a régua, vale olhar para cima. O topo absoluto do catálogo agora é o Claude Opus 5, com IQ 63,053, a US$ 25 por milhão de tokens de saída. Logo abaixo vem o Claude Fable 5 (62,073) e o GPT-5.6 Sol (60,93). Os modelos reavaliados hoje estão entre 15 e 18 vezes abaixo disso em capacidade medida.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Opus 563.125
Claude Fable 562.150
GPT-5.6 Sol60.910
Kimi K359.715
GPT-5.6 Terra56.612
Entre os 522 modelos disponíveis no catálogo nesta data.

Isso não é demérito — é função. Cada modelo tem um trabalho. Mas entre os pequenos, a fila é apertada, e dois décimos de IQ podem trocar a ordem de quem lidera o segmento de baixíssimo custo. Foi exatamente o que aconteceu com o Qwen3.5 2B em relação aos seus vizinhos de faixa.

Para quem essa reavaliação muda algo

Se você roda modelo pequeno local, usa API barata para extração, classificação, sumarização simples ou tem um agente que usa um modelo de baixo custo como roteador — sim, esta nota te interessa. Você provavelmente usou a régua para decidir, e a régua se mexeu. Vale conferir se o escolhido continua à frente do concorrente direto, especialmente na faixa do Ministral e dos Qwen3.5, que competem entre si por décimos.

Se você consome o topo de mercado, esta página não é sobre você. Nenhum dos cinco primeiros do ranking (Opus 5, Fable 5, GPT-5.6 Sol, Kimi K3, GPT-5.6 Terra) foi tocado. E se você está começando a avaliar agora, lembre do tamanho do mercado: o catálogo tem 522 modelos listados hoje, com 45 novidades só nos últimos 30 dias. A base é grande o suficiente para reavaliações como esta serem rotina — não exceção.

O que fazer na prática

Releia os números antes do próximo lote grande. Se algum desses cinco estava no seu fluxo de produção, refaça a comparação. A nota caiu? Veja se o concorrente próximo agora entrega mais pelo mesmo preço. Subiu? Pode ser a hora de migrar. Não tem preço publicado no catálogo? Busque no provedor antes de comparar pelo custo.

A implicação direta: reavaliação de benchmark não é nota de rodapé técnica. É sinal para revisitar a planilha — principalmente na faixa dos pequenos, onde a diferença entre o primeiro e o segundo colocado se mede em décimos, e a régua, como ficou claro hoje, se mexe.

Em uma frase

Antes de reprocessar o próximo lote, confira se o modelo pequeno que você adotou continua à frente do concorrente direto após a reavaliação; na faixa de baixo custo, décimos de IQ trocam a ordem da fila.

Perguntas frequentes

O que significa reavaliação de benchmark?

É quando o provedor do teste recalibra as notas de modelos já listados, geralmente por mudança no método de medição ou por correção. A nova nota substitui a anterior sem que o modelo em si tenha sido alterado — o que muda é a régua, não o objeto medido.

Preciso trocar de modelo se a nota caiu alguns décimos?

Depende. Se a queda reposiciona o modelo atrás de um concorrente de preço igual ou menor, vale testar a troca em um lote pequeno. Se o modelo continua bem posicionado na sua faixa de uso, décimos raramente justificam migração e o custo da mudança pode ser maior que o benefício.

Para que servem esses modelos pequenos abaixo de 12 de IQ?

Trabalho de baixo custo por chamada: classificação, extração, sumarização simples, raciocínio barato, roteamento de agentes e inferência local em hardware limitado. Eles não substituem o topo de mercado em tarefas que exigem raciocínio complexo, mas cobrem com folga o operacional do dia a dia.

Leia também