FalaVIP IA quinta-feira, 03 de setembro de 2026
Benchmarks

Seis modelos perdem nota no mesmo dia e a régua muda

Reavaliação do Artificial Analysis derruba GPT-5 mini, Command A+, o3-mini e outros; só Claude 4.5 Sonnet sobe.

Redação FalaVIP IA 4 min de leitura
-7,65 pontosqueda do GPT-5 mini (high), de 32,96 para 25,31
US$ 0,6875por milhão de tokens de saída do GPT-5 mini
+1,77 pontosalta do Claude 4.5 Sonnet Reasoning, único a subir

A régua mexeu debaixo de quem já tinha escolhido

Se você fechou contrato, montou pipeline ou simplesmente anotou na planilha qual modelo usar para cada tarefa, preste atenção: nove notas de benchmark foram revisadas no mesmo dia pelo Artificial Analysis, e seis caíram. Só uma subiu.

A pergunta que importa não é "qual modelo é melhor agora" — é "em qual decisão sua você confiou numa nota que já não vale".

Quem caiu, e quem caiu feio

O tombo mais agressivo foi do GPT-5 mini (high): passou de 32,96 para 25,31 no índice de inteligência, uma perda de 7,65 pontos em um único ajuste de régua. É o tipo de variação que muda de qual prateleira o modelo fica — sai da faixa intermediária e entra no fim do meio de campo. Preço de saída segue em US$ 0,6875 por milhão de tokens.

Logo atrás vem o Command A+, da Cohere: de 29,29 para 22,51. Detalhe curioso, o catálogo não publicou preço para esse modelo, então não dá para comparar com a régua anterior em reais por dólar de inteligência. O fato é que a nota caiu e a régua mudou.

O o3-mini (high), da OpenAI, perdeu 2,74 pontos e foi para 15,64 — a menor nota entre os seis reavaliados. É também o mais caro do grupo em saída: US$ 1,925 por milhão de tokens. Para uma nota de 15,6, é um valor que pede explicação.

Fecham o bloco dos que caíram o Qwen3 235B A22B 2507 Reasoning (de 22,34 para 19,61, a US$ 0,8375) e o GPT-5.1 (high) (de 38,91 para 36,87, a US$ 3,4375). Esse último é o que dói mais no bolso: o modelo mais caro do grupo perdeu quase 2 pontos sem mudar de preço.

Notas revisadas pelo Artificial Analysis
ModeloAntesDepoisDiferença
GPT-5 mini (high)33.025.3-7.7
Command A+29.322.5-6.8
o3-mini (high)18.415.6-2.7
Qwen3 235B A22B 2507 (Reason22.319.6-2.7
GPT-5.1 (high)38.936.9-2.0
Claude 4.5 Sonnet (Reasoning34.736.4+1.8

O único que subiu

Em meio ao tombo geral, o Claude 4.5 Sonnet Reasoning foi de 34,65 para 36,42 — alta de 1,77 pontos. É a única nota que subiu entre as nove revisadas. Continua sendo o modelo mais caro do grupo, a US$ 6 por milhão de tokens de saída. Para o tipo de tarefa em que reasoning compensa, a nota melhorou; para a fatura, nada mudou.

O que essa reavaliação diz sobre o tabuleiro

Para entender o peso do ajuste, vale olhar quem está no topo hoje e quem está no chão. O catálogo tem mais de 482 modelos listados e 62 criadores diferentes. No topo do índice de inteligência, o Claude Fable 5 lidera com 62,07, seguido do Claude Sonnet 5 (55,26), do GLM 5.2 da Z.ai (52,64), do Gemini 3.1 Pro Preview (47,74) e do Gemini 3.5 Flash (46,67). Os modelos reavaliados hoje estão todos bem abaixo dessa régua — nenhum deles aparece entre os cinco primeiros.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
Claude Sonnet 555.310
GLM 5.252.63.036
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
Entre os 482 modelos disponíveis no catálogo nesta data.

A leitura prática é simples: a régua mexeu, mas o topo continua o mesmo. Anthropic, Google e Z.ai seguem na frente. OpenAI, Cohere e Alibaba aparecem, mas em outra faixa.

Para quem isso muda a decisão

Se você estava usando GPT-5 mini como "barato que resolve", a nota nova exige uma repescagem: o custo-benefício precisa ser recalculado com 25,3, não com 32,9. Se estava no GPT-5.1 por ser "o topo da OpenAI para tarefas médias", a queda de 2 pontos é marginal mas real — e o preço, US$ 3,4375 por milhão de saída, não acompanhou.

Se estava no Command A+, a nota nova (22,51) reposiciona o modelo na faixa baixa, e a ausência de preço público dificulta a comparação direta. Vale testar alternativas como o GLM 5.2, que está em 52,64 por US$ 3,036 — mais caro, mas em outra prateleira de capacidade.

Se estava no o3-mini (high), a nota de 15,6 por US$ 1,925 é um sinal de alerta: é o modelo mais caro entre os reavaliados de baixo desempenho. Provavelmente não é a melhor escolha hoje.

Se estava no Qwen3 235B Reasoning, a queda para 19,6 mantém o modelo na faixa econômica, mas tira o argumento de "nota surpreendente pelo preço".

E se estava no Claude 4.5 Sonnet Reasoning, a boa notícia: a nota subiu. A má: o preço, US$ 6 por milhão de saída, segue sendo o mais alto do grupo. Para tarefas em que reasoning justifica o custo, a conta ficou um pouco mais favorável.

O que fazer agora

Pegue a planilha de modelos que você roda em produção. Para cada um dos seis que caíram, recalcule o custo por ponto de inteligência usando a nota nova. Se o modelo já não justifica o preço, troque. Se continua justificando, mantenha — mas com a nota certa na cabeça.

A régua mudou. Sua decisão precisa mudar junto.

Em uma frase

Recalcule custo por ponto de inteligência dos seis modelos reavaliados antes de renovar qualquer contrato ou pipeline.

Perguntas frequentes

Por que o Artificial Analysis reavaliou nove modelos no mesmo dia?

Reavaliações em lote são comuns quando o método de benchmark muda ou quando há correção de dados antigos. O efeito prático é o mesmo: notas antigas perdem validade e comparações precisam ser refeitas com a régua nova.

O GPT-5 mini ainda vale a pena depois da queda?

Depende do uso. A nota caiu de 32,96 para 25,31, então o argumento de "modelo intermediário barato" enfraqueceu. Para tarefas simples, o preço de US$ 0,6875 por milhão de saída ainda pode compensar; para tarefas que exigem raciocínio, vale olhar alternativas como o GLM 5.2 ou o Gemini 3.5 Flash.

Por que o Claude 4.5 Sonnet Reasoning subiu enquanto todo mundo caiu?

Não há explicação pública para movimentos individuais em reavaliações em lote — pode ser ajuste de método, correção de amostras ou novo conjunto de testes. O fato é que, entre as nove notas revisadas em 2 de julho de 2026, foi a única que subiu, de 34,65 para 36,42.

Leia também

Benchmarks

Qwen3.5 perde ponto no índice da Artificial Analysis

Versão de 0,8B cai quase um ponto de IQ; a de 35B A3B sobe pouco. Quem já tinha escolhido pelo número precisa reabrir a planilha.

Benchmarks

GPT-5 perde nota e Llama 70B sobe na régua de julho

Artificial Analysis reavalia dois modelos no mesmo dia: o topo de linha da OpenAI cai quase 1,4 ponto de IQ, e o open-weight da Meta ganha fôlego.

Benchmarks

Cinco modelos pequenos reavaliados hoje — a régua dos baratos mexeu

Qwen3.5, Gemma 4 e Ministral 3 tiveram as notas revisadas pelo catálogo nesta segunda. Para quem escolhe pelo custo por chamada, a fila entre os modelos pequenos mexeu.

Benchmarks

Quatro modelos do catálogo tiveram a nota de benchmark revisada; um deles caiu quase 26%,Quatro notas de benchmark foram revisadas em um dia: o que muda na sua escolha,Quatro modelos reavaliados: Trinity Large Thinking perdeu 6,3 pontos de IQ,Reavaliação do dia derruba nota do Trinity Large Thinking em quase 26%,Quatro modelos reavaliados pelo Artificial Analysis em 22 de julho de 2026,Trinity Large Thinking cai de 24,5 para 18,2 na reavaliação do Artificial Analysis,Quatro notas de benchmark revisadas: Trinity Large Thinking foi o que mais caiu,Reavaliação do Artificial Analysis mexe em quatro modelos do catálogo,Quatro modelos tiveram a régua de benchmark movida pelo Artificial Analysis,Quatro reavaliações do Artificial Analysis em um só dia: o que muda na sua pilha

Trinity Large Thinking perdeu quase 26% da nota em uma só revisão; Gemma 4 E4B e DeepSeek V4 Flash também foram recalibrados.