Seis modelos perdem nota no mesmo dia e a régua muda
Reavaliação do Artificial Analysis derruba GPT-5 mini, Command A+, o3-mini e outros; só Claude 4.5 Sonnet sobe.
A régua mexeu debaixo de quem já tinha escolhido
Se você fechou contrato, montou pipeline ou simplesmente anotou na planilha qual modelo usar para cada tarefa, preste atenção: nove notas de benchmark foram revisadas no mesmo dia pelo Artificial Analysis, e seis caíram. Só uma subiu.
A pergunta que importa não é "qual modelo é melhor agora" — é "em qual decisão sua você confiou numa nota que já não vale".
Quem caiu, e quem caiu feio
O tombo mais agressivo foi do GPT-5 mini (high): passou de 32,96 para 25,31 no índice de inteligência, uma perda de 7,65 pontos em um único ajuste de régua. É o tipo de variação que muda de qual prateleira o modelo fica — sai da faixa intermediária e entra no fim do meio de campo. Preço de saída segue em US$ 0,6875 por milhão de tokens.
Logo atrás vem o Command A+, da Cohere: de 29,29 para 22,51. Detalhe curioso, o catálogo não publicou preço para esse modelo, então não dá para comparar com a régua anterior em reais por dólar de inteligência. O fato é que a nota caiu e a régua mudou.
O o3-mini (high), da OpenAI, perdeu 2,74 pontos e foi para 15,64 — a menor nota entre os seis reavaliados. É também o mais caro do grupo em saída: US$ 1,925 por milhão de tokens. Para uma nota de 15,6, é um valor que pede explicação.
Fecham o bloco dos que caíram o Qwen3 235B A22B 2507 Reasoning (de 22,34 para 19,61, a US$ 0,8375) e o GPT-5.1 (high) (de 38,91 para 36,87, a US$ 3,4375). Esse último é o que dói mais no bolso: o modelo mais caro do grupo perdeu quase 2 pontos sem mudar de preço.
| Modelo | Antes | Depois | Diferença |
|---|---|---|---|
| GPT-5 mini (high) | 33.0 | 25.3 | -7.7 |
| Command A+ | 29.3 | 22.5 | -6.8 |
| o3-mini (high) | 18.4 | 15.6 | -2.7 |
| Qwen3 235B A22B 2507 (Reason | 22.3 | 19.6 | -2.7 |
| GPT-5.1 (high) | 38.9 | 36.9 | -2.0 |
| Claude 4.5 Sonnet (Reasoning | 34.7 | 36.4 | +1.8 |
O único que subiu
Em meio ao tombo geral, o Claude 4.5 Sonnet Reasoning foi de 34,65 para 36,42 — alta de 1,77 pontos. É a única nota que subiu entre as nove revisadas. Continua sendo o modelo mais caro do grupo, a US$ 6 por milhão de tokens de saída. Para o tipo de tarefa em que reasoning compensa, a nota melhorou; para a fatura, nada mudou.
O que essa reavaliação diz sobre o tabuleiro
Para entender o peso do ajuste, vale olhar quem está no topo hoje e quem está no chão. O catálogo tem mais de 482 modelos listados e 62 criadores diferentes. No topo do índice de inteligência, o Claude Fable 5 lidera com 62,07, seguido do Claude Sonnet 5 (55,26), do GLM 5.2 da Z.ai (52,64), do Gemini 3.1 Pro Preview (47,74) e do Gemini 3.5 Flash (46,67). Os modelos reavaliados hoje estão todos bem abaixo dessa régua — nenhum deles aparece entre os cinco primeiros.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| Claude Sonnet 5 | 55.3 | 10 |
| GLM 5.2 | 52.6 | 3.036 |
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
A leitura prática é simples: a régua mexeu, mas o topo continua o mesmo. Anthropic, Google e Z.ai seguem na frente. OpenAI, Cohere e Alibaba aparecem, mas em outra faixa.
Para quem isso muda a decisão
Se você estava usando GPT-5 mini como "barato que resolve", a nota nova exige uma repescagem: o custo-benefício precisa ser recalculado com 25,3, não com 32,9. Se estava no GPT-5.1 por ser "o topo da OpenAI para tarefas médias", a queda de 2 pontos é marginal mas real — e o preço, US$ 3,4375 por milhão de saída, não acompanhou.
Se estava no Command A+, a nota nova (22,51) reposiciona o modelo na faixa baixa, e a ausência de preço público dificulta a comparação direta. Vale testar alternativas como o GLM 5.2, que está em 52,64 por US$ 3,036 — mais caro, mas em outra prateleira de capacidade.
Se estava no o3-mini (high), a nota de 15,6 por US$ 1,925 é um sinal de alerta: é o modelo mais caro entre os reavaliados de baixo desempenho. Provavelmente não é a melhor escolha hoje.
Se estava no Qwen3 235B Reasoning, a queda para 19,6 mantém o modelo na faixa econômica, mas tira o argumento de "nota surpreendente pelo preço".
E se estava no Claude 4.5 Sonnet Reasoning, a boa notícia: a nota subiu. A má: o preço, US$ 6 por milhão de saída, segue sendo o mais alto do grupo. Para tarefas em que reasoning justifica o custo, a conta ficou um pouco mais favorável.
O que fazer agora
Pegue a planilha de modelos que você roda em produção. Para cada um dos seis que caíram, recalcule o custo por ponto de inteligência usando a nota nova. Se o modelo já não justifica o preço, troque. Se continua justificando, mantenha — mas com a nota certa na cabeça.
A régua mudou. Sua decisão precisa mudar junto.
Recalcule custo por ponto de inteligência dos seis modelos reavaliados antes de renovar qualquer contrato ou pipeline.
Perguntas frequentes
Por que o Artificial Analysis reavaliou nove modelos no mesmo dia?
Reavaliações em lote são comuns quando o método de benchmark muda ou quando há correção de dados antigos. O efeito prático é o mesmo: notas antigas perdem validade e comparações precisam ser refeitas com a régua nova.
O GPT-5 mini ainda vale a pena depois da queda?
Depende do uso. A nota caiu de 32,96 para 25,31, então o argumento de "modelo intermediário barato" enfraqueceu. Para tarefas simples, o preço de US$ 0,6875 por milhão de saída ainda pode compensar; para tarefas que exigem raciocínio, vale olhar alternativas como o GLM 5.2 ou o Gemini 3.5 Flash.
Por que o Claude 4.5 Sonnet Reasoning subiu enquanto todo mundo caiu?
Não há explicação pública para movimentos individuais em reavaliações em lote — pode ser ajuste de método, correção de amostras ou novo conjunto de testes. O fato é que, entre as nove notas revisadas em 2 de julho de 2026, foi a única que subiu, de 34,65 para 36,42.