Seis modelos do catálogo perderam nota de benchmark hoje
Quatro caíram, dois subiram e ninguém te avisou: o que muda na sua fila de produção depois da reavaliação do Artificial Analysis
Você escolheu modelo pelo benchmark. Agora o benchmark mudou sem mudar o modelo. Em uma única rodada de reavaliação publicada hoje, o Artificial Analysis recalibrou a régua de seis nomes do catálogo — e quatro deles saíram pior do que estavam.
O estrago do lado barato
O caso mais gritante é o do GPT-5 mini (high): foi de 32,956 para 25,305. São quase 8 pontos a menos sem que a OpenAI tenha tocado em uma linha de peso. Quem pagava US$ 0,6875 por milhão de tokens de saída acreditando estar levando um modelo "médio" agora está levando, pela régua nova, um modelo que disputa a faixa dos 25 pontos — território que, até ontem, era ocupado por opções claramente inferiores.
Logo atrás vem o Command A+, da Cohere: de 29,291 para 22,51. Pior: o catálogo não informa preço público para esse modelo, então não dá nem para calcular se a queda veio acompanhada de algum desconto que justifique.
E o o3-mini (high), da OpenAI, caiu de 18,384 para 15,641. Continua sendo um modelo de raciocínio barato — US$ 1,925 por milhão de tokens de saída —, mas a nota nova o coloca ainda mais distante do pelotão intermediário.
| Modelo | Antes | Depois | Diferença |
|---|---|---|---|
| GPT-5 mini (high) | 33.0 | 25.3 | -7.7 |
| Command A+ | 29.3 | 22.5 | -6.8 |
| o3-mini (high) | 18.4 | 15.6 | -2.7 |
| Qwen3 235B A22B 2507 (Reason | 22.3 | 19.6 | -2.7 |
| GPT-5.1 (high) | 38.9 | 36.9 | -2.0 |
| Claude 4.5 Sonnet (Reasoning | 34.7 | 36.4 | +1.8 |
O estrago do lado caro
A reavaliação também pegou o Qwen3 235B A22B 2507 (Reasoning), da Alibaba: de 22,341 para 19,608, a US$ 0,8375 por milhão de tokens de saída. E o GPT-5.1 (high) perdeu 2 pontos — de 38,914 para 36,874 —, cobrado a US$ 3,4375. Não é desastre, mas é o tipo de variação que faz um relatório técnico interno parar de bater com a planilha de custo-benefício.
O caso estranho: quem subiu
Nem todo mundo perdeu. O Claude 4.5 Sonnet (Reasoning), da Anthropic, foi de 34,653 para 36,42. É a única alta relevante da rodada e acontece no modelo mais caro da lista: US$ 6 por milhão de tokens de saída. Em outras palavras, a Anthropic não ficou mais barata — ficou mais cara por ponto de benchmark.
Para situar o que esses números significam hoje, vale olhar o topo do catálogo: o Claude Fable 5 lidera com IQ 62,073 a US$ 50 por milhão de tokens de saída, seguido do Claude Sonnet 5 (55,261 a US$ 10) e do GLM 5.2, da Z.ai (52,641 a US$ 3,036). Os modelos reavaliados hoje estão todos abaixo dessa fronteira.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| Claude Sonnet 5 | 55.3 | 10 |
| GLM 5.2 | 52.6 | 3.036 |
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
Para quem isso muda alguma coisa
Se você roda o GPT-5 mini em produção porque ele "passava" num corte interno de qualidade, vale rodar de novo. A nota caiu, e a régua é a mesma que o mercado inteiro usa para comparar — então o seu concorrente que olha o mesmo número vai te enxergar pior.
Se você usa o Command A+ por contrato ou por integração com stack da Cohere, a queda não muda a decisão técnica, mas muda a defesa do projeto: você vai precisar explicar por que paga (ou deixa de pagar) por um modelo que, pela régua atual, está abaixo de alternativas de preço parecido.
Se você está avaliando o Claude 4.5 Sonnet Reasoning, a alta reforça o argumento de quem já defendia o modelo — mas a US$ 6 por milhão de tokens de saída, ele continua sendo um produto premium. A nota subiu, a conta também.
E se nenhum desses seis nomes está na sua fila: pode seguir sem mexer em nada. A reavaliação de hoje mexeu na régua, não no seu deploy.
O que fazer agora
Três passos antes do fim do dia: revise a planilha de custo por ponto de IQ, rode os prompts de regressão que você já tem contra os modelos reavaliados, e separe os casos em que a nota cai mas o preço também caiu (não há nenhum nessa rodada) daqueles em que a nota cai e o preço fica parado. É esse segundo grupo que precisa de substituição imediata.
Reveja hoje mesmo qualquer fila de produção que dependa de GPT-5 mini, Command A+ ou o3-mini — a régua mudou e a nota nova coloca esses modelos numa faixa que não justifica mais o lugar que ocupavam.
Perguntas frequentes
O que é uma reavaliação de benchmark?
É quando o laboratório que mede inteligência dos modelos (no caso, o Artificial Analysis) recalcula as notas usando uma versão atualizada da metodologia ou dos testes. O modelo em si não mudou — o que mudou foi a régua usada para compará-lo.
Por que o GPT-5 mini caiu tanto de uma vez?
A nota caiu de 32,956 para 25,305, uma diferença de 7,65 pontos. Como o modelo não foi alterado, a causa mais provável é uma mudança na metodologia de avaliação que penalizou o tipo de raciocínio em que o GPT-5 mini se apoiava.
Devo trocar de modelo por causa da reavaliação?
Só se o modelo reavaliado estiver na sua fila de produção. Se você usa o GPT-5 mini ou o Command A+ em algo crítico, vale rodar os testes de regressão hoje. Se nenhum dos seis nomes está no seu stack, ignore a rodada.