FalaVIP IA quinta-feira, 03 de setembro de 2026
Benchmarks

Seis modelos do catálogo perderam nota de benchmark hoje

Quatro caíram, dois subiram e ninguém te avisou: o que muda na sua fila de produção depois da reavaliação do Artificial Analysis

Redação FalaVIP IA 3 min de leitura
-7,65 pontosqueda do GPT-5 mini (32,956 → 25,305)
+1,77 pontoalta do Claude 4.5 Sonnet Reasoning (34,653 → 36,42)
US$ 6,00preço por milhão de tokens de saída do Claude 4.5 Sonnet Reasoning

Você escolheu modelo pelo benchmark. Agora o benchmark mudou sem mudar o modelo. Em uma única rodada de reavaliação publicada hoje, o Artificial Analysis recalibrou a régua de seis nomes do catálogo — e quatro deles saíram pior do que estavam.

O estrago do lado barato

O caso mais gritante é o do GPT-5 mini (high): foi de 32,956 para 25,305. São quase 8 pontos a menos sem que a OpenAI tenha tocado em uma linha de peso. Quem pagava US$ 0,6875 por milhão de tokens de saída acreditando estar levando um modelo "médio" agora está levando, pela régua nova, um modelo que disputa a faixa dos 25 pontos — território que, até ontem, era ocupado por opções claramente inferiores.

Logo atrás vem o Command A+, da Cohere: de 29,291 para 22,51. Pior: o catálogo não informa preço público para esse modelo, então não dá nem para calcular se a queda veio acompanhada de algum desconto que justifique.

E o o3-mini (high), da OpenAI, caiu de 18,384 para 15,641. Continua sendo um modelo de raciocínio barato — US$ 1,925 por milhão de tokens de saída —, mas a nota nova o coloca ainda mais distante do pelotão intermediário.

Notas revisadas pelo Artificial Analysis
ModeloAntesDepoisDiferença
GPT-5 mini (high)33.025.3-7.7
Command A+29.322.5-6.8
o3-mini (high)18.415.6-2.7
Qwen3 235B A22B 2507 (Reason22.319.6-2.7
GPT-5.1 (high)38.936.9-2.0
Claude 4.5 Sonnet (Reasoning34.736.4+1.8

O estrago do lado caro

A reavaliação também pegou o Qwen3 235B A22B 2507 (Reasoning), da Alibaba: de 22,341 para 19,608, a US$ 0,8375 por milhão de tokens de saída. E o GPT-5.1 (high) perdeu 2 pontos — de 38,914 para 36,874 —, cobrado a US$ 3,4375. Não é desastre, mas é o tipo de variação que faz um relatório técnico interno parar de bater com a planilha de custo-benefício.

O caso estranho: quem subiu

Nem todo mundo perdeu. O Claude 4.5 Sonnet (Reasoning), da Anthropic, foi de 34,653 para 36,42. É a única alta relevante da rodada e acontece no modelo mais caro da lista: US$ 6 por milhão de tokens de saída. Em outras palavras, a Anthropic não ficou mais barata — ficou mais cara por ponto de benchmark.

Para situar o que esses números significam hoje, vale olhar o topo do catálogo: o Claude Fable 5 lidera com IQ 62,073 a US$ 50 por milhão de tokens de saída, seguido do Claude Sonnet 5 (55,261 a US$ 10) e do GLM 5.2, da Z.ai (52,641 a US$ 3,036). Os modelos reavaliados hoje estão todos abaixo dessa fronteira.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
Claude Sonnet 555.310
GLM 5.252.63.036
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
Entre os 482 modelos disponíveis no catálogo nesta data.

Para quem isso muda alguma coisa

Se você roda o GPT-5 mini em produção porque ele "passava" num corte interno de qualidade, vale rodar de novo. A nota caiu, e a régua é a mesma que o mercado inteiro usa para comparar — então o seu concorrente que olha o mesmo número vai te enxergar pior.

Se você usa o Command A+ por contrato ou por integração com stack da Cohere, a queda não muda a decisão técnica, mas muda a defesa do projeto: você vai precisar explicar por que paga (ou deixa de pagar) por um modelo que, pela régua atual, está abaixo de alternativas de preço parecido.

Se você está avaliando o Claude 4.5 Sonnet Reasoning, a alta reforça o argumento de quem já defendia o modelo — mas a US$ 6 por milhão de tokens de saída, ele continua sendo um produto premium. A nota subiu, a conta também.

E se nenhum desses seis nomes está na sua fila: pode seguir sem mexer em nada. A reavaliação de hoje mexeu na régua, não no seu deploy.

O que fazer agora

Três passos antes do fim do dia: revise a planilha de custo por ponto de IQ, rode os prompts de regressão que você já tem contra os modelos reavaliados, e separe os casos em que a nota cai mas o preço também caiu (não há nenhum nessa rodada) daqueles em que a nota cai e o preço fica parado. É esse segundo grupo que precisa de substituição imediata.

Em uma frase

Reveja hoje mesmo qualquer fila de produção que dependa de GPT-5 mini, Command A+ ou o3-mini — a régua mudou e a nota nova coloca esses modelos numa faixa que não justifica mais o lugar que ocupavam.

Perguntas frequentes

O que é uma reavaliação de benchmark?

É quando o laboratório que mede inteligência dos modelos (no caso, o Artificial Analysis) recalcula as notas usando uma versão atualizada da metodologia ou dos testes. O modelo em si não mudou — o que mudou foi a régua usada para compará-lo.

Por que o GPT-5 mini caiu tanto de uma vez?

A nota caiu de 32,956 para 25,305, uma diferença de 7,65 pontos. Como o modelo não foi alterado, a causa mais provável é uma mudança na metodologia de avaliação que penalizou o tipo de raciocínio em que o GPT-5 mini se apoiava.

Devo trocar de modelo por causa da reavaliação?

Só se o modelo reavaliado estiver na sua fila de produção. Se você usa o GPT-5 mini ou o Command A+ em algo crítico, vale rodar os testes de regressão hoje. Se nenhum dos seis nomes está no seu stack, ignore a rodada.

Leia também