GPT-5 perde nota no catálogo e cai para 34,7
A régua do Artificial Analysis mexeu em dois modelos hoje: o topo de linha da OpenAI recuou, e um 70B open-weight da Meta subiu.
A régua mexeu debaixo de quem já tinha escolhido
Você abriu o painel do Artificial Analysis esperando ver o mesmo número de ontem. Não viu. O GPT-5 (high), da OpenAI, saiu de 36,11 e foi parar em 34,71 — uma queda de quase 1,4 ponto numa única revisão. Em paralelo, o Llama 3.3 Instruct 70B, da Meta, subiu de 8,60 para 9,40. Dois ajustes na mesma data, e nenhum dos dois veio acompanhado de mudança de preço ou de versão.
| Modelo | Antes | Depois | Diferença |
|---|---|---|---|
| GPT-5 (high) | 36.1 | 34.7 | -1.4 |
| Llama 3.3 Instruct 70B | 8.6 | 9.4 | +0.8 |
O detalhe que incomoda é o método. O catálogo não publicou um comunicado explicando se a nota do GPT-5 caiu porque o teste ficou mais rigoroso, porque a amostra mudou ou porque o modelo foi reponderado. Você só vê o delta. E é exatamente esse delta que aparece na sua planilha de comparação e, em muitos casos, na régua que decide qual modelo entra no seu produto.
O que caiu e o que subiu, em números crus
O GPT-5 (high) continua sendo um modelo caro de operar: US$ 3,44 por milhão de tokens de saída segundo o catálogo. Com a nota revisada para 34,71, ele perde ainda mais distância para o topo da tabela atual, onde aparece Anthropic Claude Fable 5 (62,07) e Claude Sonnet 5 (55,26). Em outras palavras, o buraco entre o flagship da OpenAI e a Anthropic, que já era grande, ficou maior.
O Llama 3.3 Instruct 70B foi na direção oposta: de 8,60 para 9,40, a US$ 0,61 por milhão de tokens de saída. É um modelo de peso aberto, bem mais barato, mas a nota absoluta segue baixa — ele não disputa o topo, disputa o terreno dos modelos utilitários de baixo custo.
Para quem isso muda alguma coisa
Se você roda o GPT-5 (high) em produção e a nota do catálogo entra como critério de governança ou de SLA interno, a revisão de hoje é um sinal para revisitar a documentação. Não porque o modelo ficou pior do que era ontem — ele é o mesmo binário rodando a mesma arquitetura — mas porque o número que você usava para compará-lo com concorrentes mudou sem aviso.
Se você roda o Llama 3.3 Instruct 70B, a boa notícia é puramente estética: 0,8 ponto de IQ a mais não muda o caso de uso típico desse modelo, que continua sendo tarefas simples de classificação, extração e sumarização curta a um custo baixo.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| Claude Sonnet 5 | 55.3 | 10 |
| GLM 5.2 | 52.6 | 3.036 |
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
E se você está no meio, comparando GPT-5 (high) com Claude Sonnet 5 ou com Gemini 3.1 Pro Preview? A diferença de nota entre eles já era relevante; agora, ficou mais relevante ainda. Vale rodar sua bateria interna de prompts antes de tomar qualquer decisão.
O que o catálogo não te conta
Três coisas que ficaram de fora da revisão de hoje e que valem ficar de olho.
Primeiro: o método. O Artificial Analysis não publicou, junto com a mudança, qual teste foi reaplicado ou qual janela de amostras entrou no cálculo. Você tem o número novo, mas não tem a história por trás dele.
Segundo: a régua é a mesma para todos. Se o teste ficou mais rigoroso, modelos que não foram revisados hoje podem ser revisados amanhã — e a tabela inteira pode se mover de uma vez.
Terceiro: preço não mudou. O GPT-5 (high) continua em US$ 3,44 por milhão de tokens de saída. A revisão foi só na nota de inteligência. Quem compra por capacidade pura paga o mesmo; quem compra por nota por dólar agora tem um cálculo pior.
O tabuleiro hoje
No snapshot atual, o topo do catálogo segue dominado pela Anthropic: Claude Fable 5 (62,07), Claude Sonnet 5 (55,26), seguidos por Z.ai GLM 5.2 (52,64), Google Gemini 3.1 Pro Preview (47,74) e Gemini 3.5 Flash (46,67). São mais de 482 modelos listados, vindos de 62 criadores diferentes, e 23 foram lançados nos últimos 30 dias. O GPT-5 (high), mesmo com a revisão, não aparece nesse top 5 — e a distância para o quinto lugar é de quase 12 pontos.
O que fazer com isso amanhã de manhã
Se o GPT-5 (high) está no seu stack, rode um conjunto fixo de prompts hoje e guarde os resultados. Quando vier a próxima revisão, você vai ter uma base própria para saber se a nota do catálogo caiu porque o teste ficou mais duro ou porque algo mudou no modelo. Se o Llama 3.3 70B está rodando como classificador barato, ignore a mudança: o caso de uso não muda com 0,8 ponto.
E se você está cotando um modelo novo esta semana, lembre-se: o número que você vê no catálogo hoje é uma fotografia, não um contrato.
Trate a nota do catálogo como fotografia, não como contrato: rode sua própria bateria antes de trocar de modelo depois de uma revisão.
Perguntas frequentes
O GPT-5 ficou pior hoje?
Não necessariamente. O catálogo revisou a nota de inteligência de 36,11 para 34,71, mas o modelo em si não mudou de versão nem de preço. A régua do Artificial Analysis foi reponderada, e o delta pode refletir o teste, não o binário.
Quanto custa o GPT-5 (high) depois da revisão?
O preço segue em US$ 3,44 por milhão de tokens de saída segundo o catálogo. A revisão de hoje foi apenas na nota de IQ, não no preço.
O Llama 3.3 70B da Meta melhorou de verdade?
A nota subiu de 8,60 para 9,40, mas o modelo continua sendo um utilitário de baixo custo, a US$ 0,61 por milhão de tokens de saída. Para tarefas simples, o ganho é marginal; para qualquer coisa mais exigente, ele segue fora do jogo.