FalaVIP IA quinta-feira, 03 de setembro de 2026
Benchmarks

GPT-5 perde nota no catálogo e cai para 34,7

A régua do Artificial Analysis mexeu em dois modelos hoje: o topo de linha da OpenAI recuou, e um 70B open-weight da Meta subiu.

Redação FalaVIP IA 4 min de leitura
34,71nova nota de IQ do GPT-5 (high)
36,11 → 34,71variação da nota do GPT-5 (high)
9,40nova nota de IQ do Llama 3.3 Instruct 70B

A régua mexeu debaixo de quem já tinha escolhido

Você abriu o painel do Artificial Analysis esperando ver o mesmo número de ontem. Não viu. O GPT-5 (high), da OpenAI, saiu de 36,11 e foi parar em 34,71 — uma queda de quase 1,4 ponto numa única revisão. Em paralelo, o Llama 3.3 Instruct 70B, da Meta, subiu de 8,60 para 9,40. Dois ajustes na mesma data, e nenhum dos dois veio acompanhado de mudança de preço ou de versão.

Notas revisadas pelo Artificial Analysis
ModeloAntesDepoisDiferença
GPT-5 (high)36.134.7-1.4
Llama 3.3 Instruct 70B8.69.4+0.8

O detalhe que incomoda é o método. O catálogo não publicou um comunicado explicando se a nota do GPT-5 caiu porque o teste ficou mais rigoroso, porque a amostra mudou ou porque o modelo foi reponderado. Você só vê o delta. E é exatamente esse delta que aparece na sua planilha de comparação e, em muitos casos, na régua que decide qual modelo entra no seu produto.

O que caiu e o que subiu, em números crus

O GPT-5 (high) continua sendo um modelo caro de operar: US$ 3,44 por milhão de tokens de saída segundo o catálogo. Com a nota revisada para 34,71, ele perde ainda mais distância para o topo da tabela atual, onde aparece Anthropic Claude Fable 5 (62,07) e Claude Sonnet 5 (55,26). Em outras palavras, o buraco entre o flagship da OpenAI e a Anthropic, que já era grande, ficou maior.

O Llama 3.3 Instruct 70B foi na direção oposta: de 8,60 para 9,40, a US$ 0,61 por milhão de tokens de saída. É um modelo de peso aberto, bem mais barato, mas a nota absoluta segue baixa — ele não disputa o topo, disputa o terreno dos modelos utilitários de baixo custo.

Para quem isso muda alguma coisa

Se você roda o GPT-5 (high) em produção e a nota do catálogo entra como critério de governança ou de SLA interno, a revisão de hoje é um sinal para revisitar a documentação. Não porque o modelo ficou pior do que era ontem — ele é o mesmo binário rodando a mesma arquitetura — mas porque o número que você usava para compará-lo com concorrentes mudou sem aviso.

Se você roda o Llama 3.3 Instruct 70B, a boa notícia é puramente estética: 0,8 ponto de IQ a mais não muda o caso de uso típico desse modelo, que continua sendo tarefas simples de classificação, extração e sumarização curta a um custo baixo.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
Claude Sonnet 555.310
GLM 5.252.63.036
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
Entre os 482 modelos disponíveis no catálogo nesta data.

E se você está no meio, comparando GPT-5 (high) com Claude Sonnet 5 ou com Gemini 3.1 Pro Preview? A diferença de nota entre eles já era relevante; agora, ficou mais relevante ainda. Vale rodar sua bateria interna de prompts antes de tomar qualquer decisão.

O que o catálogo não te conta

Três coisas que ficaram de fora da revisão de hoje e que valem ficar de olho.

Primeiro: o método. O Artificial Analysis não publicou, junto com a mudança, qual teste foi reaplicado ou qual janela de amostras entrou no cálculo. Você tem o número novo, mas não tem a história por trás dele.

Segundo: a régua é a mesma para todos. Se o teste ficou mais rigoroso, modelos que não foram revisados hoje podem ser revisados amanhã — e a tabela inteira pode se mover de uma vez.

Terceiro: preço não mudou. O GPT-5 (high) continua em US$ 3,44 por milhão de tokens de saída. A revisão foi só na nota de inteligência. Quem compra por capacidade pura paga o mesmo; quem compra por nota por dólar agora tem um cálculo pior.

O tabuleiro hoje

No snapshot atual, o topo do catálogo segue dominado pela Anthropic: Claude Fable 5 (62,07), Claude Sonnet 5 (55,26), seguidos por Z.ai GLM 5.2 (52,64), Google Gemini 3.1 Pro Preview (47,74) e Gemini 3.5 Flash (46,67). São mais de 482 modelos listados, vindos de 62 criadores diferentes, e 23 foram lançados nos últimos 30 dias. O GPT-5 (high), mesmo com a revisão, não aparece nesse top 5 — e a distância para o quinto lugar é de quase 12 pontos.

O que fazer com isso amanhã de manhã

Se o GPT-5 (high) está no seu stack, rode um conjunto fixo de prompts hoje e guarde os resultados. Quando vier a próxima revisão, você vai ter uma base própria para saber se a nota do catálogo caiu porque o teste ficou mais duro ou porque algo mudou no modelo. Se o Llama 3.3 70B está rodando como classificador barato, ignore a mudança: o caso de uso não muda com 0,8 ponto.

E se você está cotando um modelo novo esta semana, lembre-se: o número que você vê no catálogo hoje é uma fotografia, não um contrato.

Em uma frase

Trate a nota do catálogo como fotografia, não como contrato: rode sua própria bateria antes de trocar de modelo depois de uma revisão.

Perguntas frequentes

O GPT-5 ficou pior hoje?

Não necessariamente. O catálogo revisou a nota de inteligência de 36,11 para 34,71, mas o modelo em si não mudou de versão nem de preço. A régua do Artificial Analysis foi reponderada, e o delta pode refletir o teste, não o binário.

Quanto custa o GPT-5 (high) depois da revisão?

O preço segue em US$ 3,44 por milhão de tokens de saída segundo o catálogo. A revisão de hoje foi apenas na nota de IQ, não no preço.

O Llama 3.3 70B da Meta melhorou de verdade?

A nota subiu de 8,60 para 9,40, mas o modelo continua sendo um utilitário de baixo custo, a US$ 0,61 por milhão de tokens de saída. Para tarefas simples, o ganho é marginal; para qualquer coisa mais exigente, ele segue fora do jogo.

Leia também