FalaVIP IA quinta-feira, 03 de setembro de 2026
Benchmarks

GPT-5 perde nota e Llama 70B sobe na régua de julho

Artificial Analysis reavalia dois modelos no mesmo dia: o topo de linha da OpenAI cai quase 1,4 ponto de IQ, e o open-weight da Meta ganha fôlego.

Redação FalaVIP IA 3 min de leitura
34,713novo IQ do GPT-5 (high)
9,403novo IQ do Llama 3.3 Instruct 70B
US$ 3,44por milhão de tokens de saída do GPT-5

A régua se mexeu e ninguém te avisou

Você abriu o painel do seu provedor de LLM ontem, escolheu o modelo pela nota de inteligência que viu pela última vez, e seguiu a vida. Hoje, essa nota pode não ser a mesma. Foi o que aconteceu com dois modelos revisados pelo Artificial Analysis no mesmo dia: o GPT-5 (high) perdeu quase 1,4 ponto de IQ e o Llama 3.3 Instruct 70B ganhou 0,8.

Parece pouco. Não é. Se você compara modelos pelo número de IQ para decidir o que entra em produção, qualquer movimento de mais de um ponto muda a ordem da fila.

Notas revisadas pelo Artificial Analysis
ModeloAntesDepoisDiferença
GPT-5 (high)36.134.7-1.4
Llama 3.3 Instruct 70B8.69.4+0.8

O que aconteceu com o GPT-5

O GPT-5 (high) saiu de 36,11 e foi para 34,713. É a primeira leitura que coloca o modelo da OpenAI abaixo dos 35. O preço continua o mesmo da última medição: US$ 3,4375 por milhão de tokens de saída. Nenhuma mudança de preço, só de régua.

O detalhe que incomoda é justamente esse: você não está pagando menos, está recebendo menos pelo mesmo dinheiro. Para quem usa GPT-5 em tarefas onde a nota era o argumento de venda — classificação, extração, raciocínio curto — vale revisitar o caderno de prompts e ver se ainda compensa.

O que aconteceu com o Llama 3.3 Instruct 70B

Na outra ponta, o Llama 3.3 Instruct 70B subiu de 8,595 para 9,403. Continua longe do topo — o catálogo tem hoje mais de 482 modelos listados e o líder, Claude Fable 5, marca 62,073 — mas é um open-weight da Meta a US$ 0,6125 por milhão de tokens de saída. Cinco vezes mais barato que o GPT-5.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
Claude Sonnet 555.310
GLM 5.252.63.036
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
Entre os 482 modelos disponíveis no catálogo nesta data.

Para quem roda Llama em self-host ou via provedores compatíveis, a régua subiu e a conta não mexeu. Para quem já tinha descartado o modelo por causa da nota antiga, vale uma segunda olhada.

Para quem isso muda algo

Se você usa GPT-5 em produção e paga a conta: a nota caiu, o preço não. Antes de migrar, compare com o segundo lugar da OpenAI na sua lista interna — reavaliar não significa trocar, significa rebalancear. Para workloads que já estavam no limite da tolerância a erro, um corte de 1,4 ponto pode ser o suficiente para trocar pelo Sonnet 5 ou pelo GLM 5.2, que custam US$ 10 e US$ 3,036 por milhão de tokens de saída respectivamente.

Se você usa Llama 3.3 70B: a régua subiu e o preço ficou. É a combinação que todo mundo quer ver no catálogo. Vale testar em tarefas onde o modelo tinha ficado abaixo do corte.

Se você não usa nenhum dos dois: o episódio serve de lembrete. Benchmark é fotografia, não documento. O número que você viu no mês passado pode já não ser o mesmo. Quem decide modelo pela nota precisa de uma rotina — semanal, quinzenal, alguma — para puxar a régua atualizada antes de fechar o próximo ciclo.

O tabuleiro em 4 de julho de 2026

O topo do catálogo segue com Anthropic na frente: Claude Fable 5 (IQ 62,073) e Claude Sonnet 5 (55,261). Logo atrás vem o Z.ai GLM 5.2, da China, com 52,641 e preço de US$ 3,036 por milhão de tokens de saída — a melhor relação custo-desempenho entre os modelos acima de IQ 50. Google aparece em quarto e quinto com Gemini 3.1 Pro Preview (47,738) e Gemini 3.5 Flash (46,673). O catálogo tem mais de 482 modelos ativos de 62 criadores diferentes, e 23 foram lançados nos últimos 30 dias.

A régua mexeu em dois. O resto do tabuleiro, por enquanto, ficou onde estava.

Em uma frase

Reavalie o GPT-5 e o Llama 3.3 70B no seu próximo ciclo de escolha: a nota mudou, o preço não, e a ordem da fila pode já não ser a mesma.

Perguntas frequentes

O GPT-5 ficou mais barato depois da reavaliação?

Não. O preço continua em US$ 3,4375 por milhão de tokens de saída. O que mudou foi só a nota de IQ, que caiu de 36,11 para 34,713.

Qual é a diferença de preço entre GPT-5 e Llama 3.3 70B hoje?

O GPT-5 (high) custa US$ 3,4375 por milhão de tokens de saída. O Llama 3.3 Instruct 70B custa US$ 0,6125 — cerca de cinco vezes mais barato.

Quem lidera o ranking de IQ agora?

O Claude Fable 5, da Anthropic, com IQ 62,073, seguido pelo Claude Sonnet 5 (55,261) e pelo Z.ai GLM 5.2 (52,641).

Leia também

Benchmarks

GPT-5 perde nota no catálogo e cai para 34,7

A régua do Artificial Analysis mexeu em dois modelos hoje: o topo de linha da OpenAI recuou, e um 70B open-weight da Meta subiu.

Benchmarks

Seis modelos perdem nota no mesmo dia e a régua muda

Reavaliação do Artificial Analysis derruba GPT-5 mini, Command A+, o3-mini e outros; só Claude 4.5 Sonnet sobe.

Benchmarks

GPT-5.5 sobe de nota em três variantes no mesmo dia e ninguém mexeu no preço

A OpenAI não lançou nada novo: a régua do Artificial Analysis se mexeu e três versões do GPT-5.5 ficaram mais inteligentes no papel — sem mudar o que você paga.

Benchmarks

Quatro modelos do catálogo tiveram a nota de benchmark revisada; um deles caiu quase 26%,Quatro notas de benchmark foram revisadas em um dia: o que muda na sua escolha,Quatro modelos reavaliados: Trinity Large Thinking perdeu 6,3 pontos de IQ,Reavaliação do dia derruba nota do Trinity Large Thinking em quase 26%,Quatro modelos reavaliados pelo Artificial Analysis em 22 de julho de 2026,Trinity Large Thinking cai de 24,5 para 18,2 na reavaliação do Artificial Analysis,Quatro notas de benchmark revisadas: Trinity Large Thinking foi o que mais caiu,Reavaliação do Artificial Analysis mexe em quatro modelos do catálogo,Quatro modelos tiveram a régua de benchmark movida pelo Artificial Analysis,Quatro reavaliações do Artificial Analysis em um só dia: o que muda na sua pilha

Trinity Large Thinking perdeu quase 26% da nota em uma só revisão; Gemma 4 E4B e DeepSeek V4 Flash também foram recalibrados.