FalaVIP IA quinta-feira, 03 de setembro de 2026
Benchmarks

Quatro modelos do catálogo tiveram a nota de benchmark revisada; um deles caiu quase 26%,Quatro notas de benchmark foram revisadas em um dia: o que muda na sua escolha,Quatro modelos reavaliados: Trinity Large Thinking perdeu 6,3 pontos de IQ,Reavaliação do dia derruba nota do Trinity Large Thinking em quase 26%,Quatro modelos reavaliados pelo Artificial Analysis em 22 de julho de 2026,Trinity Large Thinking cai de 24,5 para 18,2 na reavaliação do Artificial Analysis,Quatro notas de benchmark revisadas: Trinity Large Thinking foi o que mais caiu,Reavaliação do Artificial Analysis mexe em quatro modelos do catálogo,Quatro modelos tiveram a régua de benchmark movida pelo Artificial Analysis,Quatro reavaliações do Artificial Analysis em um só dia: o que muda na sua pilha

Trinity Large Thinking perdeu quase 26% da nota em uma só revisão; Gemma 4 E4B e DeepSeek V4 Flash também foram recalibrados.

Redação FalaVIP IA 3 min de leitura
18,16nova nota de IQ do Trinity Large Thinking
US$ 0,395preço por milhão de tokens de saída do Trinity Large Thinking
37,464nova nota de IQ do DeepSeek V4 Flash (Reasoning, High Effort)

A régua se mexeu debaixo de quem já tinha escolhido

Se a sua equipe escolheu modelo olhando uma nota de benchmark em maio ou junho, hoje ela acordou desatualizada. O Artificial Analysis recalibrou quatro modelos do catálogo em um único dia, e a maior vítima foi o Trinity Large Thinking: a nota caiu de 24,465 para 18,16 — uma perda de 6,3 pontos, ou quase 26% do que estava no placar.

Não é ajuste fino. É o tipo de mudança que obriga a repensar se aquela peça ainda cabe no pipeline.

Notas revisadas pelo Artificial Analysis
ModeloAntesDepoisDiferença
Trinity Large Thinking24.518.2-6.3
Gemma 4 E4B (Reasoning)12.512.2-0.3
DeepSeek V4 Flash (Reasoning37.437.5+0.1
Gemma 4 E2B (Reasoning)9.39.3+0.1

O que aconteceu com cada um

Olhando a lista de mudanças, o padrão é claro: três dos quatro modelos são modelos leves, de baixo custo, e a revisão do Artificial Analysis ajustou a régua em magnitudes pequenas — frações de ponto para cima ou para baixo. O destaque negativo, de novo, é o Trinity Large Thinking, que era um modelo intermediário em preço (US$ 0,395 por milhão de tokens de saída) e perdeu quase um quarto da nota de IQ.

Para contextualizar o estrago: o topo do catálogo hoje é o Claude Fable 5, da Anthropic, com 62,073 de IQ e US$ 50 por milhão de tokens de saída. O Trinity Large Thinking, mesmo antes da revisão, já estava longe desse grupo; depois dela, está ainda mais distante. Em outras palavras, a revisão não tirou o modelo do mercado, mas reduziu o argumento a favor dele.

Os outros três ajustes foram marginais:

  • Gemma 4 E4B (Reasoning): de 12,496 para 12,211, a US$ 0,04 por milhão de tokens de saída. Variação pequena, mas para baixo.
  • DeepSeek V4 Flash (Reasoning, High Effort): de 37,364 para 37,464, a US$ 0,175 por milhão de tokens de saída. Leve alta — o único dos quatro a ganhar nota.
  • Gemma 4 E2B (Reasoning): de 9,257 para 9,312. Sem preço publicado pelo catálogo.
O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
GPT-5.6 Sol60.910
Kimi K359.715
GPT-5.6 Terra56.612
Grok 4.555.86
Entre os 516 modelos disponíveis no catálogo nesta data.

Por que isso importa para quem paga a conta

Você pode ter escolhido o Trinity Large Thinking porque, no comparativo de custo-benefício do trimestre passado, ele entregava um IQ próximo do DeepSeek V4 Pro (45,268) cobrando uma fração do preço. Esse argumento acabou. Com 18,16, o modelo agora está mais perto da faixa do Gemma 4 E4B — e o Gemma custa quase dez vezes menos por milhão de tokens de saída.

A lição prática: anote a data da nota junto com a escolha. Benchmark é fotografia, não identidade. Quando o catálogo tem 516 modelos ativos de 66 criadores diferentes e 41 lançamentos só nos últimos 30 dias, a régua muda o tempo todo — e quem não revisita o comparativo acaba pagando caro por uma decisão antiga.

Para quem nada muda

Se a sua pilha usa Claude Fable 5, GPT-5.6 Sol, Kimi K3 ou qualquer modelo fora da lista de reavaliação de hoje, não há motivo para mover. A nota deles continua onde estava, e o topo do mercado segue concentrado em modelos que custam entre US$ 6 e US$ 50 por milhão de tokens de saída — longe da briga dos modelos abaixo de 40 de IQ.

Se a sua pilha usa Trinity Large Thinking como peça central, vale rodar o comparativo de novo antes de renovar contrato. E se você tinha descartado o Gemma 4 E2B por causa de uma nota levemente mais baixa, saiba que ele subiu — ainda que pouco.

Em uma frase

Quem escolheu Trinity Large Thinking pela nota de IQ precisa revalidar a decisão hoje; a nota caiu quase 26% e o argumento de custo-benefício deixou de existir.

Perguntas frequentes

O que mudou na nota do Trinity Large Thinking?

O Artificial Analysis reduziu a nota de IQ do Trinity Large Thinking de 24,465 para 18,16 em 22 de julho de 2026 — uma queda de 6,3 pontos, ou quase 26% do valor anterior. O preço de US$ 0,395 por milhão de tokens de saída não foi alterado.

Quais outros modelos foram reavaliados no mesmo dia?

Três outros modelos tiveram nota recalibrada: Gemma 4 E4B (Reasoning) caiu de 12,496 para 12,211; DeepSeek V4 Flash (Reasoning, High Effort) subiu de 37,364 para 37,464; e Gemma 4 E2B (Reasoning) subiu de 9,257 para 9,312. Este último não tem preço publicado no catálogo.

Leia também