Quatro modelos do catálogo tiveram a nota de benchmark revisada; um deles caiu quase 26%,Quatro notas de benchmark foram revisadas em um dia: o que muda na sua escolha,Quatro modelos reavaliados: Trinity Large Thinking perdeu 6,3 pontos de IQ,Reavaliação do dia derruba nota do Trinity Large Thinking em quase 26%,Quatro modelos reavaliados pelo Artificial Analysis em 22 de julho de 2026,Trinity Large Thinking cai de 24,5 para 18,2 na reavaliação do Artificial Analysis,Quatro notas de benchmark revisadas: Trinity Large Thinking foi o que mais caiu,Reavaliação do Artificial Analysis mexe em quatro modelos do catálogo,Quatro modelos tiveram a régua de benchmark movida pelo Artificial Analysis,Quatro reavaliações do Artificial Analysis em um só dia: o que muda na sua pilha
Trinity Large Thinking perdeu quase 26% da nota em uma só revisão; Gemma 4 E4B e DeepSeek V4 Flash também foram recalibrados.
A régua se mexeu debaixo de quem já tinha escolhido
Se a sua equipe escolheu modelo olhando uma nota de benchmark em maio ou junho, hoje ela acordou desatualizada. O Artificial Analysis recalibrou quatro modelos do catálogo em um único dia, e a maior vítima foi o Trinity Large Thinking: a nota caiu de 24,465 para 18,16 — uma perda de 6,3 pontos, ou quase 26% do que estava no placar.
Não é ajuste fino. É o tipo de mudança que obriga a repensar se aquela peça ainda cabe no pipeline.
| Modelo | Antes | Depois | Diferença |
|---|---|---|---|
| Trinity Large Thinking | 24.5 | 18.2 | -6.3 |
| Gemma 4 E4B (Reasoning) | 12.5 | 12.2 | -0.3 |
| DeepSeek V4 Flash (Reasoning | 37.4 | 37.5 | +0.1 |
| Gemma 4 E2B (Reasoning) | 9.3 | 9.3 | +0.1 |
O que aconteceu com cada um
Olhando a lista de mudanças, o padrão é claro: três dos quatro modelos são modelos leves, de baixo custo, e a revisão do Artificial Analysis ajustou a régua em magnitudes pequenas — frações de ponto para cima ou para baixo. O destaque negativo, de novo, é o Trinity Large Thinking, que era um modelo intermediário em preço (US$ 0,395 por milhão de tokens de saída) e perdeu quase um quarto da nota de IQ.
Para contextualizar o estrago: o topo do catálogo hoje é o Claude Fable 5, da Anthropic, com 62,073 de IQ e US$ 50 por milhão de tokens de saída. O Trinity Large Thinking, mesmo antes da revisão, já estava longe desse grupo; depois dela, está ainda mais distante. Em outras palavras, a revisão não tirou o modelo do mercado, mas reduziu o argumento a favor dele.
Os outros três ajustes foram marginais:
- Gemma 4 E4B (Reasoning): de 12,496 para 12,211, a US$ 0,04 por milhão de tokens de saída. Variação pequena, mas para baixo.
- DeepSeek V4 Flash (Reasoning, High Effort): de 37,364 para 37,464, a US$ 0,175 por milhão de tokens de saída. Leve alta — o único dos quatro a ganhar nota.
- Gemma 4 E2B (Reasoning): de 9,257 para 9,312. Sem preço publicado pelo catálogo.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| GPT-5.6 Sol | 60.9 | 10 |
| Kimi K3 | 59.7 | 15 |
| GPT-5.6 Terra | 56.6 | 12 |
| Grok 4.5 | 55.8 | 6 |
Por que isso importa para quem paga a conta
Você pode ter escolhido o Trinity Large Thinking porque, no comparativo de custo-benefício do trimestre passado, ele entregava um IQ próximo do DeepSeek V4 Pro (45,268) cobrando uma fração do preço. Esse argumento acabou. Com 18,16, o modelo agora está mais perto da faixa do Gemma 4 E4B — e o Gemma custa quase dez vezes menos por milhão de tokens de saída.
A lição prática: anote a data da nota junto com a escolha. Benchmark é fotografia, não identidade. Quando o catálogo tem 516 modelos ativos de 66 criadores diferentes e 41 lançamentos só nos últimos 30 dias, a régua muda o tempo todo — e quem não revisita o comparativo acaba pagando caro por uma decisão antiga.
Para quem nada muda
Se a sua pilha usa Claude Fable 5, GPT-5.6 Sol, Kimi K3 ou qualquer modelo fora da lista de reavaliação de hoje, não há motivo para mover. A nota deles continua onde estava, e o topo do mercado segue concentrado em modelos que custam entre US$ 6 e US$ 50 por milhão de tokens de saída — longe da briga dos modelos abaixo de 40 de IQ.
Se a sua pilha usa Trinity Large Thinking como peça central, vale rodar o comparativo de novo antes de renovar contrato. E se você tinha descartado o Gemma 4 E2B por causa de uma nota levemente mais baixa, saiba que ele subiu — ainda que pouco.
Quem escolheu Trinity Large Thinking pela nota de IQ precisa revalidar a decisão hoje; a nota caiu quase 26% e o argumento de custo-benefício deixou de existir.
Perguntas frequentes
O que mudou na nota do Trinity Large Thinking?
O Artificial Analysis reduziu a nota de IQ do Trinity Large Thinking de 24,465 para 18,16 em 22 de julho de 2026 — uma queda de 6,3 pontos, ou quase 26% do valor anterior. O preço de US$ 0,395 por milhão de tokens de saída não foi alterado.
Quais outros modelos foram reavaliados no mesmo dia?
Três outros modelos tiveram nota recalibrada: Gemma 4 E4B (Reasoning) caiu de 12,496 para 12,211; DeepSeek V4 Flash (Reasoning, High Effort) subiu de 37,364 para 37,464; e Gemma 4 E2B (Reasoning) subiu de 9,257 para 9,312. Este último não tem preço publicado no catálogo.