Benchmarks
40 reportagens de benchmarks sobre modelos de inteligência artificial.
LongCat 2.0 estreia no índice com IQ 33 e sem preço publicado
Modelo chinês entra na régua da Artificial Analysis abaixo da linha dos 45 e sem valor de API divulgado — fica difícil comparar o que não tem cotação.
Hy3-preview estreia abaixo da régua mínima do índice
Novo modelo de raciocínio entra hoje no catálogo da Artificial Analysis com IQ 33,6 e preço de US$ 4,40 por milhão de saída — longe do topo e abaixo do piso competitivo.
Muse Spark 1.1 estreia a US$ 2 com IQ 50; GLM-5.2 fica abaixo da régua
Os dois modelos que entraram hoje no Artificial Analysis. Um compete na faixa dos mais baratos com IQ acima de 50; o outro cobra mais caro e pontua menos que alternativas abaixo de US$ 2.
Dois modelos abertos perdem nota de inteligência na régua de julho
Gemma 4 31B e MiMo-V2.5 caem cerca de 3 pontos no índice do catálogo; o preço não mudou e o custo-benefício continua de pé.
KAT Coder Pro estreia a US$ 0,53 por milhão de saída
Três modelos entraram hoje no índice da Artificial Analysis; o mais barato sai a US$ 0,53 por milhão — e o IQ fica abaixo de 36.
Seis modelos tiveram a nota mexida — e dois deles você provavelmente já usa
Reavaliação do Artificial Analysis reposiciona Phi-4 Mini, Ling 2.6 Flash e Kimi K2.6; para quem escolheu pelo preço, a régua mudou.
GPT-5 perde nota e Llama 70B sobe na régua de julho
Artificial Analysis reavalia dois modelos no mesmo dia: o topo de linha da OpenAI cai quase 1,4 ponto de IQ, e o open-weight da Meta ganha fôlego.
GPT-5 perde nota no catálogo e cai para 34,7
A régua do Artificial Analysis mexeu em dois modelos hoje: o topo de linha da OpenAI recuou, e um 70B open-weight da Meta subiu.
Vinte e três modelos entram hoje no índice; o melhor deles cravou IQ 21
Os seis estreantes com ficha detalhada ficam entre IQ 10 e 21, longe do líder Anthropic Claude Fable 5 em IQ 62. Maioria é gratuita ou nem tem preço publicado.
Seis modelos do catálogo perderam nota de benchmark hoje
Quatro caíram, dois subiram e ninguém te avisou: o que muda na sua fila de produção depois da reavaliação do Artificial Analysis
Seis modelos perdem nota no mesmo dia e a régua muda
Reavaliação do Artificial Analysis derruba GPT-5 mini, Command A+, o3-mini e outros; só Claude 4.5 Sonnet sobe.
Cinco SKUs do Sonnet 5 Adaptive Reasoning cobram US$ 6/M, só um tem nota
O índice do Artificial Analysis só cravou IQ para a variante Max Effort — 53,35, abaixo do Sonnet 5 padrão (55,26) que custa US$ 10/M.
Cinco modelos estreiam no índice, e o mais barato deles custa US$ 11,25
GPT-5.5 Instant e quatro variantes do K2 entram hoje na régua do Artificial Analysis, todas abaixo da marca de IQ 30.
Gemma 3 27B saltou de 4,7 para 7,4 de IQ — o que muda na sua fila
Reavaliação do Artificial Analysis reposiciona o modelo aberto do Google e mexe com quem já tinha escolhido pelo preço.
Cinco modelos reavaliados hoje, quatro perderam nota
Só o MiMo-V2-Flash subiu na revisão do catálogo; Gemini 2.5 Pro, Magistral e Nova Lite saíram mais fracos sem mudar de versão.
Cinco modelos tiveram nota revisada hoje — e o Nemotron caiu
Devstral 2 e os três Ministral 3 subiram no índice; o Nemotron 3 Nano perdeu quase 20% da nota. A régua mexeu debaixo de quem já tinha comparado.
Nex-N2-Pro estreia a US$ 1 por milhão, mas fica abaixo da régua IQ 45
O novo modelo do índice da Artificial Analysis cobra menos que o mínimo da faixa 'esmart' — e é exatamente isso que define onde ele serve.
Grok Build 0.1 entra no índice com IQ 39,8 — 36% abaixo do topo
O modelo da xAI estreia hoje no Artificial Analysis custando US$ 1,25 por milhão de tokens de saída, mas fica longe da régua dos melhores e até dos mais baratos acima de IQ 45.
Dois modelos perdem nota no catálogo e a conta não muda
Nova 2.0 Pro Preview e Mistral Large 3 tiveram o IQ reavaliado para baixo pelo Artificial Analysis — o que mexe com quem já tinha escolhido por capacidade, não por preço.
GPT-5.5 sobe de nota em três variantes no mesmo dia e ninguém mexeu no preço
A OpenAI não lançou nada novo: a régua do Artificial Analysis se mexeu e três versões do GPT-5.5 ficaram mais inteligentes no papel — sem mudar o que você paga.