FalaVIP IA sexta-feira, 04 de setembro de 2026

Benchmarks

40 reportagens de benchmarks sobre modelos de inteligência artificial.

Benchmarks

LongCat 2.0 estreia no índice com IQ 33 e sem preço publicado

Modelo chinês entra na régua da Artificial Analysis abaixo da linha dos 45 e sem valor de API divulgado — fica difícil comparar o que não tem cotação.

Benchmarks

Hy3-preview estreia abaixo da régua mínima do índice

Novo modelo de raciocínio entra hoje no catálogo da Artificial Analysis com IQ 33,6 e preço de US$ 4,40 por milhão de saída — longe do topo e abaixo do piso competitivo.

Benchmarks

Muse Spark 1.1 estreia a US$ 2 com IQ 50; GLM-5.2 fica abaixo da régua

Os dois modelos que entraram hoje no Artificial Analysis. Um compete na faixa dos mais baratos com IQ acima de 50; o outro cobra mais caro e pontua menos que alternativas abaixo de US$ 2.

Benchmarks

Dois modelos abertos perdem nota de inteligência na régua de julho

Gemma 4 31B e MiMo-V2.5 caem cerca de 3 pontos no índice do catálogo; o preço não mudou e o custo-benefício continua de pé.

Benchmarks

KAT Coder Pro estreia a US$ 0,53 por milhão de saída

Três modelos entraram hoje no índice da Artificial Analysis; o mais barato sai a US$ 0,53 por milhão — e o IQ fica abaixo de 36.

Benchmarks

Seis modelos tiveram a nota mexida — e dois deles você provavelmente já usa

Reavaliação do Artificial Analysis reposiciona Phi-4 Mini, Ling 2.6 Flash e Kimi K2.6; para quem escolheu pelo preço, a régua mudou.

Benchmarks

GPT-5 perde nota e Llama 70B sobe na régua de julho

Artificial Analysis reavalia dois modelos no mesmo dia: o topo de linha da OpenAI cai quase 1,4 ponto de IQ, e o open-weight da Meta ganha fôlego.

Benchmarks

GPT-5 perde nota no catálogo e cai para 34,7

A régua do Artificial Analysis mexeu em dois modelos hoje: o topo de linha da OpenAI recuou, e um 70B open-weight da Meta subiu.

Benchmarks

Vinte e três modelos entram hoje no índice; o melhor deles cravou IQ 21

Os seis estreantes com ficha detalhada ficam entre IQ 10 e 21, longe do líder Anthropic Claude Fable 5 em IQ 62. Maioria é gratuita ou nem tem preço publicado.

Benchmarks

Seis modelos do catálogo perderam nota de benchmark hoje

Quatro caíram, dois subiram e ninguém te avisou: o que muda na sua fila de produção depois da reavaliação do Artificial Analysis

Benchmarks

Seis modelos perdem nota no mesmo dia e a régua muda

Reavaliação do Artificial Analysis derruba GPT-5 mini, Command A+, o3-mini e outros; só Claude 4.5 Sonnet sobe.

Benchmarks

Cinco SKUs do Sonnet 5 Adaptive Reasoning cobram US$ 6/M, só um tem nota

O índice do Artificial Analysis só cravou IQ para a variante Max Effort — 53,35, abaixo do Sonnet 5 padrão (55,26) que custa US$ 10/M.

Benchmarks

Cinco modelos estreiam no índice, e o mais barato deles custa US$ 11,25

GPT-5.5 Instant e quatro variantes do K2 entram hoje na régua do Artificial Analysis, todas abaixo da marca de IQ 30.

Benchmarks

Gemma 3 27B saltou de 4,7 para 7,4 de IQ — o que muda na sua fila

Reavaliação do Artificial Analysis reposiciona o modelo aberto do Google e mexe com quem já tinha escolhido pelo preço.

Benchmarks

Cinco modelos reavaliados hoje, quatro perderam nota

Só o MiMo-V2-Flash subiu na revisão do catálogo; Gemini 2.5 Pro, Magistral e Nova Lite saíram mais fracos sem mudar de versão.

Benchmarks

Cinco modelos tiveram nota revisada hoje — e o Nemotron caiu

Devstral 2 e os três Ministral 3 subiram no índice; o Nemotron 3 Nano perdeu quase 20% da nota. A régua mexeu debaixo de quem já tinha comparado.

Benchmarks

Nex-N2-Pro estreia a US$ 1 por milhão, mas fica abaixo da régua IQ 45

O novo modelo do índice da Artificial Analysis cobra menos que o mínimo da faixa 'esmart' — e é exatamente isso que define onde ele serve.

Benchmarks

Grok Build 0.1 entra no índice com IQ 39,8 — 36% abaixo do topo

O modelo da xAI estreia hoje no Artificial Analysis custando US$ 1,25 por milhão de tokens de saída, mas fica longe da régua dos melhores e até dos mais baratos acima de IQ 45.

Benchmarks

Dois modelos perdem nota no catálogo e a conta não muda

Nova 2.0 Pro Preview e Mistral Large 3 tiveram o IQ reavaliado para baixo pelo Artificial Analysis — o que mexe com quem já tinha escolhido por capacidade, não por preço.

Benchmarks

GPT-5.5 sobe de nota em três variantes no mesmo dia e ninguém mexeu no preço

A OpenAI não lançou nada novo: a régua do Artificial Analysis se mexeu e três versões do GPT-5.5 ficaram mais inteligentes no papel — sem mudar o que você paga.

← anteriores página 2 de 2