Vinte e três modelos entram hoje no índice; o melhor deles cravou IQ 21
Os seis estreantes com ficha detalhada ficam entre IQ 10 e 21, longe do líder Anthropic Claude Fable 5 em IQ 62. Maioria é gratuita ou nem tem preço publicado.
A régua e os novatos
Hoje a Artificial Analysis abriu espaço para mais 23 modelos no índice — mas só seis ganharam ficha completa com preço e desempenho. Entre esses seis, o melhor é o Apriel-v1.5-15B-Thinker, com IQ 21,234. O pior, Hermes 4 - Llama-3.1 70B (Reasoning), cravou IQ 9,97. A distância até o líder do dia, Anthropic Claude Fable 5 em IQ 62,073, passa dos 50 pontos.
Em outras palavras: o topo do mercado continua intocado, e os estreantes detalhados de hoje chegam todos num andar de IQ entre 10 e 22. Para quem paga a conta da API, isso importa mais do que parece, porque estreia no índice não é o mesmo que entrada no seu stack.
O que veio de novo
| Modelo | Índice de inteligência | Preço combinado US$/M |
|---|---|---|
| Apriel-v1.5-15B-Thinker | 21.2 | 0.00 |
| Apriel-v1.6-15B-Thinker | 20.5 | 0.00 |
| HyperCLOVA X SEED Think (32B | 17.0 | — |
| Tri-21B-think Preview | 13.6 | — |
| Tri-21B-Think | 12.4 | — |
| Hermes 4 - Llama-3.1 70B (Re | 10.0 | 0.20 |
Dos seis modelos com ficha publicada, três não têm preço no catálogo — HyperCLOVA X SEED Think (32B), Tri-21B-think Preview e Tri-21B-Think. Dois listam preço zero (Apriel v1.5 e v1.6) e só o Hermes 4 cobra de verdade: US$ 0,1975 por milhão de tokens de saída. Quando o catálogo não traz preço, vale lembrar: significa que o criador não disponibilizou o modelo via API tarifada nesse índice, e o custo real pode variar caso você consiga acesso por fora.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| Claude Sonnet 5 | 55.3 | 10 |
| GLM 5.2 | 52.6 | 3.036 |
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
Em paralelo, o topo do índice segue igual ao que já estava. Claude Fable 5 (IQ 62,073, US$ 50/M de saída), Claude Sonnet 5 (IQ 55,261, US$ 10/M) e Z.ai GLM 5.2 (IQ 52,641, US$ 3,036/M). Nenhum dos estreantes de hoje encosta nesse bloco.
O que essa faixa de IQ significa de verdade
Um modelo com IQ abaixo de 25 no índice da Artificial Analysis costuma passar raspando em tarefas de raciocínio estruturado, erra cadeias longas e tropeça em instruções com múltiplas restrições. Em produção, é a fronteira entre "funciona como classificador ou extrator barato" e "começa a dar trabalho para debugar". Se você está pensando em colocar um desses atrás de uma API de atendimento ou num pipeline de revisão de código, prepare-se para um punhado de chamadas a mais até acertar o resultado.
A régua útil em produção, hoje, continua sendo IQ 45 para cima. Quem está nessa faixa pagando barato tem assinatura chinesa: MiniMax M3 (IQ 45,397, US$ 1,20/M) e DeepSeek V4 Pro 0423 (IQ 45,268, US$ 1,74/M) — duas fabricantes do ecossistema aberto chinês. O terceiro na faixa, Z.ai GLM 5.2 (IQ 52,641, US$ 3,036/M), também é chinês e oferece o melhor IQ por dólar entre os modelos listados.
Para quem vale e para quem não muda nada
Se você está montando um sistema onde a chamada ao modelo é um centavo e a margem de erro é alta — triagem simples, classificação de texto curto, geração de tags —, esses modelos gratuitos ou near-zero podem entrar como peça descartável. Custo de troca é baixo, então testar não dói.
Se o seu caso envolve geração de código, respostas longas, raciocínio multi-etapa ou qualquer coisa que vai direto para o usuário final sem revisão humana, a estreia de hoje não te moveu uma casa no tabuleiro. O caminho continua sendo o mesmo: MiniMax M3, DeepSeek V4 Pro ou Z.ai GLM 5.2, dependendo do orçamento.
O que fazer com isso amanhã
A primeira coisa é separar "modelo novo" de "modelo útil pra mim". Hoje, 23 entradas apareceram no catálogo — 27 modelos nos últimos 30 dias — e a maioria serve a nichos muito específicos ou ainda não tem preço de prateleira. Espere 30 dias: os que sobreviverem e continuarem listados provavelmente ainda vão precisar de fine-tuning ou de um wrapper esperto para valer o byte que entram na sua fatura.
Não confunda estreia no índice com entrada no seu stack: hoje os novos detalhados ficam abaixo de IQ 22, e o melhor custo-benefício acima de IQ 45 segue sendo MiniMax M3 ou DeepSeek V4 Pro.
Perguntas frequentes
O que é o índice de inteligência da Artificial Analysis?
É a régua agregada que a Artificial Analysis usa para ordenar os modelos do catálogo. O índice de hoje é uma fotografia: 482 modelos listados, com Anthropic Claude Fable 5 na ponta em IQ 62,073.
Por que a maioria dos estreantes não tem preço publicado?
Quando o catálogo não traz preço, significa que o criador não disponibilizou o modelo via API pública tarifada nesse índice. Você só consegue usar se o provedor liberar acesso direto, e o custo real pode variar.
Algum dos estreantes de hoje vale a pena testar?
Pela régua de IQ, nenhum dos seis entra no bloco "útil em produção" (IQ 45+). Para chamadas baratas de baixo risco, Apriel v1.5 e v1.6 custam zero; para qualquer coisa séria, a referência da semana segue sendo MiniMax M3 ou Z.ai GLM 5.2.