FalaVIP IA quinta-feira, 03 de setembro de 2026
Benchmarks

Seis modelos tiveram a nota mexida — e dois deles você provavelmente já usa

Reavaliação do Artificial Analysis reposiciona Phi-4 Mini, Ling 2.6 Flash e Kimi K2.6; para quem escolheu pelo preço, a régua mudou.

Redação FalaVIP IA 3 min de leitura
+3,6 pontosquanto o Kimi K2.6 subiu (de 42,841 para 44,22)
US$ 0,9625preço por milhão de tokens de saída do GLM-4.6 (Reasoning)
–5,2 pontosqueda do Ling 2.6 Flash (de 19,254 para 14,055)

A régua mexeu debaixo de quem já tinha escolhido

Você rodou o comparativo mês passado, fechou a planilha, integrou o modelo na pipeline e foi dormir tranquilo. Hoje, seis linhas dessa planilha mudaram de valor sem aviso na fatura. O Artificial Analysis publicou nesta segunda uma reavaliação que reposiciona modelos pequenos e médios — alguns para cima, outros para baixo — e o efeito prático é que o ranking de custo-benefício que você montou precisa de uma nova passada.

Não é um lançamento. É o oposto: ninguém anunciou nada novo, mas a nota de seis modelos foi corrigida. Para quem olha só o topo da tabela, parece irrelevante. Para quem usa modelo pequeno por causa do preço, é a diferença entre manter e trocar.

Notas revisadas pelo Artificial Analysis
ModeloAntesDepoisDiferença
Ling 2.6 Flash19.314.1-5.2
HyperNova 60B 260522.117.8-4.3
GLM-4.6 (Reasoning)25.128.7+3.6
Phi-4 Mini Instruct3.06.0+3.0
Qwen3.5 2B (Reasoning)10.27.6-2.6
Kimi K2.642.844.2+1.4

Quem subiu — e o que isso significa na conta

Dois modelos saíram ganhando. O Kimi K2.6 foi de 42,841 para 44,22 — uma alta discreta, mas suficiente para cruzar uma fronteira psicológica: agora ele está acima de 44, na faixa onde a diferença de 1,5 ponto começa a importar em benchmarks de raciocínio. O preço não mudou: US$ 1,7125 por milhão de tokens de saída. Para um workload que já estava no Kimi, a notícia é boa de graça — você paga o mesmo e leva um modelo melhor.

O outro destaque é o GLM-4.6 (Reasoning), da Z.ai, que saltou de 25,052 para 28,696. Aqui o movimento é maior em pontos percentuais: quase 15% de ganho. Mas o preço também é outro: US$ 0,9625 por milhão de tokens de saída, o mais caro da lista de reavaliados. É um modelo de raciocínio com nota mediana — útil se você precisa da cadeia de pensamento explícita e não se importa em pagar por ela.

Quem caiu — e por que isso dói mais

A reavaliação pegou mais pesado em dois modelos que muita gente usa por serem baratos. O Ling 2.6 Flash foi de 19,254 para 14,055 — uma queda de quase 27%. Continua listado a US$ 0,15 por milhão de tokens de saída, mas a nota nova muda a comparação: ele deixa de ser "barato e razoável" e vira "barato e claramente abaixo da média". Se você tinha ele numa fila de classificação ou sumarização simples, a conta de custo por tarefa útil piorou.

O HyperNova 60B 2605 também recuou, de 22,139 para 17,804, a US$ 0,065 por milhão de tokens de saída — ainda o modelo mais barato da lista de reavaliados. Para workloads de altíssimo volume e baixa complexidade, ele continua valendo; para qualquer coisa que exija um mínimo de nuance, a nota nova pede reconsideração.

Dois casos menores completam o pacote: o Qwen3.5 2B (Reasoning) caiu de 10,24 para 7,637, e o Phi-4 Mini Instruct dobrou de nota (de 3,027 para 6,014), mas segue na faixa de modelos minúsculos. O Phi-4 tem preço listado como zero no catálogo — vale checar se isso significa gratuidade real ou se é ausência de informação publicada.

Onde isso te coloca no tabuleiro

Para entender o peso dessas mudanças, vale olhar o entorno. O topo do catálogo hoje tem Claude Fable 5 da Anthropic na liderança (IQ 62,073, a US$ 50 por milhão de tokens de saída), seguido por Claude Sonnet 5 (55,261, a US$ 10) e GLM 5.2 da Z.ai (52,641, a US$ 3,036). Os modelos reavaliados não disputam essa faixa — todos ficaram abaixo de 45 pontos.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
Claude Sonnet 555.310
GLM 5.252.63.036
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
Entre os 486 modelos disponíveis no catálogo nesta data.

A pergunta relevante é outra: se você está comprando capacidade acima de IQ 45 pelo menor preço, a fronteira hoje está em US$ 1,2 por milhão de tokens de saída (MiniMax M3) e US$ 1,74 (DeepSeek V4 Pro). O Kimi K2.6, a US$ 1,7125, está colado no DeepSeek em preço e três pontos acima em nota — uma das combinações mais equilibradas do catálogo no momento.

Para quem essa reavaliação muda algo

Se você roda Kimi K2.6 ou GLM-4.6 (Reasoning) em produção, não precisa fazer nada — só atualizar a planilha. Se rodava Ling 2.6 Flash ou HyperNova 60B esperando pagar pouco por nota aceitável, vale rerodir o comparativo com os números novos antes do próximo ciclo de cobrança. Se nunca ouviu falar desses modelos, a reavaliação provavelmente não te afeta — você está em outra faixa de preço e capacidade.

O efeito mais duradouro não é técnico, é cultural: lembra que benchmark é fotografia, não retrato. A mesma nota que te fez escolher um modelo mês passado pode ser diferente mês que vem, e o preço nem sempre acompanha.

Em uma frase

Reroda o comparativo de custo por tarefa útil usando as notas novas antes do próximo ciclo — especialmente se Ling 2.6 Flash ou HyperNova 60B estavam na sua fila.

Perguntas frequentes

O que mudou exatamente na reavaliação do Artificial Analysis de julho de 2026?

Seis modelos tiveram o índice de inteligência recalculado. Kimi K2.6 e GLM-4.6 (Reasoning) subiram; Ling 2.6 Flash, HyperNova 60B 2605 e Qwen3.5 2B (Reasoning) caíram; Phi-4 Mini Instruct subiu dentro da faixa de modelos muito pequenos. Os preços não foram alterados.

Ainda vale usar o Ling 2.6 Flash depois da queda?

Depende do workload. Para tarefas simples e de altíssimo volume, o preço de US$ 0,15 por milhão de tokens de saída ainda compensa. Para qualquer coisa que exija raciocínio mínimo, a nota nova de 14,055 sugere testar alternativas na mesma faixa de preço.

O Kimi K2.6 é a melhor opção custo-benefício hoje?

É uma das mais equilibradas: nota 44,22 a US$ 1,7125 por milhão de tokens de saída, colado em preço com o DeepSeek V4 Pro e três pontos acima em nota. Vale comparar com o MiniMax M3 (US$ 1,2, nota 45,397) para ver qual encaixa melhor no seu perfil de tarefa.

Leia também