Seis modelos tiveram a nota mexida — e dois deles você provavelmente já usa
Reavaliação do Artificial Analysis reposiciona Phi-4 Mini, Ling 2.6 Flash e Kimi K2.6; para quem escolheu pelo preço, a régua mudou.
A régua mexeu debaixo de quem já tinha escolhido
Você rodou o comparativo mês passado, fechou a planilha, integrou o modelo na pipeline e foi dormir tranquilo. Hoje, seis linhas dessa planilha mudaram de valor sem aviso na fatura. O Artificial Analysis publicou nesta segunda uma reavaliação que reposiciona modelos pequenos e médios — alguns para cima, outros para baixo — e o efeito prático é que o ranking de custo-benefício que você montou precisa de uma nova passada.
Não é um lançamento. É o oposto: ninguém anunciou nada novo, mas a nota de seis modelos foi corrigida. Para quem olha só o topo da tabela, parece irrelevante. Para quem usa modelo pequeno por causa do preço, é a diferença entre manter e trocar.
| Modelo | Antes | Depois | Diferença |
|---|---|---|---|
| Ling 2.6 Flash | 19.3 | 14.1 | -5.2 |
| HyperNova 60B 2605 | 22.1 | 17.8 | -4.3 |
| GLM-4.6 (Reasoning) | 25.1 | 28.7 | +3.6 |
| Phi-4 Mini Instruct | 3.0 | 6.0 | +3.0 |
| Qwen3.5 2B (Reasoning) | 10.2 | 7.6 | -2.6 |
| Kimi K2.6 | 42.8 | 44.2 | +1.4 |
Quem subiu — e o que isso significa na conta
Dois modelos saíram ganhando. O Kimi K2.6 foi de 42,841 para 44,22 — uma alta discreta, mas suficiente para cruzar uma fronteira psicológica: agora ele está acima de 44, na faixa onde a diferença de 1,5 ponto começa a importar em benchmarks de raciocínio. O preço não mudou: US$ 1,7125 por milhão de tokens de saída. Para um workload que já estava no Kimi, a notícia é boa de graça — você paga o mesmo e leva um modelo melhor.
O outro destaque é o GLM-4.6 (Reasoning), da Z.ai, que saltou de 25,052 para 28,696. Aqui o movimento é maior em pontos percentuais: quase 15% de ganho. Mas o preço também é outro: US$ 0,9625 por milhão de tokens de saída, o mais caro da lista de reavaliados. É um modelo de raciocínio com nota mediana — útil se você precisa da cadeia de pensamento explícita e não se importa em pagar por ela.
Quem caiu — e por que isso dói mais
A reavaliação pegou mais pesado em dois modelos que muita gente usa por serem baratos. O Ling 2.6 Flash foi de 19,254 para 14,055 — uma queda de quase 27%. Continua listado a US$ 0,15 por milhão de tokens de saída, mas a nota nova muda a comparação: ele deixa de ser "barato e razoável" e vira "barato e claramente abaixo da média". Se você tinha ele numa fila de classificação ou sumarização simples, a conta de custo por tarefa útil piorou.
O HyperNova 60B 2605 também recuou, de 22,139 para 17,804, a US$ 0,065 por milhão de tokens de saída — ainda o modelo mais barato da lista de reavaliados. Para workloads de altíssimo volume e baixa complexidade, ele continua valendo; para qualquer coisa que exija um mínimo de nuance, a nota nova pede reconsideração.
Dois casos menores completam o pacote: o Qwen3.5 2B (Reasoning) caiu de 10,24 para 7,637, e o Phi-4 Mini Instruct dobrou de nota (de 3,027 para 6,014), mas segue na faixa de modelos minúsculos. O Phi-4 tem preço listado como zero no catálogo — vale checar se isso significa gratuidade real ou se é ausência de informação publicada.
Onde isso te coloca no tabuleiro
Para entender o peso dessas mudanças, vale olhar o entorno. O topo do catálogo hoje tem Claude Fable 5 da Anthropic na liderança (IQ 62,073, a US$ 50 por milhão de tokens de saída), seguido por Claude Sonnet 5 (55,261, a US$ 10) e GLM 5.2 da Z.ai (52,641, a US$ 3,036). Os modelos reavaliados não disputam essa faixa — todos ficaram abaixo de 45 pontos.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| Claude Sonnet 5 | 55.3 | 10 |
| GLM 5.2 | 52.6 | 3.036 |
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
A pergunta relevante é outra: se você está comprando capacidade acima de IQ 45 pelo menor preço, a fronteira hoje está em US$ 1,2 por milhão de tokens de saída (MiniMax M3) e US$ 1,74 (DeepSeek V4 Pro). O Kimi K2.6, a US$ 1,7125, está colado no DeepSeek em preço e três pontos acima em nota — uma das combinações mais equilibradas do catálogo no momento.
Para quem essa reavaliação muda algo
Se você roda Kimi K2.6 ou GLM-4.6 (Reasoning) em produção, não precisa fazer nada — só atualizar a planilha. Se rodava Ling 2.6 Flash ou HyperNova 60B esperando pagar pouco por nota aceitável, vale rerodir o comparativo com os números novos antes do próximo ciclo de cobrança. Se nunca ouviu falar desses modelos, a reavaliação provavelmente não te afeta — você está em outra faixa de preço e capacidade.
O efeito mais duradouro não é técnico, é cultural: lembra que benchmark é fotografia, não retrato. A mesma nota que te fez escolher um modelo mês passado pode ser diferente mês que vem, e o preço nem sempre acompanha.
Reroda o comparativo de custo por tarefa útil usando as notas novas antes do próximo ciclo — especialmente se Ling 2.6 Flash ou HyperNova 60B estavam na sua fila.
Perguntas frequentes
O que mudou exatamente na reavaliação do Artificial Analysis de julho de 2026?
Seis modelos tiveram o índice de inteligência recalculado. Kimi K2.6 e GLM-4.6 (Reasoning) subiram; Ling 2.6 Flash, HyperNova 60B 2605 e Qwen3.5 2B (Reasoning) caíram; Phi-4 Mini Instruct subiu dentro da faixa de modelos muito pequenos. Os preços não foram alterados.
Ainda vale usar o Ling 2.6 Flash depois da queda?
Depende do workload. Para tarefas simples e de altíssimo volume, o preço de US$ 0,15 por milhão de tokens de saída ainda compensa. Para qualquer coisa que exija raciocínio mínimo, a nota nova de 14,055 sugere testar alternativas na mesma faixa de preço.
O Kimi K2.6 é a melhor opção custo-benefício hoje?
É uma das mais equilibradas: nota 44,22 a US$ 1,7125 por milhão de tokens de saída, colado em preço com o DeepSeek V4 Pro e três pontos acima em nota. Vale comparar com o MiniMax M3 (US$ 1,2, nota 45,397) para ver qual encaixa melhor no seu perfil de tarefa.