Qwen3.5 perde ponto no índice da Artificial Analysis
Versão de 0,8B cai quase um ponto de IQ; a de 35B A3B sobe pouco. Quem já tinha escolhido pelo número precisa reabrir a planilha.
A régua mexeu debaixo de quem já tinha escolhido
Se você comparou modelos mês passado e anotou a nota do Qwen3.5 0.8B, apague. A versão não-reasoning desse modelo pequeno da Alibaba caiu de 4,418 para 3,309 no índice da Artificial Analysis — uma perda de pouco mais de um ponto inteiro em escala que vai até os 60. Em termos relativos, é quase 25% a menos de nota de um dia para o outro, sem mudança de preço nem de nome.
O outro lado da família mexeu pouco. O Qwen3.5 35B A3B (Non-reasoning) subiu de 23,383 para 23,993. Menos de 0,6 ponto, o tipo de ajuste que não muda fila nem decisão de compra. Mas está aí, registrado, e a régua é a mesma para todos.
O que é essa régua, afinal
A Artificial Analysis mantém um índice agregado de inteligência que combina benchmarks públicos. Não é uma prova única: é uma média ponderada de provas como GPQA, MMLU, coding e raciocínio, recalculada conforme os laboratórios atualizam versões ou conforme a própria metodologia é revisada. Por isso um número pode mudar sem o modelo ter sido treinado de novo — às vezes a régua é que se mexeu, às vezes o modelo foi reavaliado com uma versão mais dura da prova.
Pense numa prova de vestibular: se o MEC trocar a fórmula de cálculo da nota, candidatos que não estudaram nada de novo podem subir ou descer no ranking. Foi mais ou menos isso.
| Modelo | Antes | Depois | Diferença |
|---|---|---|---|
| Qwen3.5 0.8B (Non-reasoning) | 4.4 | 3.3 | -1.1 |
| Qwen3.5 35B A3B (Non-reasoni | 23.4 | 24.0 | +0.6 |
Para quem isso muda a decisão
Aqui é onde a coisa fica útil de verdade. O Qwen3.5 0.8B é um modelo de 800 milhões de parâmetros — serve para classificar texto, extrair entidades, rodar em edge, fazer sumarização barata. Ele nunca esteve no topo de nada; estava no catálogo como opção de baixíssimo custo para tarefas em que nota alta não é o critério. Continua valendo isso. A queda de 4,4 para 3,3 não o tira do nicho, só o afasta ainda mais de qualquer conversa sobre "inteligência".
Se você já tinha colocado ele numa fila de produção por causa de 4,418, mantenha — o motivo da escolha (custo, latência, footprint) continua o mesmo. Se você estava olhando o número como argumento de venda interna, o argumento acabou.
O 35B A3B é outra conversa. Modelo de 35 bilhões com 3 bilhões ativos por token (daí o "A3B" — active parameters), preço de US$ 0,6875 por milhão de tokens de saída. É o tipo de peça que competes no meio do tabuleiro: não está no topo de inteligência, mas custa uma fração do que custa um frontier. A subida de meio ponto não muda o cenário competitivo — ele continua onde estava, só um pouquinho mais apresentável em planilha.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| GPT-5.6 Sol | 60.9 | 10 |
| Kimi K3 | 59.7 | 15 |
| GPT-5.6 Terra | 56.6 | 12 |
| Grok 4.5 | 55.8 | 6 |
Onde o 0.8B se situa agora
Para ter referência: o topo do catálogo hoje é o Claude Fable 5, da Anthropic, com IQ 62,073 e preço de US$ 50 por milhão de tokens de saída. O modelo mais barato acima de IQ 45 é o MiniMax M3, a US$ 1,20 por milhão. Um Qwen3.5 0.8B em 3,3 está em outro universo de uso — não é competidor de ninguém no top 5, e não deveria ser comparado a eles. É ferramenta, não concorrente.
O que você faz amanhã
Se o 0.8B está em produção por motivo de custo, não toque. Se está em produção por motivo de "nota de benchmark em apresentação para cliente", troque a apresentação — o número de hoje é 3,309 e qualquer pessoa que abrir a fonte vai ver a divergência. Se está em avaliação, rebaixe a expectativa: o modelo cumpre tarefas simples, não espere dele o que o número antigo sugeria.
O 35B A3B segue como candidato sólido para workloads de meio de tabela onde o orçamento manda mais que a régua. A correção pequena joga a favor de quem defende a compra, mas ninguém deveria escolher modelo por 0,6 ponto de IQ.
No fim, a lição é a mesma de sempre: benchmark é fotografia, não contrato. A Artificial Analysis avisa quando refaz a foto. Quem olha só o número, leva susto. Quem olha o motivo da escolha, segue dormindo.
Reavalie o Qwen3.5 0.8B só se a nota era argumento de venda; se era custo, mantenha. Para o 35B A3B, a micro-corção não muda decisão — siga comparando preço e latência.
Perguntas frequentes
O que mudou no Qwen3.5 0.8B em julho de 2026?
A nota de IQ no índice da Artificial Analysis caiu de 4,418 para 3,309 em 18 de julho de 2026. Não houve mudança de preço nem de nome — é uma reavaliação de benchmark, não um novo modelo.
Por que a nota de IQ muda sem o modelo ter sido atualizado?
O índice da Artificial Analysis é uma média ponderada de vários benchmarks. Quando a metodologia é revisada ou quando os laboratórios reavaliam um modelo com provas mais recentes, a nota pode subir ou descer sem que o modelo em si tenha sido treinado de novo.
O Qwen3.5 35B A3B ainda vale a pena depois da reavaliação?
Sim, se o motivo da escolha era custo por capacidade. A nota subiu de 23,383 para 23,993 — ajuste pequeno demais para mudar a posição competitiva. O preço de US$ 0,6875 por milhão de tokens de saída segue sendo o argumento principal.