FalaVIP IA quinta-feira, 03 de setembro de 2026
Benchmarks

Qwen3.5 perde ponto no índice da Artificial Analysis

Versão de 0,8B cai quase um ponto de IQ; a de 35B A3B sobe pouco. Quem já tinha escolhido pelo número precisa reabrir a planilha.

Redação FalaVIP IA 3 min de leitura
3,309novo IQ do Qwen3.5 0.8B (era 4,418)
23,993novo IQ do Qwen3.5 35B A3B (era 23,383)
US$ 0,6875preço por milhão de tokens de saída do 35B A3B

A régua mexeu debaixo de quem já tinha escolhido

Se você comparou modelos mês passado e anotou a nota do Qwen3.5 0.8B, apague. A versão não-reasoning desse modelo pequeno da Alibaba caiu de 4,418 para 3,309 no índice da Artificial Analysis — uma perda de pouco mais de um ponto inteiro em escala que vai até os 60. Em termos relativos, é quase 25% a menos de nota de um dia para o outro, sem mudança de preço nem de nome.

O outro lado da família mexeu pouco. O Qwen3.5 35B A3B (Non-reasoning) subiu de 23,383 para 23,993. Menos de 0,6 ponto, o tipo de ajuste que não muda fila nem decisão de compra. Mas está aí, registrado, e a régua é a mesma para todos.

O que é essa régua, afinal

A Artificial Analysis mantém um índice agregado de inteligência que combina benchmarks públicos. Não é uma prova única: é uma média ponderada de provas como GPQA, MMLU, coding e raciocínio, recalculada conforme os laboratórios atualizam versões ou conforme a própria metodologia é revisada. Por isso um número pode mudar sem o modelo ter sido treinado de novo — às vezes a régua é que se mexeu, às vezes o modelo foi reavaliado com uma versão mais dura da prova.

Pense numa prova de vestibular: se o MEC trocar a fórmula de cálculo da nota, candidatos que não estudaram nada de novo podem subir ou descer no ranking. Foi mais ou menos isso.

Notas revisadas pelo Artificial Analysis
ModeloAntesDepoisDiferença
Qwen3.5 0.8B (Non-reasoning)4.43.3-1.1
Qwen3.5 35B A3B (Non-reasoni23.424.0+0.6

Para quem isso muda a decisão

Aqui é onde a coisa fica útil de verdade. O Qwen3.5 0.8B é um modelo de 800 milhões de parâmetros — serve para classificar texto, extrair entidades, rodar em edge, fazer sumarização barata. Ele nunca esteve no topo de nada; estava no catálogo como opção de baixíssimo custo para tarefas em que nota alta não é o critério. Continua valendo isso. A queda de 4,4 para 3,3 não o tira do nicho, só o afasta ainda mais de qualquer conversa sobre "inteligência".

Se você já tinha colocado ele numa fila de produção por causa de 4,418, mantenha — o motivo da escolha (custo, latência, footprint) continua o mesmo. Se você estava olhando o número como argumento de venda interna, o argumento acabou.

O 35B A3B é outra conversa. Modelo de 35 bilhões com 3 bilhões ativos por token (daí o "A3B" — active parameters), preço de US$ 0,6875 por milhão de tokens de saída. É o tipo de peça que competes no meio do tabuleiro: não está no topo de inteligência, mas custa uma fração do que custa um frontier. A subida de meio ponto não muda o cenário competitivo — ele continua onde estava, só um pouquinho mais apresentável em planilha.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
GPT-5.6 Sol60.910
Kimi K359.715
GPT-5.6 Terra56.612
Grok 4.555.86
Entre os 509 modelos disponíveis no catálogo nesta data.

Onde o 0.8B se situa agora

Para ter referência: o topo do catálogo hoje é o Claude Fable 5, da Anthropic, com IQ 62,073 e preço de US$ 50 por milhão de tokens de saída. O modelo mais barato acima de IQ 45 é o MiniMax M3, a US$ 1,20 por milhão. Um Qwen3.5 0.8B em 3,3 está em outro universo de uso — não é competidor de ninguém no top 5, e não deveria ser comparado a eles. É ferramenta, não concorrente.

O que você faz amanhã

Se o 0.8B está em produção por motivo de custo, não toque. Se está em produção por motivo de "nota de benchmark em apresentação para cliente", troque a apresentação — o número de hoje é 3,309 e qualquer pessoa que abrir a fonte vai ver a divergência. Se está em avaliação, rebaixe a expectativa: o modelo cumpre tarefas simples, não espere dele o que o número antigo sugeria.

O 35B A3B segue como candidato sólido para workloads de meio de tabela onde o orçamento manda mais que a régua. A correção pequena joga a favor de quem defende a compra, mas ninguém deveria escolher modelo por 0,6 ponto de IQ.

No fim, a lição é a mesma de sempre: benchmark é fotografia, não contrato. A Artificial Analysis avisa quando refaz a foto. Quem olha só o número, leva susto. Quem olha o motivo da escolha, segue dormindo.

Em uma frase

Reavalie o Qwen3.5 0.8B só se a nota era argumento de venda; se era custo, mantenha. Para o 35B A3B, a micro-corção não muda decisão — siga comparando preço e latência.

Perguntas frequentes

O que mudou no Qwen3.5 0.8B em julho de 2026?

A nota de IQ no índice da Artificial Analysis caiu de 4,418 para 3,309 em 18 de julho de 2026. Não houve mudança de preço nem de nome — é uma reavaliação de benchmark, não um novo modelo.

Por que a nota de IQ muda sem o modelo ter sido atualizado?

O índice da Artificial Analysis é uma média ponderada de vários benchmarks. Quando a metodologia é revisada ou quando os laboratórios reavaliam um modelo com provas mais recentes, a nota pode subir ou descer sem que o modelo em si tenha sido treinado de novo.

O Qwen3.5 35B A3B ainda vale a pena depois da reavaliação?

Sim, se o motivo da escolha era custo por capacidade. A nota subiu de 23,383 para 23,993 — ajuste pequeno demais para mudar a posição competitiva. O preço de US$ 0,6875 por milhão de tokens de saída segue sendo o argumento principal.

Leia também