FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Qwen3.5 397B A17B assume topo do ranking de inteligência, mas Xiaomi cobra 1/8 do preço

Modelo aberto da chinesa Qwen é hoje o mais bem pontuado do índice — e o segundo lugar cobra pouco mais de um oitavo por token de saída.

Redação FalaVIP IA 3 min de leitura
US$ 2,34por milhão de tokens de saída do Qwen3.5 397B A17B
US$ 0,30por milhão de tokens de saída do Xiaomi MiMo-V2-Flash
0,24 pontodiferença de IQ entre o 1º e o 2º lugar do ranking

A Qwen publicou hoje o Qwen3.5 397B A17B: 397 bilhões de parâmetros no nome, 17 bilhões no boleto da GPU a cada token gerado. É um modelo de mistura de especialistas (MoE) que combina atenção linear com MoE esparsa, multimodal nativo e com pesos abertos. Depois da publicação, ocupa o topo do índice de inteligência que a comunidade usa para comparar LLMs neste momento.

397B no nome, 17B no boleto

Vale traduzir o nome antes de discutir preço. O 397B é o tamanho total do "catálogo" de especialistas. Os 17B são os parâmetros ativos por token — o que realmente roda na GPU. O modelo é uma mistura de especialistas com arquitetura híbrida que combina atenção linear com a mistura esparsa, mirando eficiência de inferência. O custo por token fica muito mais perto de um modelo de 17B do que de um de 397B.

O modelo aceita texto, imagem e vídeo como entrada e devolve texto. Janela de contexto de 262 mil tokens. Pesos abertos, hospedável em infra própria.

Fora do índice geral, a pontuação em coding chama atenção: 48,2, a mais alta entre os modelos do top 5 atual. Em agente, 19,8 — mais modesto, e vale considerar para fluxos agentic longos.

O vizinho de mesa cobra um oitavo do preço

A história do topo hoje não se conta sem o Xiaomi MiMo-V2-Flash, que aparece logo abaixo com 34,0 pontos de inteligência contra 34,3 do Qwen. Detalhe que muda a conversa: o preço de saída do Xiaomi é US$ 0,30 por milhão de tokens, contra US$ 2,34 do Qwen — pouco mais de um oitavo.

Índice de inteligência (Artificial Analysis)
Qwen3.5 397B A17B34,3MiMo-V2-Flash34o331,1Claude Haiku 4.529,9índice
Fonte: Artificial Analysis

Mesma vizinhança no ranking, conta oito vezes menor. Para projetos sensíveis a custo, a pergunta difícil deixa de ser "Qwen vale a aposta" e passa a ser "por que estou pagando sete vezes mais pelo MiMo". A diferença de 0,24 ponto entre os dois dificilmente vai aparecer no produto final.

A conta, comparada

Preço de saída (US$ por milhão de tokens)
Qwen3.5 397B A17B3,5MiMo-V2-Flash0,3o38Claude Haiku 4.55US$/M
Fonte: OpenRouter
  • Qwen3.5 397B A17B: US$ 2,34 por milhão de tokens de saída
  • Xiaomi MiMo-V2-Flash: US$ 0,30
  • Anthropic Claude Haiku 4.5: US$ 5,00
  • OpenAI o3: US$ 8,00

Para gerar a mesma quantidade de tokens no o3 você paga cerca de 3,4 vezes o que paga no Qwen novo — e o Qwen marca mais no índice. O Claude Haiku 4.5 fica em US$ 5,00. Os dois modelos chineses no topo entregam, na medição atual, mais que qualquer modelo americano disponível, e cobrando bem menos.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Qwen3.5 397B A17B (o novo)34.30.553.5262k
MiMo-V2-Flash34.00.10.3262k
o331.128200k
Claude Haiku 4.529.915200k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

A linha completa

O anúncio de hoje não veio sozinho. A Qwen também publicou o Qwen3.5 Plus, com janela de contexto de 1 milhão de tokens e preço de saída de US$ 1,56 por milhão de tokens. É o modelo da família voltado para quem precisa enfiar documentos longos sem trocar de provedor.

Os outros modelos anunciados no mesmo dia
ModeloEntrada US$/MSaída US$/MContexto
Qwen3.5 Plus 2026-02-150.261.561M

O catálogo geral conta agora com 336 modelos, 52 criadores e 21 lançamentos nos últimos 30 dias — a Qwen segue entre os mais ativos do mercado.

Para quem vale e para quem não muda nada

Vale para você se: você roda modelos em infra própria e quer open weights no topo do índice; constrói agentes onde o token de saída domina o custo; precisa de multimodal nativo (texto, imagem, vídeo) sem montar pipeline; ou quer codificação forte — 48,2 é o melhor entre os modelos abertos do top 5.

Não muda nada se: você já está no o3 ou no Claude Haiku 4.5 por tooling, SDK ou porque refatorar custa caro; o MiMo da Xiaomi já resolve pelo preço que cobra; ou seu gargalo é janela de contexto e o Plus de 1M tokens te atende por menos.

O que o lançamento muda é a régua. Dois modelos chineses com pesos abertos ocupam hoje as duas primeiras posições do índice cobrando entre um oitavo e pouco mais da metade do que OpenAI cobra pelo o3, e menos da metade do Claude Haiku 4.5. Se você já cogitou sair do API fechado, o argumento de qualidade acabou de derrubar mais um degrau.

Em uma frase

Se você consegue hospedar modelos abertos (ou usa provedor compatível) e o token de saída pesa na sua conta, o novo padrão de referência ficou chinês e barato: o Xiaomi MiMo-V2-Flash a US$ 0,30/M entrega quase o mesmo IQ que o top 1; o Qwen3.5 397B A17B a US$ 2,34/M custa menos da metade do o3 e passa OpenAI e Anthropic no índice.

Perguntas frequentes

Quanto custa o Qwen3.5 397B A17B na API?

US$ 0,39 por milhão de tokens de entrada e US$ 2,34 por milhão de tokens de saída. O preço de cache não foi divulgado pela Qwen no material do lançamento — quem precisar dessa informação precisa consultar o provedor escolhido.

O Qwen3.5 397B A17B é melhor que o o3 da OpenAI?

No índice de inteligência atual, sim: 34,3 contra 31,1 do o3. O o3 continua custando mais que o tripo do Qwen novo por token de saída (US$ 8,00 contra US$ 2,34), então para cargas sensíveis a custo o argumento financeiro acompanha a preferência técnica.

Qual a diferença entre o Qwen3.5 397B A17B e o MiMo-V2-Flash da Xiaomi?

São 0,24 ponto de IQ a favor do Qwen (34,3 contra 34,0) e quase oito vezes de diferença no preço de saída (US$ 2,34 contra US$ 0,30). Na prática, para a maioria dos produtos, a diferença de qualidade é desprezível e o custo domina.

Leia também