FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen 3.5 397B e MiMo-V2-Flash empatam em QI, mas a conta sai 7,8x maior

Dois modelos chineses open-weights com 34 pontos de inteligência e arquitetura híbrida. Um cobra US$ 2,34 por milhão de tokens de saída; o outro, US$ 0,30.

Redação FalaVIP IA 3 min de leitura
US$ 2,34por milhão de tokens de saída (Qwen 3.5)
US$ 0,30por milhão de tokens de saída (MiMo-V2-Flash)
34,26 vs 34,02índice de inteligência Artificial Analysis

O empate que ninguém pediu

Você olha o índice de inteligência e vê 34,262 contra 34,024. Diferença de 0,24 ponto. Em qualquer cenário prático, é o mesmo modelo. Só que um cobra US$ 2,34 por milhão de tokens de saída e o outro, US$ 0,30. Em volume, isso é uma diferença de 7,8x na fatura — sem que a capacidade tenha mudado.

Índice de inteligência (Artificial Analysis)
Qwen3.5 397B A17B34,3MiMo-V2-Flash34índice
Fonte: Artificial Analysis

A pergunta que sobra é: o que o Qwen 3.5 397B A17B está vendendo para justificar esse preço? E a resposta está nos números que o índice de inteligência não mostra.

O que o Qwen cobra a mais

O Qwen 3.5 397B A17B tem 397 bilhões de parâmetros totais com 17 bilhões ativos. É uma arquitetura MoE híbrida, com atenção linear misturada à atenção tradicional — o tipo de escolha que entrega throughput alto sem perder qualidade em tarefas longas. Lançado em 16 de fevereiro de 2026, multimodal de verdade: aceita texto, imagem e vídeo, devolve só texto. Janela de contexto de 262 mil tokens.

Onde ele ganha do MiMo: coding 48,21 contra não medido; agentic 19,84 contra não medido; blended de US$ 1,35 por milhão de tokens (preço médio ponderado) contra não publicado. O MiMo-V2-Flash, da Xiaomi, só tem os números de inteligência e de omniscience — o resto do quadro comparativo ficou de fora.

Preço de saída (US$ por milhão de tokens)
Qwen3.5 397B A17B3,5MiMo-V2-Flash0,3US$/M
Fonte: OpenRouter

Traduzindo o marketing: o Qwen está sendo vendido como ferramenta de produção. O MiMo, como base aberta barata.

O que o MiMo entrega por quase nada

MiMo-V2-Flash tem 309 bilhões totais e 15 bilhões ativos. Mesma família de arquitetura híbrida, mesma janela de 262 mil tokens, mas só texto → texto. Lançado em 14 de dezembro de 2025, mais de dois meses antes do Qwen 3.5. E é o modelo mais barato do catálogo inteiro com índice acima de 34.

Qwen3.5 397B A17B × MiMo-V2-Flash
CritérioQwen3.5 397B A17BMiMo-V2-Flash
Índice de inteligência34.334.0
Entrada US$/M0.550.1
Saída US$/M3.50.3
Contexto262k262k
Pesos abertossimsim
Velocidade (tok/s)88
Índice de código48.2
Índice agêntico19.8

O detalhe que muda a conta: o MiMo tem cache de leitura a US$ 0,01 por milhão de tokens. Quando você repete o mesmo prompt em chamadas sucessivas — exatamente o que acontece em qualquer pipeline RAG ou agente — o custo de input colapsa. O Qwen 3.5 não publicou preço de cache. Se você roda agente com contexto repetido, a diferença real entre os dois pode passar de 10x.

Onde cada um ganha

Qwen 3.5 397B A17B ganha quando: você precisa de multimodal nativo (imagem e vídeo entram no prompt), tem tarefa de coding pesada ou quer agentic validado por benchmark. O preço de US$ 2,34 por milhão de saída é alto, mas você está pagando por um modelo que entrega em produção.

MiMo-V2-Flash ganha quando: o trabalho é texto puro, o prompt se repete muito e a margem de cada chamada precisa ser gorda. US$ 0,30 por milhão de saída com cache a US$ 0,01 é, hoje, a referência de custo no topo do catálogo.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
MiMo-V2-Flash34.00.3
o331.18
Entre os 340 modelos disponíveis no catálogo nesta data.

E para deixar claro onde isso se encaixa: o Gemini 3.1 Pro Preview lidera com 47,7 de índice e cobra US$ 12 por milhão de saída. Claude Sonnet 4.6 está em 35,1 por US$ 15. Os dois modelos chineses deste comparativo entregam 90% da inteligência do Claude por uma fração do preço — e o MiMo, especificamente, cobra 40x menos que o Sonnet com índice quase idêntico.

O que isso muda na sua pilha

Se você está pagando API para gerar texto em volume, o MiMo-V2-Flash é o novo padrão de custo. Se você precisa ver imagem ou vídeo junto, não tem escolha: é Qwen 3.5, e a conta vai ser proporcional à multimodelidade. O empate no índice é só o ponto de partida — o resto da decisão mora nos centavos por token e no que você, de fato, coloca no prompt.

Em uma frase

Para texto puro em volume, troque para o MiMo-V2-Flash e use o cache de US$ 0,01 para colapsar o custo de prompts repetidos; só pague os US$ 2,34 do Qwen 3.5 quando a entrada tiver imagem ou vídeo.

Perguntas frequentes

Qwen 3.5 397B A17B ou Xiaomi MiMo-V2-Flash: qual é mais barato?

O MiMo-V2-Flash é mais barato em quase todas as métricas: US$ 0,10 por milhão de tokens de entrada contra US$ 0,39, e US$ 0,30 por milhão de saída contra US$ 2,34. Em volume com cache habilitado, a diferença pode passar de 10x.

Os dois modelos têm o mesmo nível de inteligência?

Praticamente. O índice Artificial Analysis marca 34,262 para o Qwen 3.5 e 34,024 para o MiMo-V2-Flash — 0,24 ponto de diferença, dentro da margem de empate. O Qwen tem, porém, medições de coding (48,21) e agentic (19,84) que o MiMo não publicou.

Qual dos dois aceita imagem e vídeo?

Só o Qwen 3.5 397B A17B. O MiMo-V2-Flash é text-to-text. Se o seu fluxo precisa anexar imagem ou vídeo ao prompt, o MiMo está fora da jogada.

Leia também