FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Quase o mesmo QI, conta oito vezes menor

Qwen3.5 397B e MiMo-V2-Flash empatam em inteligência no catálogo, mas a diferença de preço e de recursos multimodais define quem leva cada tarefa.

Redação FalaVIP IA 3 min de leitura
US$ 0,30por milhão de tokens de saída no MiMo-V2-Flash
US$ 2,34por milhão de tokens de saída no Qwen3.5 397B
8xdiferença de preço para a mesma inteligência

O empate técnico que esconde uma conta muito diferente

Pegue os dois modelos chineses de código aberto que mais se aproximam em índice de inteligência no catálogo hoje: o Qwen3.5 397B A17B, lançado há seis dias, e o MiMo-V2-Flash, da Xiaomi, que chegou em dezembro. Os dois marcam 34,2 pontos de QI — uma diferença de 0,24, que em termos práticos é ruído estatístico. Se você parasse por aí, diria que são intercambiáveis. Mas a conta no fim do mês conta outra história.

Índice de inteligência (Artificial Analysis)
Qwen3.5 397B A17B34,3MiMo-V2-Flash34índice
Fonte: Artificial Analysis

O preço de saída é onde o MiMo atropela

A diferença de preço entre os dois é brutal. O MiMo-V2-Flash cobra US$ 0,30 por milhão de tokens de saída. O Qwen3.5 397B cobra US$ 2,34 pelo mesmo volume. São quase oito vezes a mais para gerar a mesma quantidade de texto, em modelos que entregam inteligência praticamente igual.

Preço de saída (US$ por milhão de tokens)
Qwen3.5 397B A17B3,5MiMo-V2-Flash0,3US$/M
Fonte: OpenRouter

No input, a discrepância é menor, mas ainda relevante: US$ 0,10 contra US$ 0,39 por milhão de tokens — quase quatro vezes. E tem o cache do MiMo, a US$ 0,01 por milhão, um recurso que o Qwen nem lista no catálogo. Para quem roda pipelines longos com prompts repetidos, esse centavo por milhão é o tipo de detalhe que aparece na fatura.

Onde o Qwen abre distância — e não é pouco

Mas preço não é tudo, e é aqui que a comparação fica honesta. O Qwen3.5 397B é multimodal: aceita texto, imagem e vídeo como entrada e devolve texto. O MiMo-V2-Flash é text-only. Se você precisa descrever uma imagem, transcrever um vídeo ou trabalhar com documentos visuais, o MiMo simplesmente não entra na conversa.

Tem mais. O Qwen traz 48,2 pontos em coding e 19,8 em agentic — dois benchmarks em que o MiMo não tem nota publicada no catálogo. Isso não quer dizer que o MiMo é ruim nessas tarefas; quer dizer que você está comprando no escuro. Para quem está montando um agente ou precisa de geração de código confiável, ter número publicado muda a conta de risco.

A velocidade também pesa: o Qwen marca 87,9 tokens por segundo; o MiMo não tem medição no catálogo. Em fluxo de produção, essa diferença pode ser o gargalo entre uma chamada síncrona e uma fila de espera.

Qwen3.5 397B A17B × MiMo-V2-Flash
CritérioQwen3.5 397B A17BMiMo-V2-Flash
Índice de inteligência34.334.0
Entrada US$/M0.550.1
Saída US$/M3.50.3
Contexto262k262k
Pesos abertossimsim
Velocidade (tok/s)88
Índice de código48.2
Índice agêntico19.8

O tabuleiro maior

Olhando o topo do mercado hoje, o cenário é claro: o Google Gemini 3.1 Pro Preview lidera com folga (47,7 de QI), seguido pelo Claude Sonnet 4.6 (35,1). Os dois modelos chineses deste comparativo vêm logo atrás, empatados tecnicamente, mas com propostas comerciais opostas — um aposta em ser canivete suíço, o outro em ser o mais barato da sala.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
MiMo-V2-Flash34.00.3
o331.18
Entre os 340 modelos disponíveis no catálogo nesta data.

Para quem cada um faz sentido

Se você roda chatbots de atendimento, resumos de texto puro, classificação em massa ou qualquer workload em que o volume de tokens domina o orçamento, o MiMo-V2-Flash é a escolha racional. Oito vezes mais barato com a mesma inteligência é um argumento que não precisa de adjetivo.

Se você precisa de multimodalidade, tem pipeline de código ou está construindo agente, o Qwen3.5 397B entrega o pacote completo — e os benchmarks publicados para sustentar a decisão. A conta fica maior, mas você sabe o que está comprando.

E se você está nos dois mundos? Rodar o MiMo para o tráfego de texto pesado e chamar o Qwen para as tarefas multimodais é uma combinação que faz sentido técnico e financeiro — mesmo vindo de dois fabricantes diferentes.

Em uma frase

Use MiMo-V2-Flash para workloads de texto puro em escala e Qwen3.5 397B quando precisar de multimodalidade, código ou agente — os dois são open weights e podem conviver na mesma stack.

Perguntas frequentes

Qwen3.5 397B ou MiMo-V2-Flash: qual escolher?

Depende do tipo de tarefa. Para texto puro em alto volume, MiMo-V2-Flash entrega a mesma inteligência por um oitavo do preço. Para multimodalidade, código ou agentes, o Qwen3.5 397B é o único dos dois que cobre essas frentes — e tem benchmarks publicados para sustentar a escolha.

Os dois modelos são open weights?

Sim. Ambos são modelos de código aberto com arquitetura Mixture-of-Experts: o Qwen tem 397B parâmetros totais (17B ativos) e o MiMo tem 309B totais (15B ativos). Os dois vêm da China.

Vale a pena migrar do Qwen para o MiMo para economizar?

Só se sua workload for 100% texto. Qualquer pipeline que dependa de entrada de imagem ou vídeo, ou que exija benchmark publicado de código, vai perder funcionalidade ao trocar. O caminho mais inteligente é usar os dois em camadas.

Leia também