FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

MiMo-V2-Omni e Qwen3.5 397B custam quase igual — só um lê áudio

Xiaomi e Qwen ocupam a mesma faixa de US$ 2 por milhão na saída e ficam a 1,6 ponto de QI. O que decide está nas linhas que o release não destaca.

Redação FalaVIP IA 3 min de leitura
US$ 0,08 / milhãopreço de cache do MiMo-V2-Omni
48,212QI de coding do Qwen3.5 397B A17B
397B / 17Bparâmetros totais / ativos do Qwen3.5 397B A17B

Dois dólares por milhão e QI quase igual — problemas diferentes

São 374 modelos no catálogo de hoje, vindos de 53 criadores. Dois deles, ambos chineses, caíram na mesma faixa de preço nos últimos 33 dias. Xiaomi soltou o MiMo-V2-Omni em 18 de março — três dias atrás. A Qwen já tinha colocado o 397B A17B em 16 de fevereiro. O índice de inteligência dos dois fica a 1,6 ponto um do outro (35,866 contra 34,262); o Gemini 3.1 Pro Preview lidera a 47,7 e o GPT-5.3-Codex aparece em segundo a 45,5, então MiMo e Qwen disputam o terceiro lugar com o Claude Sonnet 4.6 entre eles. A essa distância, ninguém troca de provedor pelo QI geral.

Índice de inteligência (Artificial Analysis)
MiMo-V2-Omni35,9Qwen3.5 397B A17B34,3índice
Fonte: Artificial Analysis

Áudio: a fronteira que o Qwen não cruza

O release do MiMo fala em "fronteira omni-modal nativa" e, nesse caso, o marketing não está inflando. O modelo aceita texto, imagem, vídeo e áudio numa arquitetura unificada, devolvendo apenas texto. O Qwen3.5 397B é vision-language nativo — texto, imagem e vídeo. Sem áudio. Se você está montando um agente que transcreve reunião, analisa chamada de call center ou interpreta um trecho de podcast, o Qwen nem entra na conversa. Antes de comparar benchmark, abra a coluna de modalidade: ali se resolve 80% da decisão.

MiMo-V2-Omni × Qwen3.5 397B A17B
CritérioMiMo-V2-OmniQwen3.5 397B A17B
Índice de inteligência35.934.3
Entrada US$/M0.40.55
Saída US$/M23.5
Contexto262k262k
Pesos abertosnãosim
Velocidade (tok/s)88
Índice de código48.2
Índice agêntico19.8

O cache de US$ 0,08 muda a conta em RAG e prompts repetidos

O preço de entrada do MiMo é US$ 0,40 por milhão; o do Qwen, US$ 0,39. Diferença desprezível. Na saída, MiMo cobra US$ 2,00 contra US$ 2,34 do Qwen — cerca de 17% mais barato por token gerado. Mas o número que importa mesmo está numa linha que costuma passar batido: o MiMo tem cache de US$ 0,08 por milhão, cinco vezes mais barato que o próprio input do modelo. O Qwen não publicou preço de cache no catálogo. Para qualquer aplicação que repete prompts longos — RAG, system prompts estáticos, ferramentas de extração com schema fixo — o MiMo cobra uma fração do que parece cobrar à primeira vista.

Preço de saída (US$ por milhão de tokens)
MiMo-V2-Omni2Qwen3.5 397B A17B3,5US$/M
Fonte: OpenRouter

Qwen ganha em coding (48,2) e em controle (pesos abertos, 17B ativos)

O índice geral do Qwen é menor, mas em coding o cenário inverte: 48,212. É a maior nota publicada do modelo e fica acima do QI do próprio MiMo (35,866). Quem está escolhendo modelo para geração de código, refactor, pair programming ou agente de desenvolvimento enxerga aqui uma diferença real, mesmo que o agregado não diga. O MiMo não publicou nota de coding nem de agentic — catálogo sem nota significa "não sabemos".

Do lado do controle, o Qwen 397B A17B é modelo de pesos abertos com 397 bilhões de parâmetros totais e 17 bilhões ativos por token, MoE híbrido que combina atenção linear com mistura esparsa de especialistas. O MiMo-V2-Omni não divulga contagem de parâmetros e é closed weights. Em API de prateleira isso pouco importa; quando o volume justifica, ou quando dados sensíveis impedem envio para provedor externo, self-host vira a variável dominante. O Qwen roda em hardware comum usando a fração ativa de 17B. O MiMo não roda em lugar nenhum seu.

Veredito: em que situação cada um ganha

O Xiaomi MiMo-V2-Omni ganha quando o trabalho envolve áudio (transcrição, análise de chamada, multimodal misto), quando a aplicação repete prompts longos e se beneficia do cache de US$ 0,08, ou quando você quer o QI agregado mais alto e o menor preço de saída da dupla.

O Qwen3.5 397B A17B ganha quando o foco é código (48,2 contra 35 do MiMo), quando os dados não podem sair da infraestrutura da empresa, ou quando o time quer inspecionar a arquitetura e rodar self-host com 17B ativos.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
MiMo-V2-Omni35.92
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
Entre os 374 modelos disponíveis no catálogo nesta data.
Em uma frase

Escolha MiMo-V2-Omni quando houver áudio, prompts repetidos que se beneficiem do cache de US$ 0,08 ou quando o menor preço de saída pesar mais; escolha Qwen3.5 397B A17B quando o foco for código, os dados não puderem sair da sua infraestrutura ou o time quiser rodar self-host com 17B ativos.

Perguntas frequentes

MiMo-V2-Omni ou Qwen3.5 397B: qual é mais barato na prática?

Depende do padrão de uso. O MiMo cobra US$ 2,00 por milhão de tokens de saída contra US$ 2,34 do Qwen — cerca de 17% mais barato na saída. A diferença real, porém, aparece no cache: o MiMo cobra US$ 0,08 por milhão em prompts cacheados, cinco vezes menos que o próprio input. O Qwen não publicou preço de cache no catálogo.

Qual dos dois modelos aceita áudio?

Apenas o Xiaomi MiMo-V2-Omni. Ele é omni-modal nativo e processa texto, imagem, vídeo e áudio numa arquitetura unificada. O Qwen3.5 397B A17B é vision-language: aceita texto, imagem e vídeo, mas não tem entrada de áudio.

Posso rodar o Qwen3.5 397B A17B na minha infraestrutura?

Sim. O Qwen3.5 397B A17B é de pesos abertos e foi declarado com 397 bilhões de parâmetros totais e 17 bilhões ativos por token (MoE híbrido com atenção linear). O MiMo-V2-Omni não divulga parâmetros e é closed weights, então só roda via API do provedor.

Leia também