FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

MiMo-V2-Flash custa 8 vezes menos que a Qwen3.5-122B, mas só lê texto

Os dois são MoE chineses open-weights com reasoning. A diferença está no multimodal, nos benchmarks publicados e no preço de cache.

Redação FalaVIP IA 3 min de leitura
8xde diferença no preço de saída (US$ 0,30 vs US$ 2,40 por milhão de tokens)
34,024IQ da MiMo-V2-Flash contra 32,847 da Qwen3.5-122B-A10B
US$ 0,01preço de cache da MiMo por milhão de tokens (Qwen não publicou)

Oito vezes mais barato — em qual esquina fica a pegadinha?

A MiMo-V2-Flash da Xiaomi cobra US$ 0,30 por milhão de tokens de saída. A Qwen3.5-122B-A10B, da Qwen, cobra US$ 2,40. São oito vezes de diferença na fatura. A conta não é tudo — e o catálogo desta data mostra que, por trás do número, mora uma diferença que você precisa olhar antes de migrar.

Dois MoE chineses, duas estratégias

Os dois modelos são open-weights, ambos da China, ambos MoE com atenção híbrida. Pense em dois carros com o mesmo motor híbrido, mas carrocerias diferentes. A MiMo-V2-Flash tem 309 bilhões de parâmetros totais e 15 bilhões ativos; a Qwen3.5-122B-A10B tem 125 bilhões no total e 10 bilhões ativos. Janela de contexto das duas: 262.144 tokens. Os dois raciocinam (reasoning: true).

Onde elas divergem é no que aceitam como entrada. A Qwen3.5-122B-A10B é nativa multimodal: recebe texto, imagem e vídeo e devolve texto. A MiMo-V2-Flash é estritamente texto -> texto. Para a maioria dos fluxos de RAG, resumo e agentes puros em texto, isso não importa. Para qualquer pipeline que dependa de screenshot, frame de vídeo ou documento escaneado, importa muito.

Inteligência: a MiMo lidera por pouco

Índice de inteligência (Artificial Analysis)
MiMo-V2-Flash34Qwen3.5-122B-A10B32,8índice
Fonte: Artificial Analysis

No índice de inteligência atual, a MiMo-V2-Flash marca 34,024 e a Qwen3.5-122B-A10B marca 32,847. Diferença pequena — pouco mais de 1 ponto — mas a favor da MiMo, que também é a mais barata das duas. Ambas ficam bem abaixo dos dois primeiros colocados do mercado hoje: Google Gemini 3.1 Pro Preview (47,738) e OpenAI GPT-5.3-Codex (45,512), que custam US$ 12 e US$ 14 por milhão de tokens de saída, respectivamente.

Preço de saída (US$ por milhão de tokens)
MiMo-V2-Flash0,3Qwen3.5-122B-A10B2,4US$/M
Fonte: OpenRouter

Onde a Qwen3.5-122B-A10B recupera terreno é em benchmarks específicos que a MiMo-V2-Flash simplesmente não publica: coding em 45,715 e agentic em 21,267. Se você está montando um agente de codificação ou testando raciocínio multi-etapa, a Qwen traz dado na nota fiscal; a Xiaomi traz silêncio.

Velocidade e a economia real

MiMo-V2-Flash × Qwen3.5-122B-A10B
CritérioMiMo-V2-FlashQwen3.5-122B-A10B
Índice de inteligência34.032.8
Entrada US$/M0.10.29
Saída US$/M0.32.4
Contexto262k262k
Pesos abertossimsim
Velocidade (tok/s)131
Índice de código45.7
Índice agêntico21.3

A Qwen3.5-122B-A10B declara 131,43 tokens por segundo de velocidade. A MiMo-V2-Flash não publica essa métrica no momento. Em cargas de inferência com reasoning ligado, throughput declarado muda a conta inteira — um modelo duas vezes mais lento custa efetivamente mais caro mesmo com o mesmo preço nominal.

Para complicar a equação da Qwen, o catálogo desta data não publica preço de cache para ela. Isso significa que fluxos com prompt repetido e cache hit — exatamente o cenário de agente e CI de código — não têm economia negociada e conhecida; você só descobre testando.

A MiMo-V2-Flash cobra US$ 0,01 por milhão de tokens de cache. Praticamente um arredondamento. Para pipelines de RAG que martelam o mesmo prompt com retrieval em cima, isso é dinheiro na mão.

Para quem cada um ganha

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
MiMo-V2-Flash34.00.3
Entre os 357 modelos disponíveis no catálogo nesta data.

Escolha a MiMo-V2-Flash quando:

  • Sua carga é 100% texto e vai continuar assim;
  • O gargalo é a fatura de API, especialmente em alto volume de saída;
  • Você usa cache agressivo (RAG com retrieval repetido, prompts de sistema pesados);
  • Você quer o open-weights mais barato entre os chineses com reasoning.

Escolha a Qwen3.5-122B-A10B quando:

  • Você precisa ler imagens ou vídeo no input — screenshot de bug, frame, página visual de UI;
  • Sua workload é agentic ou de coding com reasoning pesado, e os benchmarks publicados (45,7 em coding, 21,3 em agentic) entram na decisão;
  • Throughput declarado importa — os 131 t/s publicados servem de referência;
  • Você está confortável pagando 8x mais caro na saída e esperando o catálogo publicar o preço de cache.

Para fluxos de texto com prioridade em custo, RAG clássico e sumarização em massa, a MiMo-V2-Flash ganha. Para qualquer carga multimodal ou para quem precisa de benchmark de coding/agentic documentado, a Qwen3.5-122B-A10B ganha.

Em uma frase

Texto puro e fatura apertada: MiMo-V2-Flash. Multimodal, coding/agentic documentado ou throughput publicado como referência: Qwen3.5-122B-A10B, aceitando pagar 8x mais caro na saída.

Perguntas frequentes

MiMo-V2-Flash aceita imagem ou vídeo como entrada?

Não. A MiMo-V2-Flash é estritamente texto -> texto. Para multimodal, a única opção deste comparativo é a Qwen3.5-122B-A10B, que recebe texto, imagem e vídeo e devolve texto.

Qual dos dois é mais barato por milhão de tokens?

A MiMo-V2-Flash cobra US$ 0,10 de entrada e US$ 0,30 de saída por milhão de tokens; a Qwen3.5-122B-A10B cobra US$ 0,29 de entrada e US$ 2,40 de saída. A MiMo também publica cache a US$ 0,01; a Qwen não publicou preço de cache nesta data.

Os dois modelos permitem download dos pesos?

Sim. Ambos são open-weights — MiMo-V2-Flash com 309B totais e 15B ativos; Qwen3.5-122B-A10B com 125B totais e 10B ativos. Os dois são MoE com atenção híbrida e reasoning ligado.

Leia também