MiMo-V2-Flash custa 8 vezes menos que a Qwen3.5-122B, mas só lê texto
Os dois são MoE chineses open-weights com reasoning. A diferença está no multimodal, nos benchmarks publicados e no preço de cache.
Oito vezes mais barato — em qual esquina fica a pegadinha?
A MiMo-V2-Flash da Xiaomi cobra US$ 0,30 por milhão de tokens de saída. A Qwen3.5-122B-A10B, da Qwen, cobra US$ 2,40. São oito vezes de diferença na fatura. A conta não é tudo — e o catálogo desta data mostra que, por trás do número, mora uma diferença que você precisa olhar antes de migrar.
Dois MoE chineses, duas estratégias
Os dois modelos são open-weights, ambos da China, ambos MoE com atenção híbrida. Pense em dois carros com o mesmo motor híbrido, mas carrocerias diferentes. A MiMo-V2-Flash tem 309 bilhões de parâmetros totais e 15 bilhões ativos; a Qwen3.5-122B-A10B tem 125 bilhões no total e 10 bilhões ativos. Janela de contexto das duas: 262.144 tokens. Os dois raciocinam (reasoning: true).
Onde elas divergem é no que aceitam como entrada. A Qwen3.5-122B-A10B é nativa multimodal: recebe texto, imagem e vídeo e devolve texto. A MiMo-V2-Flash é estritamente texto -> texto. Para a maioria dos fluxos de RAG, resumo e agentes puros em texto, isso não importa. Para qualquer pipeline que dependa de screenshot, frame de vídeo ou documento escaneado, importa muito.
Inteligência: a MiMo lidera por pouco
No índice de inteligência atual, a MiMo-V2-Flash marca 34,024 e a Qwen3.5-122B-A10B marca 32,847. Diferença pequena — pouco mais de 1 ponto — mas a favor da MiMo, que também é a mais barata das duas. Ambas ficam bem abaixo dos dois primeiros colocados do mercado hoje: Google Gemini 3.1 Pro Preview (47,738) e OpenAI GPT-5.3-Codex (45,512), que custam US$ 12 e US$ 14 por milhão de tokens de saída, respectivamente.
Onde a Qwen3.5-122B-A10B recupera terreno é em benchmarks específicos que a MiMo-V2-Flash simplesmente não publica: coding em 45,715 e agentic em 21,267. Se você está montando um agente de codificação ou testando raciocínio multi-etapa, a Qwen traz dado na nota fiscal; a Xiaomi traz silêncio.
Velocidade e a economia real
| Critério | MiMo-V2-Flash | Qwen3.5-122B-A10B |
|---|---|---|
| Índice de inteligência | 34.0 | 32.8 |
| Entrada US$/M | 0.1 | 0.29 |
| Saída US$/M | 0.3 | 2.4 |
| Contexto | 262k | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | — | 131 |
| Índice de código | — | 45.7 |
| Índice agêntico | — | 21.3 |
A Qwen3.5-122B-A10B declara 131,43 tokens por segundo de velocidade. A MiMo-V2-Flash não publica essa métrica no momento. Em cargas de inferência com reasoning ligado, throughput declarado muda a conta inteira — um modelo duas vezes mais lento custa efetivamente mais caro mesmo com o mesmo preço nominal.
Para complicar a equação da Qwen, o catálogo desta data não publica preço de cache para ela. Isso significa que fluxos com prompt repetido e cache hit — exatamente o cenário de agente e CI de código — não têm economia negociada e conhecida; você só descobre testando.
A MiMo-V2-Flash cobra US$ 0,01 por milhão de tokens de cache. Praticamente um arredondamento. Para pipelines de RAG que martelam o mesmo prompt com retrieval em cima, isso é dinheiro na mão.
Para quem cada um ganha
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
| MiMo-V2-Flash | 34.0 | 0.3 |
Escolha a MiMo-V2-Flash quando:
- Sua carga é 100% texto e vai continuar assim;
- O gargalo é a fatura de API, especialmente em alto volume de saída;
- Você usa cache agressivo (RAG com retrieval repetido, prompts de sistema pesados);
- Você quer o open-weights mais barato entre os chineses com reasoning.
Escolha a Qwen3.5-122B-A10B quando:
- Você precisa ler imagens ou vídeo no input — screenshot de bug, frame, página visual de UI;
- Sua workload é agentic ou de coding com reasoning pesado, e os benchmarks publicados (45,7 em coding, 21,3 em agentic) entram na decisão;
- Throughput declarado importa — os 131 t/s publicados servem de referência;
- Você está confortável pagando 8x mais caro na saída e esperando o catálogo publicar o preço de cache.
Para fluxos de texto com prioridade em custo, RAG clássico e sumarização em massa, a MiMo-V2-Flash ganha. Para qualquer carga multimodal ou para quem precisa de benchmark de coding/agentic documentado, a Qwen3.5-122B-A10B ganha.
Texto puro e fatura apertada: MiMo-V2-Flash. Multimodal, coding/agentic documentado ou throughput publicado como referência: Qwen3.5-122B-A10B, aceitando pagar 8x mais caro na saída.
Perguntas frequentes
MiMo-V2-Flash aceita imagem ou vídeo como entrada?
Não. A MiMo-V2-Flash é estritamente texto -> texto. Para multimodal, a única opção deste comparativo é a Qwen3.5-122B-A10B, que recebe texto, imagem e vídeo e devolve texto.
Qual dos dois é mais barato por milhão de tokens?
A MiMo-V2-Flash cobra US$ 0,10 de entrada e US$ 0,30 de saída por milhão de tokens; a Qwen3.5-122B-A10B cobra US$ 0,29 de entrada e US$ 2,40 de saída. A MiMo também publica cache a US$ 0,01; a Qwen não publicou preço de cache nesta data.
Os dois modelos permitem download dos pesos?
Sim. Ambos são open-weights — MiMo-V2-Flash com 309B totais e 15B ativos; Qwen3.5-122B-A10B com 125B totais e 10B ativos. Os dois são MoE com atenção híbrida e reasoning ligado.