MiMo-V2-Omni cobra US$ 2 por milhão e bate Qwen3.5-122B em inteligência
Dois modelos chineses lançados em fevereiro e março disputam o mesmo nicho multimodal — e a conta da API sai diferente.
Pesa na sua fatura: o MiMo-V2-Omni, da Xiaomi, custa US$ 2 por milhão de tokens de saída. O Qwen3.5-122B-A10B, da Qwen, sai por US$ 2,40. Diferença pequena em percentual, mas é o tipo de detalhe que decide entre duas chamadas e três chamadas por feature quando você está rodando um agente em produção.
Os dois são chineses, multimodais e foram lançados com menos de um mês de distância — MiMo em 18 de março, Qwen em 25 de fevereiro. Estão brigando pelo mesmo cliente: quem quer um modelo que entende imagem, vídeo e áudio sem ter que pagar tarifa de fronteira. O MiMo ainda adiciona áudio como entrada; o Qwen não. Se o seu pipeline transcreve ou analisa áudio antes de mandar pro LLM, isso já é um divisor.
Inteligência: o MiMo abre 3 pontos
No índice da Artificial Analysis medido hoje, o MiMo marca 35,87 e o Qwen 32,85. Três pontos de distância não é pouco quando você compara modelos do mesmo segmento. Para ter referência, o topo do catálogo hoje é o Gemini 3.1 Pro Preview, com 47,74 — então nenhum dos dois está brigando pelo pódio geral, mas o MiMo está visivelmente à frente do Qwen nessa régua.
O Qwen, por outro lado, é o único dos dois com nota publicada de coding: 45,72. É um número alto, acima do índice geral, o que sugere que o modelo foi afinado pensando em geração de código. O MiMo não tem nota de coding nem de agentic no catálogo — e a Xiaomi não publicou. Não chute a partir do índice geral.
Preço de entrada: o Qwen ganha por pouco
Na ponta da entrada, o Qwen cobra US$ 0,29 por milhão de tokens contra US$ 0,40 do MiMo. Se o seu caso de uso é resumir documentos grandes ou fazer RAG com prompts compridos, a conta pesa mais por aqui do que pela saída. Mas a diferença é de 11 centavos por milhão — em workloads típicos, isso some no orçamento.
O MiMo tem cache read por US$ 0,08 por milhão; o Qwen não publicou preço de cache. Quando o catálogo não publica, não inventa: significa que você precisa pedir orçamento ou testar antes de cravar a arquitetura.
| Critério | MiMo-V2-Omni | Qwen3.5-122B-A10B |
|---|---|---|
| Índice de inteligência | 35.9 | 32.8 |
| Entrada US$/M | 0.4 | 0.29 |
| Saída US$/M | 2 | 2.4 |
| Contexto | 262k | 262k |
| Pesos abertos | não | sim |
| Velocidade (tok/s) | — | 131 |
| Índice de código | — | 45.7 |
| Índice agêntico | — | 21.3 |
Onde cada um ganha — e onde nenhum dos dois serve
MiMo-V2-Omni ganha quando: você precisa de áudio nativo no pipeline, quer o melhor índice de inteligência entre os dois e não liga de pagar 38% a mais na entrada. Faz sentido para assistentes que ouvem chamadas, transcrevem reuniões ou analisam vídeos com legenda automática.
Qwen3.5-122B-A10B ganha quando: o trabalho é geração de código, você quer pesos abertos (open_weights: true, 125B de parâmetros totais com 10B ativos) e prefere um modelo com nota de agentic publicada — 21,27, baixa, mas publicada. Também é a escolha se você roda self-host e quer inspecionar o que está rodando.
Nenhum dos dois serve quando: você precisa do topo absoluto de inteligência. Tanto Gemini 3.1 Pro Preview (47,74) quanto GPT-5.3-Codex (45,51) estão acima, e o GPT-5.3 sai por US$ 14 por milhão — sete vezes o MiMo. Se a régua é "o melhor que existe", esses dois chineses não são a resposta.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
Implicação prática
Se você está montando um agente multimodal hoje e o áudio não entra no fluxo, o Qwen3.5-122B-A10B é a escolha racional: coding publicado, pesos abertos, entrada mais barata. Se o áudio entra, a conversa muda: o MiMo-V2-Omni processa áudio nativamente, e essa etapa a menos no pipeline vale mais que os 40 centavos extras por milhão na entrada. A diferença de três pontos no índice de inteligência não fecha a questão sozinha — mas quando o resto empata, ela pesa.
Sem áudio no pipeline, vá de Qwen3.5-122B-A10B; com áudio nativo, o MiMo-V2-Omni paga os 40 centavos extras por milhão na entrada.
Perguntas frequentes
MiMo-V2-Omni é melhor que Qwen3.5-122B-A10B?
Depende do uso. O MiMo tem índice de inteligência 35,87 contra 32,85 do Qwen e processa áudio nativamente. O Qwen tem nota de coding publicada (45,72) e pesos abertos. Para geração de código, o Qwen leva; para fluxos com áudio, o MiMo.
Quanto custa cada um por milhão de tokens?
MiMo-V2-Omni: US$ 0,40 de entrada e US$ 2,00 de saída por milhão de tokens, com cache read a US$ 0,08. Qwen3.5-122B-A10B: US$ 0,29 de entrada e US$ 2,40 de saída; preço de cache não publicado no catálogo.
Algum dos dois é open source?
O Qwen3.5-122B-A10B tem pesos abertos (125B totais, 10B ativos por inferência). O MiMo-V2-Omni não tem pesos abertos publicados — só é acessível via API.