FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

MiMo-V2-Omni a US$ 2 ou Qwen3.5-122B a US$ 2,40? O que cada chinês de março entrega por esse preço

Dois modelos chineses lançados em fevereiro e março disputam a faixa de preço mais barata do catálogo — um é multimodal nativo, o outro é aberto e tem benchmark de código.

Redação FalaVIP IA 3 min de leitura
US$ 2,00MiMo-V2-Omni, saída por milhão de tokens
US$ 2,40Qwen3.5-122B-A10B, saída por milhão de tokens
35,87 vs 32,85índice de inteligência Artificial Analysis

Dois chineses na prateleira de baixo custo

Você está olhando o catálogo e encontra dois modelos chineses lançados a menos de 30 dias um do outro, ambos na faixa dos US$ 2 por milhão de tokens de saída. O MiMo-V2-Omni da Xiaomi chegou em 18 de março; o Qwen3.5-122B-A10B da Qwen, em 25 de fevereiro. Os dois custam quase a mesma coisa — US$ 2,00 contra US$ 2,40 por milhão de tokens saindo — e os dois ficam bem abaixo dos US$ 12 do Gemini 3.1 Pro Preview e dos US$ 14 do GPT-5.3-Codex, os dois únicos acima do índice 45 de inteligência hoje.

A pergunta não é qual é mais barato. A pergunta é o que cada um entrega por esse preço.

O que separa um do outro

Preço de saída (US$ por milhão de tokens)
MiMo-V2-Omni2Qwen3.5-122B-A10B2,4US$/M
Fonte: OpenRouter

O MiMo é um modelo omni-modal nativo: aceita texto, imagem, áudio e vídeo e devolve texto. O Qwen3.5-122B é um vision-language — aceita texto, imagem e vídeo, mas não tem áudio. Em tarefas de visão, os dois se equivalem; em áudio, só o MiMo entra.

A conta de entrada também difere. O MiMo cobra US$ 0,40 por milhão de tokens de entrada e ainda oferece cache de prompt a US$ 0,08 — útil se você repete o mesmo contexto várias vezes. O Qwen cobra US$ 0,29 na entrada, mais barato, mas o catálogo não publicou preço de cache para ele.

Onde a diferença pesa mesmo é em três pontos: capacidade de raciocínio medida, código e pesos abertos.

Inteligência, código e abertura

Índice de inteligência (Artificial Analysis)
MiMo-V2-Omni35,9Qwen3.5-122B-A10B32,8índice
Fonte: Artificial Analysis

O índice de inteligência Artificial Analysis coloca o MiMo em 35,87 e o Qwen em 32,85. Três pontos de distância num índice que vai até 100 não é muita coisa — os dois ficam num meio de tabela onde a maioria dos modelos de uso geral se concentra. Mas existe uma diferença que o índice geral não mostra: o Qwen tem nota específica de coding igual a 45,72, enquanto o MiMo não tem essa nota publicada no catálogo. Em tarefas de programação, o Qwen é o único dos dois com benchmark disponível.

MiMo-V2-Omni × Qwen3.5-122B-A10B
CritérioMiMo-V2-OmniQwen3.5-122B-A10B
Índice de inteligência35.932.8
Entrada US$/M0.40.29
Saída US$/M22.4
Contexto262k262k
Pesos abertosnãosim
Velocidade (tok/s)131
Índice de código45.7
Índice agêntico21.3

E tem a questão dos pesos. O Qwen3.5-122B-A10B é open weights, com 125 bilhões de parâmetros totais e 10 bilhões ativos por inferência, numa arquitetura híbrida de atenção linear com mixture-of-experts. Você pode baixar e rodar localmente se tiver hardware. O MiMo-V2-Omni é API-only — não há pesos públicos.

Velocidade e o que o catálogo não diz

O Qwen tem velocidade registrada de 131,43 tokens por segundo. Para o MiMo, o catálogo não publicou velocidade — então não dá para comparar lado a lado sem chutar. O mesmo vale para benchmark de código do MiMo e para o preço de cache do Qwen: o catálogo simplesmente não traz esses números, e o que não está no dado não existe para este texto.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
MiMo-V2-Omni35.92
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
Entre os 374 modelos disponíveis no catálogo nesta data.

Ambos são chineses, ambos têm raciocínio ativo e ambos operam com janela de 262.144 tokens. Nenhum dos dois chega perto do topo do mercado em inteligência — para isso, o catálogo aponta Gemini 3.1 Pro Preview e GPT-5.3-Codex, que custam de seis a sete vezes mais.

Quando cada um ganha

O MiMo-V2-Omni ganha quando o seu fluxo depende de áudio: transcrição, análise de chamada, qualquer coisa que envolva voz ou vídeo com fala. Também ganha se você usa o mesmo prompt repetidamente em escala — o cache a US$ 0,08 derruba o custo efetivo de entrada. E ganha em inteligência geral medida: 35,87 contra 32,85.

O Qwen3.5-122B-A10B ganha quando o que você quer é rodar localmente ou inspecionar os pesos — ele é open weights, o MiMo não. Ganha em programação, onde tem benchmark de 45,72 publicado e o concorrente não tem. E ganha em preço de entrada puro: US$ 0,29 contra US$ 0,40 por milhão de tokens.

Se a sua escolha fosse só pelo índice de inteligência, o MiMo leva. Se fosse só por código e abertura, o Qwen leva. Como nem todo mundo precisa das duas coisas, a resposta não é "depende" — é saber qual das duas você precisa.

Implicação prática

Se você está montando um produto com voz, vídeo ou áudio, comece pelo MiMo-V2-Omni e meça o cache antes de reclamar do preço. Se está prototipando um agente que escreve código e quer evitar a fatura da API, baixe o Qwen3.5-122B-A10B e rode local — os 10 bilhões de parâmetros ativos cabem em hardware de consumidor bem equipado. E se nenhum dos dois resolve, o salto para os US$ 12 do Gemini ou US$ 14 do GPT-5.3-Codex continua sendo o único caminho acima do índice 45.

Em uma frase

MiMo para áudio e multimodal com cache; Qwen para código e self-hosting — escolha pelo caso de uso, não pelo índice geral.

Perguntas frequentes

MiMo-V2-Omni ou Qwen3.5-122B-A10B: qual é mais barato?

O MiMo custa US$ 2,00 por milhão de tokens de saída e o Qwen US$ 2,40. Na entrada, o Qwen é mais barato (US$ 0,29 contra US$ 0,40), mas só o MiMo tem preço de cache publicado (US$ 0,08 por milhão).

Qual dos dois roda localmente?

Só o Qwen3.5-122B-A10B tem pesos abertos, com 125B de parâmetros totais e 10B ativos por inferência. O MiMo-V2-Omni é exclusivo via API.

Qual é melhor para programar?

O Qwen tem benchmark de código publicado (45,72 no índice Artificial Analysis). O catálogo não traz nota de código para o MiMo-V2-Omni, então não dá para afirmar que ele entrega o mesmo em programação.

Leia também