MiMo-V2-Omni é o único do top 5 que processa áudio por US$ 2
O modelo é o terceiro mais inteligente do catálogo e o mais barato entre os cinco primeiros. Serve para áudio nativo, não para o topo absoluto de raciocínio.
A Xiaomi lançou ontem o MiMo-V2-Omni e o release chama o modelo de "frontier omni-modal". O índice de inteligência Artificial Analysis discorda em parte: 35.866 pontos, terceiro lugar no catálogo de hoje, atrás de Gemini 3.1 Pro Preview (47.738) e GPT-5.3-Codex (45.512). "Frontier", aqui, parece significar "top 3" — não "top 1". Vale separar o marketing do tabuleiro real.
O que "omni-modal" quer dizer aqui
O MiMo-V2-Omni aceita texto, imagem, vídeo e áudio como entrada e devolve apenas texto, em arquitetura unificada. Os pares diretos do catálogo — Qwen3.5 397B A17B e Qwen3.5 122B A10B — processam texto, imagem e vídeo, mas não áudio nativamente. O Claude Haiku 4.5 aceita arquivo, mas trata áudio como anexo que passa por transcrição antes. O MiMo-V2-Omni é o único modelo do top 5 do índice que recebe áudio em arquitetura unificada.
A diferença parece sutil quando o input é só imagem. Fica grande em centrais de atendimento, análise de reuniões, moderação de podcast ou agentes que reagem a comandos de voz: tirar a etapa de speech-to-text reduz latência e o custo total, mesmo que o token de saída do Omni custe mais que o de um modelo de texto puro.
A conta, finalmente
A US$ 2 por milhão de tokens de saída, o MiMo-V2-Omni é o modelo mais barato entre os cinco primeiros do índice de inteligência. Gemini 3.1 Pro Preview cobra US$ 12. GPT-5.3-Codex, US$ 14. Claude Sonnet 4.6, US$ 15. O preço de cache — US$ 0,08 por milhão — é mais barato que o do Claude Haiku 4.5 (US$ 0,10), o que derruba custo em pipelines com system prompt repetido.
O modelo da própria Xiaomi para texto puro, o MiMo-V2-Flash, cobra US$ 0,30 por milhão de saída. Omni custa quase sete vezes mais — o prêmio pela multimodalidade nativa. E há outro detalhe: o MiMo-V2-Flash tem pesos abertos, o Omni não. A Xiaomi decidiu abrir o texto e fechar o multimodal.
Para quem vale
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| MiMo-V2-Omni (o novo) | 35.9 | 0.4 | 2 | 262k |
| MiMo-V2-Flash | 34.0 | 0.1 | 0.3 | 262k |
| Qwen3.5-122B-A10B | 32.8 | 0.29 | 2.4 | 262k |
| Qwen3.5 397B A17B | 34.3 | 0.55 | 3.5 | 262k |
| Claude Haiku 4.5 | 29.9 | 1 | 5 | 200k |
O MiMo-V2-Omni faz sentido em três cenários:
- Áudio nativo no pipeline, sem etapa de speech-to-text separada.
- Contexto longo com cache: 262 mil tokens de janela e US$ 0,08 de cache por milhão pagam rápido em pipelines com system prompt estável.
- Multimodal sem orquestração, quando passar imagem, vídeo e áudio pelo mesmo endpoint simplifica o código mais do que o token mais caro compensa.
Para quem não muda nada
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
Se o caso é texto puro, o MiMo-V2-Flash da própria Xiaomi entrega IQ 34.024 — 1,8 ponto abaixo — por US$ 0,30 de saída, quase sete vezes mais barato. Se multimodal com pesos abertos for prioridade, os Qwen 3.5 entregam notas próximas com 397B e 122B parâmetros disponíveis para self-host, e custam US$ 2,34 e US$ 2,40 por milhão de saída, na mesma faixa.
E se você precisa do topo absoluto de inteligência, os quase 12 pontos de IQ que separam o MiMo-V2-Omni do Gemini 3.1 Pro Preview continuam sendo um abismo em raciocínio complexo. O MiMo-V2-Omni é forte no meio do tabuleiro, não no topo — e a fatura mensal vai mostrar isso quando o workload escalar. Hoje ele ocupa o lugar certo do mercado: multimodal nativo barato, não o topo do raciocínio.
Use MiMo-V2-Omni quando áudio nativo entra no pipeline e o orçamento pesa; pule para Gemini 3.1 Pro ou GPT-5.3-Codex quando o que importa é o topo do raciocínio.
Perguntas frequentes
MiMo-V2-Omni substitui o Gemini 3.1 Pro Preview?
Não. São quase 12 pontos de IQ de diferença, com Gemini na frente em raciocínio complexo. O MiMo-V2-Omni compete em custo por multimodalidade nativa, não em capacidade bruta.
Qual a diferença entre MiMo-V2-Omni e MiMo-V2-Flash?
O Omni é multimodal nativo (imagem, vídeo, áudio) e fechado, custando US$ 2 por milhão de saída. O Flash é só texto, tem pesos abertos e custa US$ 0,30 por milhão — quase sete vezes mais barato por token.
Áudio nativo muda o que na prática?
Elimina a etapa de transcrição antes do modelo. Em pipelines com voz (centrais, reuniões, podcasts), isso reduz latência e custo total, mesmo com o token de saída do Omni sendo mais caro que o de um modelo de texto puro.