FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

MiMo-V2-Omni é o único do top 5 que processa áudio por US$ 2

O modelo é o terceiro mais inteligente do catálogo e o mais barato entre os cinco primeiros. Serve para áudio nativo, não para o topo absoluto de raciocínio.

Redação FalaVIP IA 2 min de leitura
US$ 2por milhão de tokens de saída
35.866índice de inteligência (3º do catálogo)
US$ 0,08por milhão de tokens em cache

A Xiaomi lançou ontem o MiMo-V2-Omni e o release chama o modelo de "frontier omni-modal". O índice de inteligência Artificial Analysis discorda em parte: 35.866 pontos, terceiro lugar no catálogo de hoje, atrás de Gemini 3.1 Pro Preview (47.738) e GPT-5.3-Codex (45.512). "Frontier", aqui, parece significar "top 3" — não "top 1". Vale separar o marketing do tabuleiro real.

Índice de inteligência (Artificial Analysis)
MiMo-V2-Omni35,9MiMo-V2-Flash34Qwen3.5-122B-A10B32,8Qwen3.5 397B A17B34,3Claude Haiku 4.529,9índice
Fonte: Artificial Analysis

O que "omni-modal" quer dizer aqui

O MiMo-V2-Omni aceita texto, imagem, vídeo e áudio como entrada e devolve apenas texto, em arquitetura unificada. Os pares diretos do catálogo — Qwen3.5 397B A17B e Qwen3.5 122B A10B — processam texto, imagem e vídeo, mas não áudio nativamente. O Claude Haiku 4.5 aceita arquivo, mas trata áudio como anexo que passa por transcrição antes. O MiMo-V2-Omni é o único modelo do top 5 do índice que recebe áudio em arquitetura unificada.

A diferença parece sutil quando o input é só imagem. Fica grande em centrais de atendimento, análise de reuniões, moderação de podcast ou agentes que reagem a comandos de voz: tirar a etapa de speech-to-text reduz latência e o custo total, mesmo que o token de saída do Omni custe mais que o de um modelo de texto puro.

A conta, finalmente

Preço de saída (US$ por milhão de tokens)
MiMo-V2-Omni2MiMo-V2-Flash0,3Qwen3.5-122B-A10B2,4Qwen3.5 397B A17B3,5Claude Haiku 4.55US$/M
Fonte: OpenRouter

A US$ 2 por milhão de tokens de saída, o MiMo-V2-Omni é o modelo mais barato entre os cinco primeiros do índice de inteligência. Gemini 3.1 Pro Preview cobra US$ 12. GPT-5.3-Codex, US$ 14. Claude Sonnet 4.6, US$ 15. O preço de cache — US$ 0,08 por milhão — é mais barato que o do Claude Haiku 4.5 (US$ 0,10), o que derruba custo em pipelines com system prompt repetido.

O modelo da própria Xiaomi para texto puro, o MiMo-V2-Flash, cobra US$ 0,30 por milhão de saída. Omni custa quase sete vezes mais — o prêmio pela multimodalidade nativa. E há outro detalhe: o MiMo-V2-Flash tem pesos abertos, o Omni não. A Xiaomi decidiu abrir o texto e fechar o multimodal.

Para quem vale

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
MiMo-V2-Omni (o novo)35.90.42262k
MiMo-V2-Flash34.00.10.3262k
Qwen3.5-122B-A10B32.80.292.4262k
Qwen3.5 397B A17B34.30.553.5262k
Claude Haiku 4.529.915200k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

O MiMo-V2-Omni faz sentido em três cenários:

  • Áudio nativo no pipeline, sem etapa de speech-to-text separada.
  • Contexto longo com cache: 262 mil tokens de janela e US$ 0,08 de cache por milhão pagam rápido em pipelines com system prompt estável.
  • Multimodal sem orquestração, quando passar imagem, vídeo e áudio pelo mesmo endpoint simplifica o código mais do que o token mais caro compensa.

Para quem não muda nada

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
MiMo-V2-Omni35.92
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
Entre os 373 modelos disponíveis no catálogo nesta data.

Se o caso é texto puro, o MiMo-V2-Flash da própria Xiaomi entrega IQ 34.024 — 1,8 ponto abaixo — por US$ 0,30 de saída, quase sete vezes mais barato. Se multimodal com pesos abertos for prioridade, os Qwen 3.5 entregam notas próximas com 397B e 122B parâmetros disponíveis para self-host, e custam US$ 2,34 e US$ 2,40 por milhão de saída, na mesma faixa.

E se você precisa do topo absoluto de inteligência, os quase 12 pontos de IQ que separam o MiMo-V2-Omni do Gemini 3.1 Pro Preview continuam sendo um abismo em raciocínio complexo. O MiMo-V2-Omni é forte no meio do tabuleiro, não no topo — e a fatura mensal vai mostrar isso quando o workload escalar. Hoje ele ocupa o lugar certo do mercado: multimodal nativo barato, não o topo do raciocínio.

Em uma frase

Use MiMo-V2-Omni quando áudio nativo entra no pipeline e o orçamento pesa; pule para Gemini 3.1 Pro ou GPT-5.3-Codex quando o que importa é o topo do raciocínio.

Perguntas frequentes

MiMo-V2-Omni substitui o Gemini 3.1 Pro Preview?

Não. São quase 12 pontos de IQ de diferença, com Gemini na frente em raciocínio complexo. O MiMo-V2-Omni compete em custo por multimodalidade nativa, não em capacidade bruta.

Qual a diferença entre MiMo-V2-Omni e MiMo-V2-Flash?

O Omni é multimodal nativo (imagem, vídeo, áudio) e fechado, custando US$ 2 por milhão de saída. O Flash é só texto, tem pesos abertos e custa US$ 0,30 por milhão — quase sete vezes mais barato por token.

Áudio nativo muda o que na prática?

Elimina a etapa de transcrição antes do modelo. Em pipelines com voz (centrais, reuniões, podcasts), isso reduz latência e custo total, mesmo com o token de saída do Omni sendo mais caro que o de um modelo de texto puro.

Leia também