Omni da Xiaomi custa 75% menos que o o3 e entrega mais inteligência
MiMo-V2-Omni estreou há seis dias cobrando US$ 2 por milhão de saída enquanto o o3, com quase um ano de casa, cobra US$ 8 — e ainda perde em benchmark.
O preço que a OpenAI cobra por ser a OpenAI
Você paga US$ 8 por milhão de tokens de saída no o3 e US$ 2 no MiMo-V2-Omni. Não é erro de tabela. O modelo da Xiaomi, lançado em 18 de março, custa exatamente um quarto do que a OpenAI cobra pelo o3 desde abril de 2025. E não estamos falando de um modelo chinês qualquer brigando por migalha: ele aparece em terceiro lugar no ranking de inteligência do catálogo, acima do Claude Sonnet 4.6 e do Qwen3.5.
A diferença que o benchmark mostra
A conta fica ainda mais desconfortável quando você olha o índice de inteligência. O MiMo-V2-Omni marca 35,866; o o3, 31,096. O modelo chinês é mais inteligente segundo a medição atual do catálogo, custa 75% menos na saída e ainda oferece cache de leitura por US$ 0,08 contra US$ 0,50 do o3 — uma diferença de seis vezes.
| Critério | MiMo-V2-Omni | o3 |
|---|---|---|
| Índice de inteligência | 35.9 | 31.1 |
| Entrada US$/M | 0.4 | 2 |
| Saída US$/M | 2 | 8 |
| Contexto | 262k | 200k |
| Pesos abertos | não | não |
| Velocidade (tok/s) | — | 109 |
| Índice de código | — | — |
| Índice agêntico | — | — |
Pensa na API como uma conta de luz: o o3 é o kWh mais caro do bairro, e o MiMo-V2-Omni é o mesmo kWh em outro poste, com medidor diferente. O serviço entregue — raciocínio, multimodalidade, contexto — está ali. O que muda é quem assina a fatura.
Multimodal nativo versus multimodal com arquivo
Aqui mora uma diferença que o preço sozinho não conta. O MiMo-V2-Omni é omni-modal de verdade: processa imagem, vídeo e áudio dentro da mesma arquitetura, sem você ter que pré-processar nada. O o3 aceita texto, imagem e arquivo, mas arquivo é basicamente texto embarcado — você manda o PDF e o modelo lê, não interpreta o vídeo. Se o seu produto é um agente que olha tela, transcreve reunião ou analisa vídeo de câmera, o caminho da Xiaomi é o que entrega a função sem gambiarra.
O contexto também joga a favor do chinês: 262 mil tokens contra 200 mil do o3. Não é差距 absurdo, mas em fluxos de agente que acumulam histórico é folga que sobra.
Onde cada um ganha
O o3 não está morto. Ele tem uma vantagem concreta: knowledge cutoff em junho de 2024 declarado, velocidade de 108,93 tokens por segundo medida e um ano a mais de maturidade em produção. Se o seu stack já tem prompts afinados para o o3, se você depende de latência estável e de um modelo que a OpenAI ainda atualiza com patch de segurança, trocar agora é trocar estabilidade por economia.
O MiMo-V2-Omni ganha em três cenários: produto multimodal que precisa ouvir e ver nativamente, fluxo com muito cache de leitura (a diferença de 6x no cache multiplica em pipelines RAG), e qualquer workload de raciocínio onde o índice de inteligência atual pesa mais que a reputação da marca. Para quem está começando um projeto novo, a conta é simples: o chinês entrega mais por menos.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
O que sobra na prateleira
O o3 é um modelo de transição. Foi lançado como o topo da OpenAI em abril de 2025 e hoje aparece abaixo do MiMo-V2-Omni, do Claude Sonnet 4.6 e do Qwen3.5 em inteligência. A OpenAI já tem o GPT-5.3-Codex no segundo lugar do ranking, a US$ 14 por milhão de saída — então o o3 virou a opção "barata" da casa, só que não é mais barata que o resto do mercado.
Para você que paga a conta da API, a pergunta não é "Xiaomi ou OpenAI". É: faz sentido continuar pagando US$ 8 por milhão num modelo que já foi ultrapassado em inteligência e em multimodalidade por um chinês de seis dias?
Comece o próximo projeto multimodal com MiMo-V2-Omni e só migre para o o3 se a latência medida dele for bloqueadora no seu fluxo.
Perguntas frequentes
O MiMo-V2-Omni é realmente mais barato que o o3?
Sim. Custa US$ 2 por milhão de tokens de saída contra US$ 8 do o3, e o cache de leitura sai por US$ 0,08 contra US$ 0,50 — uma diferença de seis vezes no cache.
Qual dos dois é melhor para análise de vídeo?
O MiMo-V2-Omni processa vídeo nativamente na mesma arquitetura, enquanto o o3 trabalha com texto, imagem e arquivo. Para fluxo de agente que consome vídeo ou áudio, o modelo da Xiaomi entrega a função sem pré-processamento.
Vale a pena trocar do o3 para o MiMo-V2-Omni agora?
Se o seu projeto é multimodal, depende muito de cache de leitura ou está começando do zero, vale. Se você já tem prompts afinados para o o3 e precisa de latência estável com SLA de fornecedor americano, espere a Xiaomi mostrar um trimestre de produção antes de migrar.