MiMo-V2-Omni cobra 1/7 do Sonnet 4.6 e quase empata em inteligência
Omni-modal chinês a US$ 2 por milhão de saída versus o modelo da Anthropic a US$ 15. A diferença pesa na fatura mais do que no benchmark.
A diferença que sobra no fim do mês
O catálogo tem 373 modelos neste dia. Xiaomi e Anthropic ocupam a mesma faixa de capacidade, com 35,866 e 35,108 de índice de inteligência. Em termos práticos, estão colados. Mas a conta não: o MiMo-V2-Omni custa US$ 2 por milhão de tokens de saída; o Sonnet 4.6, US$ 15. Mesma régua de capacidade, preço sete vezes e meio maior do lado americano. Quem roda agente ou geração longa no fim do mês sente isso na fatura antes de sentir no benchmark.
O que o release do MiMo promete — e o que o dado confirma
A descrição do MiMo-V2-Omni diz "frontier omni-modal" e cita grounding visual, raciocínio em múltiplas etapas e capacidade agentic. Traduzindo: aceita imagem, vídeo e áudio no mesmo modelo, sem você encadear três APIs. A modalidade declarada é text+image+audio+video->text, com contexto de 262.144 tokens. É multimodal nativo, não um wrapper em volta de um modelo de texto. Em China, com 53 criadores no catálogo, poucos chegam a esse nível de unificação. Pelo lado do Sonnet 4.6, a modalidade é text+image+file->text — também multimodal, mas sem áudio nem vídeo declarados, e com contexto de 1.000.000 de tokens, quatro vezes o do MiMo.
O que cada um faz melhor de verdade
| Critério | MiMo-V2-Omni | Claude Sonnet 4.6 |
|---|---|---|
| Índice de inteligência | 35.9 | 35.1 |
| Entrada US$/M | 0.4 | 3 |
| Saída US$/M | 2 | 15 |
| Contexto | 262k | 1M |
| Pesos abertos | não | não |
| Velocidade (tok/s) | — | 41 |
| Índice de código | — | — |
| Índice agêntico | — | — |
Onde o Sonnet 4.6 leva vantagem clara:
- Contexto: 1.000.000 de tokens contra 262.144. Para codebase inteiro, transcrição de call longa ou PDF monstro, o limite maior muda o jogo.
- Cache de prompt: US$ 0,30 por milhão contra US$ 0,08. Curiosamente o MiMo tem cache mais barato, mas o Sonnet tem a infraestrutura mais madura do mercado para reuso agressivo de prompt — Anthropic inventou essa categoria de preço.
- Velocidade declarada: 41,37 tokens por segundo. O MiMo-V2-Omni não publicou velocidade no catálogo, então não há comparação justa.
- Omniscience: -2,1 contra -20,133. Quanto mais perto de zero, menos o modelo "alucina" sobre o próprio conhecimento. O MiMo erra muito mais quando perguntado sobre o que sabe. Isso importa para agentes que precisam calibrar confiança.
- Tamanho do catálogo hoje: ambos estão no top 5 por inteligência, com o MiMo em terceiro e o Sonnet em quarto. Estar empatado no topo dois dias depois do lançamento (lançado em 18 de março de 2026) é o que está chamando atenção.
Onde o MiMo-V2-Omni leva:
- Preço de entrada: US$ 0,40 por milhão contra US$ 3. Sete vezes e meio mais barato para processar input.
- Preço de saída: US$ 2 contra US$ 15.
- Modalidade completa: áudio e vídeo entram sem truque.
- Raciocínio nativo: o campo
reasoningestá marcado como true; no Sonnet 4.6 está false. Para problemas de múltiplas etapas, isso pode pesar.
Quem é quem nesse tabuleiro em 19 de março de 2026
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
Os dois únicos modelos acima de IQ 45 são Gemini 3.1 Pro Preview e GPT-5.3-Codex, a US$ 12 e US$ 14 por milhão de saída respectivamente. Ou seja: a faixa logo abaixo, onde MiMo e Sonnet brigam, é onde mora a melhor relação entre capacidade e preço. O Gemini 3.1 Pro Preview entrega 47,738 de IQ por US$ 12; o MiMo entrega 35,866 por US$ 2. Razão de preço por ponto de IQ? Gemini custa 0,25; MiMo custa 0,056. Se você não precisa do topo absoluto, a conta do MiMo é difícil de bater.
Em que situação cada um ganha
O MiMo-V2-Omni ganha quando seu gargalo é custo por chamada: pipelines de áudio e vídeo, agentes que fazem milhares de chamadas curtas, qualquer workload que precisa de multimodal nativo e pode tolerar uma janela de contexto menor. Pagar US$ 0,08 de cache em vez de US$ 0,30 muda a aritmética de produto inteiro.
O Sonnet 4.6 ganha quando seu gargalo é tamanho do contexto e confiabilidade sobre o próprio conhecimento: analise de repositório monolítico, agente que precisa navegar 800k tokens sem truncar, ou workflow onde "o modelo afirma algo que não sabe" é risco de produto. A velocidade publicada de 41,37 t/s e o ecossistema Anthropic de tool use também pesam.
Para uma startup brasileira rodando agente em produção: comece o protótipo no MiMo, valide o produto, e migre para Sonnet 4.6 só quando o contexto curto ou a taxa de erro no conhecimento próprio começar a doer.
Use MiMo-V2-Omni para multimodal nativo com custo baixo; troque para Sonnet 4.6 quando precisar de contexto longo ou menos erro sobre o próprio conhecimento.
Perguntas frequentes
MiMo-V2-Omni é mais barato que o Claude Sonnet 4.6?
Sim, em todas as métricas de preço: US$ 0,40 contra US$ 3 por milhão de tokens de entrada, US$ 2 contra US$ 15 por milhão de saída, e US$ 0,08 contra US$ 0,30 por milhão em cache de prompt.
Qual dos dois tem contexto maior?
O Claude Sonnet 4.6, com 1.000.000 de tokens — quase quatro vezes os 262.144 tokens do MiMo-V2-Omni.
MiMo-V2-Omni processa áudio e vídeo?
Sim. A modalidade declarada é text+image+audio+video->text, com suporte nativo. O Sonnet 4.6 não declara áudio nem vídeo no catálogo.