Xiaomi lidera raciocínio no catálogo e cobra 26 vezes menos que OpenAI o3
MiMo-V2-Flash, modelo de pesos abertos da chinesa Xiaomi, lidera o recorte de raciocínio com IQ 34 e custa US$ 0,30 por milhão de tokens de saída — contra US$ 8 do o3.
A virada que ninguém viu no release
Se você abrir hoje a tabela dos modelos de raciocínio no catálogo, vai encontrar uma liderança que não estava no roteiro. A Xiaomi, conhecida por celular, está no topo do recorte com o MiMo-V2-Flash, IQ 34,024, cobrando US$ 0,30 por milhão de tokens de saída. A OpenAI, três pontos abaixo com o o3 (IQ 31,096), cobra US$ 8 pelo mesmo milhão. A conta repete ela mesma: 26 vezes mais.
O MiMo não é nome que aparecia no noticiário de IA até três meses atrás. Xiaomi é a empresa que vende Redmi e aspirador robô. Ver o logo dela no topo do recorte de raciocínio é, por si só, a notícia — porque redefine de onde vem a fronteira nesta categoria.
Raciocínio virou commodity aberta
Olha o gráfico de inteligência × preço. Os quatro modelos acima de IQ 24 contam três histórias: o o3, fechado e caro; o Claude Haiku 4.5 da Anthropic, fechado a US$ 5; e dois abertos — o MiMo da Xiaomi e o gpt-oss-120b da própria OpenAI — abaixo de US$ 0,30 por milhão de saída.
Quando 5 dos 8 modelos destacados no recorte têm pesos abertos, a categoria mudou de fase. Xiaomi, Qwen3 Next 80B A3B Thinking, INTELLECT-3 da Prime Intellect, gpt-oss-120b e gpt-oss-20b: todos disponíveis para baixar, hospedar em cloud própria ou consumir via API de revenda. Os dois modelos chineses do recorte — MiMo e Qwen3 Next — estão nesse bloco aberto; do lado americano, fechado e aberto dividem o espaço.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| MiMo-V2-Flash | xiaomi | 34.0 | 0.3 | 262k |
| o3 | openai | 31.1 | 8 | 200k |
| Claude Haiku 4.5 | anthropic | 29.9 | 5 | 200k |
| gpt-oss-120b | openai | 24.1 | 0.17 | 131k |
| Nova 2 Lite | amazon | 19.2 | 2.5 | 1M |
| Qwen3 Next 80B A3B Thinking | qwen | 16.9 | 1.2 | 262k |
| INTELLECT-3 | prime-intellect | 15.7 | 1.1 | 131k |
| gpt-oss-20b | openai | 15.2 | 0.13 | 131k |
Raciocínio deixou de ser o terreno em que o laboratório americano mais caro vence por padrão.
Para quem isso muda a fatura
Se você roda agentes que disparam dezenas de chamadas por tarefa, a régua mudou. Um workflow que gasta 5 milhões de tokens de saída por dia no o3 sai por US$ 40. No MiMo, US$ 1,50. No gpt-oss-120b, US$ 0,85. Em raciocínio, a saída é o gargalo de sempre — e esse delta multiplica por dia, por usuário, por mês.
A outra mudança é arquitetural. MiMo é MoE com 309 bilhões de parâmetros totais e só 15 bilhões ativos por passagem. gpt-oss-120b são 117 bilhões totais com 5,1 bilhões ativos. O custo de servir é proporcional aos ativos, não ao total — dá para hospedar raciocínio de fronteira em uma única GPU de datacenter de 80 GB.
E o detalhe que complica o argumento dos fechados: o MiMo suporta 262 mil tokens de contexto, mais que o o3 (200 mil) e o Haiku 4.5 (200 mil). Só Nova 2 Lite, da Amazon, entrega janela maior no recorte — 1 milhão de tokens.
Para quem não muda nada
Entre os modelos do recorte com dados publicados, três aceitam multimodal: OpenAI o3, Claude Haiku 4.5 e Amazon Nova 2 Lite. Os abertos do topo são todos text→text — não enxergam imagem, não leem PDF anexo.
Se a sua tarefa exige janela de 1 milhão de tokens, só Nova 2 Lite entrega — e mesmo assim cobra US$ 2,50 por milhão de saída, num IQ de 19,24.
E se o seu critério é codificação com nota aferida publicada, Claude Haiku 4.5 lidera (43,892), seguido do gpt-oss-120b (30,441). MiMo, o3, Nova 2 Lite e INTELLECT-3 não publicaram essa nota — sem número, a comparação para por aí.
Outra diferença prática: o3 e Haiku 4.5 são hospedados e cobrados pelo criador. Os abertos podem ser auto-hospedados, o que muda jurisdição de dados e o SLA que você consegue negociar.
O que fazer amanhã
Pega o workload de raciocínio mais caro da sua operação e roda o mesmo prompt no MiMo-V2-Flash e no gpt-oss-120b. Olha custo por chamada e taxa de aceite. Se a qualidade aguentar 80% do o3, a sua fatura cai de um dígito. Se não aguentar, pelo menos você sai com o número exato da diferença que está pagando — e pode voltar ao o3 sabendo que era escolha, não ignorância.
Migre um workload real de raciocínio para o MiMo-V2-Flash ou o gpt-oss-120b esta semana e meça: se a qualidade aguentar 80% do o3, a fatura mensal cai de um dígito sem trocar de fornecedor.
Perguntas frequentes
Xiaomi é confiável para raciocínio em produção?
O MiMo-V2-Flash tem pesos abertos e 15 bilhões de parâmetros ativos por passagem. O catálogo não publicou nota específica de codificação ou agente para ele, então a validação prática depende do seu caso — cabe num piloto de baixo custo antes de migrar de vez.
Quando ainda vale pagar o OpenAI o3?
Quando você precisa de multimodal nativo (texto, imagem, arquivo) com raciocínio, de janela ampla já testada e de notas aferidas em benchmarks específicos. O o3 lidera entre os fechados em raciocínio puro, mas a diferença caiu para cerca de 3 pontos de IQ enquanto o preço segue 26 vezes maior.
Modelo de raciocínio é sempre mais caro?
Era a regra até pouco tempo atrás. Hoje, no recorte, os cinco modelos abertos do topo cobram entre US$ 0,13 e US$ 1,20 por milhão de tokens de saída — menos do que muitos modelos não-raciocínio do catálogo. A conta virou pelo avesso.