FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Xiaomi lidera raciocínio no catálogo e cobra 26 vezes menos que OpenAI o3

MiMo-V2-Flash, modelo de pesos abertos da chinesa Xiaomi, lidera o recorte de raciocínio com IQ 34 e custa US$ 0,30 por milhão de tokens de saída — contra US$ 8 do o3.

Redação FalaVIP IA 3 min de leitura
US$ 0,30por milhão de tokens de saída no Xiaomi MiMo-V2-Flash
26×mais caro o OpenAI o3 pelo mesmo tipo de saída
5 de 8modelos destacados no recorte de raciocínio com pesos abertos

A virada que ninguém viu no release

Se você abrir hoje a tabela dos modelos de raciocínio no catálogo, vai encontrar uma liderança que não estava no roteiro. A Xiaomi, conhecida por celular, está no topo do recorte com o MiMo-V2-Flash, IQ 34,024, cobrando US$ 0,30 por milhão de tokens de saída. A OpenAI, três pontos abaixo com o o3 (IQ 31,096), cobra US$ 8 pelo mesmo milhão. A conta repete ela mesma: 26 vezes mais.

O MiMo não é nome que aparecia no noticiário de IA até três meses atrás. Xiaomi é a empresa que vende Redmi e aspirador robô. Ver o logo dela no topo do recorte de raciocínio é, por si só, a notícia — porque redefine de onde vem a fronteira nesta categoria.

Raciocínio virou commodity aberta

Inteligência × preço no recorte
MiMo-V2-Flasho3Claude Haiku 4.5gpt-oss-120bNova 2 LiteQwen3 Next 80B A3B ThinkingINTELLECT-3gpt-oss-20bUS$ por milhão (saída, escala log)índice de inteligência

Olha o gráfico de inteligência × preço. Os quatro modelos acima de IQ 24 contam três histórias: o o3, fechado e caro; o Claude Haiku 4.5 da Anthropic, fechado a US$ 5; e dois abertos — o MiMo da Xiaomi e o gpt-oss-120b da própria OpenAI — abaixo de US$ 0,30 por milhão de saída.

Quando 5 dos 8 modelos destacados no recorte têm pesos abertos, a categoria mudou de fase. Xiaomi, Qwen3 Next 80B A3B Thinking, INTELLECT-3 da Prime Intellect, gpt-oss-120b e gpt-oss-20b: todos disponíveis para baixar, hospedar em cloud própria ou consumir via API de revenda. Os dois modelos chineses do recorte — MiMo e Qwen3 Next — estão nesse bloco aberto; do lado americano, fechado e aberto dividem o espaço.

Destaques do recorte: modelos de raciocínio
ModeloCriadorInteligênciaSaída US$/MContexto
MiMo-V2-Flashxiaomi34.00.3262k
o3openai31.18200k
Claude Haiku 4.5anthropic29.95200k
gpt-oss-120bopenai24.10.17131k
Nova 2 Liteamazon19.22.51M
Qwen3 Next 80B A3B Thinkingqwen16.91.2262k
INTELLECT-3prime-intellect15.71.1131k
gpt-oss-20bopenai15.20.13131k

Raciocínio deixou de ser o terreno em que o laboratório americano mais caro vence por padrão.

Para quem isso muda a fatura

Se você roda agentes que disparam dezenas de chamadas por tarefa, a régua mudou. Um workflow que gasta 5 milhões de tokens de saída por dia no o3 sai por US$ 40. No MiMo, US$ 1,50. No gpt-oss-120b, US$ 0,85. Em raciocínio, a saída é o gargalo de sempre — e esse delta multiplica por dia, por usuário, por mês.

A outra mudança é arquitetural. MiMo é MoE com 309 bilhões de parâmetros totais e só 15 bilhões ativos por passagem. gpt-oss-120b são 117 bilhões totais com 5,1 bilhões ativos. O custo de servir é proporcional aos ativos, não ao total — dá para hospedar raciocínio de fronteira em uma única GPU de datacenter de 80 GB.

E o detalhe que complica o argumento dos fechados: o MiMo suporta 262 mil tokens de contexto, mais que o o3 (200 mil) e o Haiku 4.5 (200 mil). Só Nova 2 Lite, da Amazon, entrega janela maior no recorte — 1 milhão de tokens.

Para quem não muda nada

Entre os modelos do recorte com dados publicados, três aceitam multimodal: OpenAI o3, Claude Haiku 4.5 e Amazon Nova 2 Lite. Os abertos do topo são todos text→text — não enxergam imagem, não leem PDF anexo.

Se a sua tarefa exige janela de 1 milhão de tokens, só Nova 2 Lite entrega — e mesmo assim cobra US$ 2,50 por milhão de saída, num IQ de 19,24.

E se o seu critério é codificação com nota aferida publicada, Claude Haiku 4.5 lidera (43,892), seguido do gpt-oss-120b (30,441). MiMo, o3, Nova 2 Lite e INTELLECT-3 não publicaram essa nota — sem número, a comparação para por aí.

Outra diferença prática: o3 e Haiku 4.5 são hospedados e cobrados pelo criador. Os abertos podem ser auto-hospedados, o que muda jurisdição de dados e o SLA que você consegue negociar.

O que fazer amanhã

Pega o workload de raciocínio mais caro da sua operação e roda o mesmo prompt no MiMo-V2-Flash e no gpt-oss-120b. Olha custo por chamada e taxa de aceite. Se a qualidade aguentar 80% do o3, a sua fatura cai de um dígito. Se não aguentar, pelo menos você sai com o número exato da diferença que está pagando — e pode voltar ao o3 sabendo que era escolha, não ignorância.

Em uma frase

Migre um workload real de raciocínio para o MiMo-V2-Flash ou o gpt-oss-120b esta semana e meça: se a qualidade aguentar 80% do o3, a fatura mensal cai de um dígito sem trocar de fornecedor.

Perguntas frequentes

Xiaomi é confiável para raciocínio em produção?

O MiMo-V2-Flash tem pesos abertos e 15 bilhões de parâmetros ativos por passagem. O catálogo não publicou nota específica de codificação ou agente para ele, então a validação prática depende do seu caso — cabe num piloto de baixo custo antes de migrar de vez.

Quando ainda vale pagar o OpenAI o3?

Quando você precisa de multimodal nativo (texto, imagem, arquivo) com raciocínio, de janela ampla já testada e de notas aferidas em benchmarks específicos. O o3 lidera entre os fechados em raciocínio puro, mas a diferença caiu para cerca de 3 pontos de IQ enquanto o preço segue 26 vezes maior.

Modelo de raciocínio é sempre mais caro?

Era a regra até pouco tempo atrás. Hoje, no recorte, os cinco modelos abertos do topo cobram entre US$ 0,13 e US$ 1,20 por milhão de tokens de saída — menos do que muitos modelos não-raciocínio do catálogo. A conta virou pelo avesso.

Leia também