MiMo-V2-Flash da Xiaomi custa 27 vezes menos que o o3
Modelo aberto da Xiaomi entra no topo do índice de inteligência com preço de saída de US$ 0,30 por milhão de tokens e bate de frente com Haiku 4.5 e o3.
Você está olhando para o topo do índice de inteligência e o primeiro lugar não é da OpenAI, nem da Anthropic, nem do Google. É da Xiaomi. O MiMo-V2-Flash estreou ontem e já aparece com IQ de 34,024 no catálogo que reúne 307 modelos ativos de 47 criadores diferentes — uma amostra grande o suficiente para o número não ser acaso.
O que a Xiaomi entregou de verdade
MiMo-V2-Flash é um modelo aberto, com 309 bilhões de parâmetros totais e apenas 15 bilhões ativos por inferência. É a arquitetura Mixture-of-Experts funcionando a favor da conta: o modelo é enorme no papel, mas só “acorda” uma fração dos pesos a cada token gerado. É como manter um caminhão de mudança no estacionamento e usar só o porta-malas do carro no dia a dia — você paga o espaço, mas o combustível é de compacto.
O contexto é de 262 mil tokens, acima dos 200 mil do Haiku 4.5 e do o3. O preço de entrada é US$ 0,10 por milhão de tokens e o de saída, US$ 0,30. Tem cache por US$ 0,01. Não é gratuito, mas o ticket é pequeno.
Onde ele se encaixa no tabuleiro
Para situar o MiMo no mercado, o melhor é olhar o que já estava no pódio antes dele chegar. O o3, da OpenAI, lidera entre os modelos fechados “de peso” com IQ de 31,096 e cobra US$ 8 por milhão de tokens de saída. O Claude Haiku 4.5, da Anthropic, marca 29,892 e sai por US$ 5. O MiMo-V2-Flash passa os dois em inteligência medida e cobra, respectivamente, 27 vezes e 17 vezes menos por token gerado.
A diferença não é só de preço. O o3 é multimodal (aceita texto, imagem e arquivo) e o Haiku 4.5 também. O MiMo-V2-Flash é text→text. Se o seu pipeline depende de ler uma imagem ou um PDF, ele não substitui os outros. Também não há dado público de velocidade (tokens por segundo) nem de benchmark específico de coding ou agentic para o MiMo — então qualquer afirmação do tipo “é melhor para programar” ou “é mais rápido” não passa de chute até aparecer medição.
Para quem vale a pena
Se você roda um agente que consome muito token de saída — geração de código, sumarização longa, pipelines de RAG com respostas extensas — o MiMo-V2-Flash muda a conta no fim do mês. O cache de US$ 0,01 é outro chamariz: dá para encadear prompts longos sem multiplicar o custo. E por ser open weights, é possível hospedar, fazer fine-tuning ou inspecionar os pesos, algo que o3 e Haiku 4.5 não permitem.
Para times pequenos e CTOs de empresa enxuta, o cálculo é direto: substituir parte do tráfego de Haiku 4.5 por MiMo-V2-Flash em tarefas textuais puras pode reduzir o custo variável sem perder qualidade. Em 15 de dezembro de 2025, com 31 modelos lançados nos últimos 30 dias, o catálogo está denso — e o chinês chega para competir na faixa que antes era só americana.
| Campo | Valor |
|---|---|
| Identificador | xiaomi/mimo-v2-flash |
| Criador | xiaomi |
| Preço de entrada | US$ 0.100 / M tokens |
| Preço de saída | US$ 0.300 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.010 / M (90% de desconto) |
| Índice de inteligência (AA) | 34.0 |
| Parâmetros | 309B (15B ativos por token) |
| Pesos | abertos |
| Raciocínio | sim (gasta tokens de saída pensando) |
Para quem não muda nada
Se você precisa de multimodalidade (imagem, PDF, áudio transcrito), o MiMo-V2-Flash não cobre. Se o seu caso de uso depende de benchmark específico de coding ou agentic com nota publicada, o o3 e o Haiku 4.5 ainda trazem esses números — o MiMo, por ora, não. E se a sua stack exige SLA de fornecedor ocidental com contrato enterprise, um modelo chinês open weights rodando em provedor terceiro exige um plano B de contingência que não vinha no release.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| MiMo-V2-Flash (o novo) | 34.0 | 0.1 | 0.3 | 262k |
| Claude Haiku 4.5 | 29.9 | 1 | 5 | 200k |
| o3 | 31.1 | 2 | 8 | 200k |
O que olhar nas próximas semanas
Três sinais vão dizer se o MiMo-V2-Flash é barulho de estreia ou mudança real. Primeiro, benchmarks de coding e agentic aparecendo publicamente — sem isso, o índice geral é a única régua. Segundo, latência por token em provedores reais: o MoE de 309B/15B é eficiente no papel, mas a velocidade depende da implementação. Terceiro, estabilidade do preço: US$ 0,30 de saída é agressivo demais para não gerar dúvida sobre promoção de lançamento.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Por enquanto, o movimento é claro: a Xiaomi colocou um modelo aberto no topo do índice e cobrou uma fração do que os líderes americanos custam. Se você roda muito texto puro e a conta da API está doendo, vale testar esta semana.
Se o seu caso de uso é só texto e o custo de saída pesa na fatura, troque parte do tráfego para o MiMo-V2-Flash agora; se depende de imagem, PDF ou benchmark específico de coding, espere os números públicos.
Perguntas frequentes
Quanto custa o Xiaomi MiMo-V2-Flash por milhão de tokens?
O preço de entrada é US$ 0,10 por milhão de tokens e o de saída, US$ 0,30. O cache de prompt sai por US$ 0,01 por milhão, o que ajuda em cadeias longas de RAG e agentes.
O MiMo-V2-Flash é melhor que o Claude Haiku 4.5?
No índice geral de inteligência da Artificial Analysis, o MiMo marca 34,024 contra 29,892 do Haiku 4.5 e custa 17 vezes menos no token de saída. A diferença prática depende do seu caso: o MiMo é só texto, enquanto o Haiku aceita imagem, PDF e arquivo.
Dá para rodar o MiMo-V2-Flash localmente?
Sim, os pesos são abertos. São 309 bilhões de parâmetros totais com 15 bilhões ativos por inferência, então o hardware mínimo é o de um modelo denso de 15B — embora o download completo exija o espaço do modelo inteiro.