FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Xiaomi lança MiMo-V2-Flash a US$ 0,30 por milhão de saída e lidera o catálogo

Modelo open-weights de 309B parâmetros custa 26 vezes menos que o o3 da OpenAI por token de saída.

Redação FalaVIP IA 3 min de leitura
US$ 0,30por milhão de tokens de saída
309B parâmetros totais / 15B ativosarquitetura Mixture-of-Experts
262.144 tokensjanela de contexto

Você já deve ter visto a manchete: Xiaomi entrou no catálogo com o modelo mais barato entre os que pontuam acima de 30 no índice de inteligência. A pergunta que interessa é outra — o que isso muda na fatura da API quando você roda em produção.

O MiMo-V2-Flash chegou hoje custando US$ 0,30 por milhão de tokens de saída e US$ 0,10 por milhão de tokens de entrada, com cache a US$ 0,01. É um modelo de 309 bilhões de parâmetros totais, mas só 15 bilhões ficam ativos por inferência — a tal arquitetura Mixture-of-Experts que aciona só o pedaço da rede que cada token precisa. Pense num restaurante com 309 cozinheiros no quadro, mas só 15 vão ao fogão por pedido: a cozinha é enorme, o ticket sai barato.

Preço de saída (US$ por milhão de tokens)
MiMo-V2-Flash0,3o38Claude Haiku 4.55gpt-oss-120b0,17US$/M
Fonte: OpenRouter

O que o número de inteligência quer dizer

O índice atual atribui 34,024 ao MiMo-V2-Flash — a maior nota entre os 307 modelos listados hoje. Como o catálogo guarda apenas modelos ainda ativos, esse 307 é um piso: lançamentos que saíram do ar depois não aparecem. A Xiaomi assume a liderança isolada, à frente do o3 da OpenAI (31,096) e do Claude Haiku 4.5 da Anthropic (29,892). Detalhe importante: o índice é a medição de hoje, não uma série histórica — então não dá para afirmar que o MiMo "subiu" ou "disparou"; só que, nesta data, ele está no topo.

Índice de inteligência (Artificial Analysis)
MiMo-V2-Flash34o331,1Claude Haiku 4.529,9gpt-oss-120b24,1índice
Fonte: Artificial Analysis

O que muda na conta

Aqui está a tensão real. O o3 cobra US$ 8 por milhão de tokens de saída. O MiMo-V2-Flash cobra US$ 0,30. Mesmo considerando a entrada (US$ 0,10 contra algo na faixa de US$ 2 a 15 do o3, dependendo do tier), a diferença por milhão de tokens de saída é de 26 vezes. Para um pipeline que gera, digamos, 50 milhões de tokens por mês, a conta com o3 passa de US$ 400; com MiMo-V2-Flash fica em US$ 15 — e ainda sobra cache a um centavo.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
MiMo-V2-Flash (o novo)34.00.10.3262k
o331.128200k
Claude Haiku 4.529.915200k
gpt-oss-120b24.10.0370.17131k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

O Claude Haiku 4.5, que costuma ser a referência de "barato e competente" da Anthropic, sai a US$ 5 por milhão de saída. O gpt-oss-120b da própria OpenAI é o concorrente mais direto em preço: US$ 0,17 por milhão de saída, mas com índice de inteligência de 24,126 — quase dez pontos abaixo do MiMo.

Inteligência × preço de saída
MiMo-V2-Flasho3Claude Haiku 4.5gpt-oss-120bUS$ por milhão (saída, escala log)índice de inteligência

Para quem vale — e para quem não

Vale se você roda cargas com muito token de saída: geração de texto longo, pipelines de agente que despejam logs e respostas, sumarização em massa, extração estruturada de documentos. Vale também se você quer self-host — os pesos são abertos, e os 15 bilhões ativos por inferência cabam em hardware mais modesto do que o número total sugere. A janela de 262.144 tokens ajuda quem processa documentos grandes sem precisar fragmentar.

Não muda nada se o seu gargalo é raciocínio de fronteira em problemas onde cada ponto percentual de acurácia importa mais que o custo. O o3 continua sendo o o3, e benchmarks de coding e agentic não foram publicados no catálogo para o MiMo-V2-Flash — então não dá para cravar onde ele tropeça. Também não muda nada para quem já está preso a um contrato enterprise com a OpenAI ou a Anthropic: preço de catálogo é uma coisa, o que você paga no seu contrato é outra.

Ficha técnica — MiMo-V2-Flash
CampoValor
Identificadorxiaomi/mimo-v2-flash
Criadorxiaomi
Preço de entradaUS$ 0.100 / M tokens
Preço de saídaUS$ 0.300 / M tokens
Janela de contexto262k
Modalidadetext->text
Leitura de cacheUS$ 0.010 / M (90% de desconto)
Índice de inteligência (AA)34.0
Parâmetros309B (15B ativos por token)
Pesosabertos
Raciocíniosim (gasta tokens de saída pensando)

Onde a Xiaomi entra no tabuleiro

É a primeira vez que a Xiaomi aparece no topo do índice deste catálogo. A empresa vem da China, é mais conhecida por hardware de consumo, e o movimento mira o mesmo nicho que a DeepSeek abriu em 2024: modelo de peso aberto, preço agressivo, benchmark competitivo. O fato de o modelo ser chinês não é detalhe — explica a estratégia de preço e a escolha de abrir pesos para ganhar tração fora do ecossistema doméstico.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 307 modelos disponíveis no catálogo nesta data.

O que fazer com isso hoje

Se você paga API por token de saída e ainda não testou alternativa chinesa, este é o dia. Rode uma amostra do seu caso real — não benchmark genérico — sobre o MiMo-V2-Flash e meça latência, qualidade e custo. Se a qualidade passar no seu limiar, a economia é imediata. Se não passar, você ainda tem o gpt-oss-120b a US$ 0,17 como segundo degrau, e o Claude Haiku 4.5 como terceira opção antes de subir para o o3. O tabuleiro de preços mudou hoje; o seu próximo deploy é quem vai sentir.

Em uma frase

Trocar o3 por MiMo-V2-Flash em cargas com muito token de saída pode cortar a fatura em mais de 20 vezes, mas só vale se a qualidade do modelo chinês passar no seu caso de uso real.

Perguntas frequentes

Quanto custa o MiMo-V2-Flash da Xiaomi?

US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de tokens de saída, com cache a US$ 0,01 por milhão. É o modelo mais barato entre os que pontuam acima de 30 no índice de inteligência do catálogo.

O MiMo-V2-Flash tem pesos abertos?

Sim. É open-weights, com 309 bilhões de parâmetros totais e 15 bilhões ativos por inferência (Mixture-of-Experts), o que reduz o custo de hospedagem em relação a modelos densos do mesmo porte total.

MiMo-V2-Flash é melhor que o o3 da OpenAI?

No índice de inteligência do catálogo, o MiMo-V2-Flash marca 34,024 contra 31,096 do o3. Mas o índice é uma medição geral; para tarefas específicas de coding ou agentic, cujo benchmark não foi publicado para o MiMo, é preciso testar antes de trocar.

Leia também