FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

MiMo-V2-Flash assume topo do índice por 27 vezes menos na saída

Modelo open-source da Xiaomi estreou no índice Artificial Analysis com 34,02 pontos; o3, segundo colocado, cobra US$ 8 por milhão de tokens de saída.

Redação FalaVIP IA 2 min de leitura
US$ 0,30por milhão de tokens de saída (MiMo-V2-Flash)
US$ 8,00por milhão de tokens de saída (o3)
27×diferença de preço por token gerado

O catálogo tem mais de 307 modelos e o topo do índice de inteligência tem hoje um ocupante novo: 34,02 pontos, contra 31,10 do o3. O nome é MiMo-V2-Flash, da Xiaomi, open-source, MoE de 309B com 15B ativos. E o que essa posição significa na fatura da API está em um único número: US$ 0,30 por milhão de tokens de saída, contra US$ 8 do modelo da OpenAI.

Índice de inteligência (Artificial Analysis)
MiMo-V2-Flash34o331,1índice
Fonte: Artificial Analysis

A diferença de quase 3 pontos no índice não é enorme, mas a de preço é. São 27 vezes mais barato por token gerado. Em 1 bilhão de tokens de saída por mês, são US$ 300 contra US$ 8.000. A diferença — US$ 7.700 — paga um estagiário júnior.

O preço que não está no release

Cache de prompt é o outro terreno onde o MiMo desmonta a conta. US$ 0,01 por milhão contra US$ 0,50 do o3. Cinquenta vezes mais barato. Onde isso dói? Em qualquer agente que relê contexto a cada turno — RAG pesado, chains longas, code review iterativo, multi-step com tool use.

Preço de saída (US$ por milhão de tokens)
MiMo-V2-Flash0,3o38US$/M
Fonte: OpenRouter

Entrada também pesa: US$ 0,10 contra US$ 2 por milhão de tokens. Vinte vezes mais barato. O contexto é maior também: 262 mil tokens no MiMo, 200 mil no o3. Não é o dobro, mas é o suficiente para estourar pipelines de análise de código inteiro ou bases de conhecimento longas.

MiMo-V2-Flash × o3
CritérioMiMo-V2-Flasho3
Índice de inteligência34.031.1
Entrada US$/M0.12
Saída US$/M0.38
Contexto262k200k
Pesos abertossimnão
Velocidade (tok/s)109
Índice de código
Índice agêntico

Onde o MiMo não compete

O o3 não é mais caro à toa. Ele aceita texto, imagem e arquivo na entrada; o MiMo é estritamente text->text. Se você precisa descrever um print de UI, ler um PDF escaneado ou analisar uma planilha anexada, o o3 segue sendo a referência entre os dois.

O o3 também traz knowledge cutoff declarado (junho de 2024), velocidade medida em 108,93 e vem de fornecedor americano — o que pesa em contratos com cláusulas de residência de dados, LGPD estrita ou HIPAA. O MiMo é chinês, open weights, e não publicou data de corte de conhecimento.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 307 modelos disponíveis no catálogo nesta data.

Self-host é outro ponto. Open weights não significa "roda na sua GPU de casa". MoE de 309B com 15B ativos exige cluster à altura. Para a maioria, a API da Xiaomi segue sendo a saída mais barata.

Quem ganha em quê

Escolha o MiMo-V2-Flash quando: o workload é texto puro em alto volume; a fatura de saída domina o P&L; você quer reduzir dependência de fornecedor; ou o pipeline precisa estourar o limite de 200K de contexto do o3.

Escolha o o3 quando: a tarefa envolve imagem, PDF ou arquivo anexo; compliance exige fornecedor americano auditável; o pipeline já está acoplado ao tooling da OpenAI e o custo de migrar não compensa.

O que muda na sua fila de segunda

Se você roda produção inteira em o3 só porque ele era a referência de qualidade, vale rodar um A/B cego de mil amostras em tarefas puramente textuais. A diferença de IQ é pequena (34 contra 31), mas a de custo não é — e em alto volume, a conta se resolve sozinha.

O o3 não perdeu relevância; perdeu a exclusividade do topo. Multimodal e governança seguem sendo dele. Texto puro em escala, agora é do chinês de 24 horas atrás.

Em uma frase

Migre para o MiMo-V2-Flash em qualquer workload textual de alto volume onde a fatura de saída dói; mantenha o o3 para tarefas com imagem, PDF ou exigência de fornecedor americano.

Perguntas frequentes

MiMo-V2-Flash é multimodal?

Não. O MiMo-V2-Flash é estritamente text->text. Para descrever imagens, ler PDFs ou analisar arquivos anexos, o o3 segue sendo a opção multimodal do comparativo.

Posso rodar o MiMo-V2-Flash na minha infraestrutura?

Sim, os pesos são abertos (MoE de 309B com 15B ativos). Na prática, 15B ativos com qualidade exigem cluster de GPU robusto — para a maior parte dos casos, a API da Xiaomi continua sendo a saída mais barata.

O o3 ainda vale a pena em dezembro de 2025?

Sim, em três cenários: tarefas que envolvem imagem, PDF ou arquivo anexo; contratos que exigem fornecedor americano com termos auditáveis; e pipelines já acoplados ao tooling da OpenAI, onde o custo de migrar supera a economia.

Leia também