FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

MiMo-V2.5 da Xiaomi: multimodal a US$ 0,28 por milhão de tokens

Quatro dias após o lançamento, o novo modelo da Xiaomi aceita imagem, áudio e vídeo — mas o IQ 38 deixa claro que não disputa o topo do catálogo.

Redação FalaVIP IA 3 min de leitura
US$ 0,28por milhão de tokens de saída
IQ 38,04índice de inteligência do catálogo
mais barato que o MiMo-V2-Omni anterior

A conta antes do hype

A Xiaomi diz que o MiMo-V2.5 entrega "desempenho Pro-level pela metade do custo de inferência". Traduzindo do release para a fatura da API: o token de saída sai por US$ 0,28, frente aos US$ 0,87 do MiMo-V2.5-Pro — quase um terço do preço, na verdade. E, ao contrário do Pro, este aqui aceita imagem, áudio e vídeo como entrada. Omnimodal nativo nesse preço é raro: o parente próximo no catálogo, o MiMo-V2-Omni, cobra US$ 2 por milhão de saída. São sete vezes mais caro.

Quatro dias depois do lançamento, a pergunta que importa não é "mais um modelo chinês?". É: para que tipo de carga este aqui se paga?

Ficha técnica — MiMo-V2.5
CampoValor
Identificadorxiaomi/mimo-v2.5
Criadorxiaomi
Preço de entradaUS$ 0.140 / M tokens
Preço de saídaUS$ 0.280 / M tokens
Janela de contexto1.05M
Modalidadetext+image+audio+video->text
Leitura de cacheUS$ 0.003 / M (98% de desconto)
Índice de inteligência (AA)38.0
Índice de código56.8
Índice agêntico24.4
Parâmetros310B (15B ativos por token)
Pesosabertos
Velocidade de saída58 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

O que ele é, de verdade

MiMo-V2.5 é uma MoE de 310 bilhões de parâmetros totais com 15 bilhões ativos por token. Pense em um hospital com 310 médicos no quadro, mas só 15 de plantão por consulta — você paga o preço do especialista, mas só chama quem é preciso. Contexto de 1.050.000 tokens, raciocínio habilitado, pesos abertos. Velocidade nominal de 57,52. Modalidade text+image+audio+video→text: consome qualquer coisa, devolve texto.

A descrição oficial destaca que ele "supera o MiMo-V2-Omni em percepção multimodal". Olhando o índice de inteligência do catálogo, o V2.5 marca 38,04 e o Omni, 35,87. Tradução: ele não é só mais barato, é objetivamente mais capaz que o Omni que custava sete vezes mais. Em coding, marca 56,8; em agentic, 24,4 — números respeitáveis, mas distantes do Pro.

Onde se encaixa no tabuleiro

O catálogo tem hoje 413 modelos de 56 criadores. No topo, o Google Gemini 3.1 Pro Preview lidera com IQ 47,74 a US$ 12 por milhão de saída. DeepSeek V4 Pro vem logo abaixo, com IQ 45,27 e o melhor custo-benefício acima de IQ 45: US$ 1,74. O MiMo-V2.5-Pro da própria Xiaomi está em IQ 42,88 a US$ 0,87.

Índice de inteligência (Artificial Analysis)
MiMo-V2.538MiMo-V2-Flash34MiMo-V2.5-Pro42,9MiMo-V2-Omni35,9Qwen3.5-122B-A10B32,8índice
Fonte: Artificial Analysis

O V2.5 fica quase cinco pontos abaixo do Pro da casa. Isso é uma diferença real em raciocínio complexo — coding 56,8 contra 60,2 do Pro, agentic 24,4 contra 29,5. Em tarefas onde o modelo precisa encadear muitos passos, essa lacuna aparece em idas e vindas extras até acertar.

Inteligência × preço de saída
MiMo-V2.5MiMo-V2-FlashMiMo-V2.5-ProMiMo-V2-OmniQwen3.5-122B-A10BUS$ por milhão (saída, escala log)índice de inteligência

Onde ele brilha é no canto inferior esquerdo do gráfico: multimodal nativo, abaixo de US$ 0,30 de saída, com IQ acima de 38. Não tem muita coisa ali disputando espaço.

Para quem vale — e para quem não muda nada

Se você roda pipelines de visão, vídeo ou áudio em escala — indexação, classificação, extração, descrição — e o custo é o gargalo, o MiMo-V2.5 é candidato sério. Input a US$ 0,14 e cache a US$ 0,0028 por milhão deixam prompts longos viáveis em produção sem estourar a fatura. Pesos abertos com 15B ativos significam que dá para hospedar em hardware de empresa sem lotar data center.

Se você precisa do topo de raciocínio, este aqui não compete. DeepSeek V4 Pro, Gemini 3.1 Pro Preview e GPT-5.3-Codex custam mais, mas entregam de cinco a dez pontos a mais de IQ. Em coding agentic, a diferença se traduz em menos loops.

Se você já roda o MiMo-V2.5-Pro e o custo não é o problema, manter o Pro faz mais sentido: mesmo fornecedor, mesma API, IQ mais alto.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
MiMo-V2.5 (o novo)38.00.140.281.05M
MiMo-V2-Flash34.00.10.3262k
MiMo-V2.5-Pro42.90.4350.871.05M
MiMo-V2-Omni35.90.42262k
Qwen3.5-122B-A10B32.80.292.4262k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Implicação prática

O MiMo-V2.5 não é o melhor modelo do mercado. É o multimodal nativo mais barato entre os modelos relevantes que estão no catálogo hoje. Para cargas de percepção multimodal onde o orçamento manda, vale testar antes de partir para os US$ 2 por milhão do Omni ou os US$ 12 do Gemini.

Você escolhe por centavos precisa lembrar: cinco pontos de IQ podem ser a diferença entre um agente que termina o trabalho e um que fica em loop. Antes de migrar, meça a taxa de conclusão da tarefa, não só o preço do token.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
DeepSeek V4 Pro 042345.32.0845
MiMo-V2.5-Pro42.90.87
MiMo-V2.538.00.28
Entre os 413 modelos disponíveis no catálogo nesta data.
Em uma frase

Para multimodal barato em escala, MiMo-V2.5 é o candidato; para o topo de raciocínio, DeepSeek V4 Pro ou Gemini 3.1 Pro Preview continuam entregando o que a conta justifica.

Perguntas frequentes

MiMo-V2.5 é gratuito?

Não. Input sai a US$ 0,14 e output a US$ 0,28 por milhão de tokens, com cache a US$ 0,0028. É barato, mas não é grátis.

Qual a diferença do MiMo-V2.5 para o MiMo-V2.5-Pro?

O Pro tem IQ 42,88 (contra 38,04 do V2.5), 1.023B de parâmetros totais (contra 310B) e custa US$ 0,87 por milhão de saída — cerca de três vezes mais caro por um ganho real em raciocínio, coding e agentic. O Pro também é só texto.

MiMo-V2.5 aceita imagem e vídeo?

Sim. É um modelo omnimodal nativo: processa texto, imagem, áudio e vídeo como entrada e devolve texto. É a grande diferença em relação ao MiMo-V2.5-Pro, que é só texto.

Leia também