FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

MiMo-V2-Flash e Gemma 4 26B A4B: dois MoE baratos que brigam por nichos diferentes

Ambos custam menos de US$ 0,40 por milhão de tokens de saída, mas o chinês da Xiaomi entrega mais raciocínio e o da Google entende imagem e vídeo.

Redação FalaVIP IA 3 min de leitura
US$ 0,30preço de saída do MiMo-V2-Flash por milhão de tokens
US$ 0,34preço de saída do Gemma 4 26B A4B por milhão de tokens
34,024 vs 26,066índice de inteligência Artificial Analysis

O que está em jogo

Dois modelos com pesos abertos, dois Mixture-of-Experts recém-chegados ao catálogo, dois preços na faixa dos centavos por milhão de tokens. O MiMo-V2-Flash da Xiaomi estreou em dezembro de 2025; o Gemma 4 26B A4B da Google DeepMind chegou há uma semana, em 3 de abril de 2026. Ambos disputam a mesma prateleira: a dos modelos baratos que ainda dão para colocar em produção sem vender um rim. Mas eles não estão brigando pelo mesmo cliente.

Índice de inteligência (Artificial Analysis)
MiMo-V2-Flash34Gemma 4 26B A4B 26,1índice
Fonte: Artificial Analysis

O tamanho do cérebro (e o quanto ele gasta de verdade)

O MiMo-V2-Flash tem 309 bilhões de parâmetros totais, mas só ativa 15 bilhões por token. O Gemma 4 26B A4B é menor no papel — 25,2 bilhões totais — e ativa apenas 3,8 bilhões. Pense no MoE como um restaurante com cardápio enorme: cada pedido sai da cozinha usando só os cozinheiros daquela receita. O MiMo é um salão com 309 chefs no quadro e 15 na linha por prato; o Gemma é um salão com 25 chefs no quadro e quase 4 na linha.

A diferença prática aparece no índice de inteligência medido hoje pela Artificial Analysis: 34,024 para o MiMo-V2-Flash, 26,066 para o Gemma 4 26B A4B. São quase oito pontos de distância, num catálogo onde o topo (Gemini 3.1 Pro Preview) marca 47,738. Para efeitos de raciocínio geral, o chinês está mais perto do Claude Sonnet 4.6 do que o americano está dele.

MiMo-V2-Flash × Gemma 4 26B A4B
CritérioMiMo-V2-FlashGemma 4 26B A4B
Índice de inteligência34.026.1
Entrada US$/M0.10.07
Saída US$/M0.30.34
Contexto262k262k
Pesos abertossimsim
Velocidade (tok/s)
Índice de código39.3
Índice agêntico11.0

O que cada um faz melhor

O Gemma 4 26B A4B traz um trunfo que o MiMo-V2-Flash não oferece: multimodalidade nativa. A ficha diz text+image+video->text, ou seja, você joga uma imagem ou um vídeo na entrada e recebe texto na saída. O MiMo trabalha só com texto. Se o seu pipeline precisa descrever frames, ler print de erro ou extrair informação de PDF com foto, o Gemma ganha por W.O.

Em coding, o Gemma também tem nota publicada: 39,316. O MiMo-V2-Flash não traz nota de coding nem de agentic no catálogo — campo vazio significa que a casa não publicou, não chute. Em agentic, o Gemma marca 11,036. É um número modesto, mas é o que tem.

Preço de saída (US$ por milhão de tokens)
MiMo-V2-Flash0,3Gemma 4 26B A4B 0,34US$/M
Fonte: OpenRouter

A conta no fim do mês

Aqui a história fica interessante. O MiMo-V2-Flash cobra US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de saída, com cache a US$ 0,01 — preço de agressivo. O Gemma 4 26B A4B cobra US$ 0,07 de entrada e US$ 0,34 de saída, sem cache publicado. Na saída, o MiMo é 12% mais barato; na entrada, o Gemma é 30% mais barato. Para um workload típico de chat curto (pouca entrada, muita saída), o MiMo ganha. Para um workload de ingestão de documento (muita entrada, pouca saída), o Gemma ganha.

E tem o detalhe do cache: US$ 0,01 por milhão no MiMo é um diferencial relevante se você repete system prompts grandes. O Gemma não publicou esse valor — está em branco no catálogo, não é zero.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
MiMo-V2-Omni35.92
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
Entre os 390 modelos disponíveis no catálogo nesta data.

Para quem vale cada um

MiMo-V2-Flash vale para você se: roda muito texto puro, precisa de raciocínio acima da média para a faixa de preço, faz chamadas longas com system prompt repetido (cache baratinho), e não precisa de visão. É o modelo para classificar, resumir, gerar, raciocinar — o canivete suíço de texto.

Gemma 4 26B A4B vale para você se: precisa entender imagem ou vídeo, quer pagar menos na entrada, ou está montando um pipeline multimodal enxuto. É o modelo para extrair informação visual, descrever UI, ler documento escaneado.

Para quem está acima do orçamento dos dois e quer só o melhor do mercado, o Gemini 3.1 Pro Preview cobra US$ 12 por milhão de saída — quarenta vezes o preço do MiMo. Para quem quer o teto de inteligência da faixa aberta, o MiMo-V2-Flash é hoje a referência; o Gemma entra quando multimodalidade é requisito.

Em uma frase

Se o seu produto é texto puro e o orçamento é apertado, MiMo-V2-Flash; se precisa entender imagem ou vídeo sem estourar a conta na entrada, Gemma 4 26B A4B.

Perguntas frequentes

MiMo-V2-Flash ou Gemma 4 26B A4B: qual é mais barato?

Depende do lado do token. O MiMo cobra US$ 0,30 por milhão de tokens de saída contra US$ 0,34 do Gemma, mas o Gemma cobra US$ 0,07 de entrada contra US$ 0,10 do MiMo. Em workloads com mais saída, o MiMo ganha; com mais entrada, o Gemma ganha.

Qual dos dois entende imagem e vídeo?

Só o Gemma 4 26B A4B. A ficha do catálogo lista `text+image+video->text` para ele, enquanto o MiMo-V2-Flash é `text->text` apenas.

Os dois modelos têm pesos abertos?

Sim. Tanto o MiMo-V2-Flash quanto o Gemma 4 26B A4B estão marcados como open_weights no catálogo, então é possível baixar e rodar localmente, sujeito ao hardware que cada um exige.

Leia também