MiMo-V2-Flash e Gemma 4 26B A4B: dois MoE baratos que brigam por nichos diferentes
Ambos custam menos de US$ 0,40 por milhão de tokens de saída, mas o chinês da Xiaomi entrega mais raciocínio e o da Google entende imagem e vídeo.
O que está em jogo
Dois modelos com pesos abertos, dois Mixture-of-Experts recém-chegados ao catálogo, dois preços na faixa dos centavos por milhão de tokens. O MiMo-V2-Flash da Xiaomi estreou em dezembro de 2025; o Gemma 4 26B A4B da Google DeepMind chegou há uma semana, em 3 de abril de 2026. Ambos disputam a mesma prateleira: a dos modelos baratos que ainda dão para colocar em produção sem vender um rim. Mas eles não estão brigando pelo mesmo cliente.
O tamanho do cérebro (e o quanto ele gasta de verdade)
O MiMo-V2-Flash tem 309 bilhões de parâmetros totais, mas só ativa 15 bilhões por token. O Gemma 4 26B A4B é menor no papel — 25,2 bilhões totais — e ativa apenas 3,8 bilhões. Pense no MoE como um restaurante com cardápio enorme: cada pedido sai da cozinha usando só os cozinheiros daquela receita. O MiMo é um salão com 309 chefs no quadro e 15 na linha por prato; o Gemma é um salão com 25 chefs no quadro e quase 4 na linha.
A diferença prática aparece no índice de inteligência medido hoje pela Artificial Analysis: 34,024 para o MiMo-V2-Flash, 26,066 para o Gemma 4 26B A4B. São quase oito pontos de distância, num catálogo onde o topo (Gemini 3.1 Pro Preview) marca 47,738. Para efeitos de raciocínio geral, o chinês está mais perto do Claude Sonnet 4.6 do que o americano está dele.
| Critério | MiMo-V2-Flash | Gemma 4 26B A4B |
|---|---|---|
| Índice de inteligência | 34.0 | 26.1 |
| Entrada US$/M | 0.1 | 0.07 |
| Saída US$/M | 0.3 | 0.34 |
| Contexto | 262k | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | — | — |
| Índice de código | — | 39.3 |
| Índice agêntico | — | 11.0 |
O que cada um faz melhor
O Gemma 4 26B A4B traz um trunfo que o MiMo-V2-Flash não oferece: multimodalidade nativa. A ficha diz text+image+video->text, ou seja, você joga uma imagem ou um vídeo na entrada e recebe texto na saída. O MiMo trabalha só com texto. Se o seu pipeline precisa descrever frames, ler print de erro ou extrair informação de PDF com foto, o Gemma ganha por W.O.
Em coding, o Gemma também tem nota publicada: 39,316. O MiMo-V2-Flash não traz nota de coding nem de agentic no catálogo — campo vazio significa que a casa não publicou, não chute. Em agentic, o Gemma marca 11,036. É um número modesto, mas é o que tem.
A conta no fim do mês
Aqui a história fica interessante. O MiMo-V2-Flash cobra US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de saída, com cache a US$ 0,01 — preço de agressivo. O Gemma 4 26B A4B cobra US$ 0,07 de entrada e US$ 0,34 de saída, sem cache publicado. Na saída, o MiMo é 12% mais barato; na entrada, o Gemma é 30% mais barato. Para um workload típico de chat curto (pouca entrada, muita saída), o MiMo ganha. Para um workload de ingestão de documento (muita entrada, pouca saída), o Gemma ganha.
E tem o detalhe do cache: US$ 0,01 por milhão no MiMo é um diferencial relevante se você repete system prompts grandes. O Gemma não publicou esse valor — está em branco no catálogo, não é zero.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
Para quem vale cada um
MiMo-V2-Flash vale para você se: roda muito texto puro, precisa de raciocínio acima da média para a faixa de preço, faz chamadas longas com system prompt repetido (cache baratinho), e não precisa de visão. É o modelo para classificar, resumir, gerar, raciocinar — o canivete suíço de texto.
Gemma 4 26B A4B vale para você se: precisa entender imagem ou vídeo, quer pagar menos na entrada, ou está montando um pipeline multimodal enxuto. É o modelo para extrair informação visual, descrever UI, ler documento escaneado.
Para quem está acima do orçamento dos dois e quer só o melhor do mercado, o Gemini 3.1 Pro Preview cobra US$ 12 por milhão de saída — quarenta vezes o preço do MiMo. Para quem quer o teto de inteligência da faixa aberta, o MiMo-V2-Flash é hoje a referência; o Gemma entra quando multimodalidade é requisito.
Se o seu produto é texto puro e o orçamento é apertado, MiMo-V2-Flash; se precisa entender imagem ou vídeo sem estourar a conta na entrada, Gemma 4 26B A4B.
Perguntas frequentes
MiMo-V2-Flash ou Gemma 4 26B A4B: qual é mais barato?
Depende do lado do token. O MiMo cobra US$ 0,30 por milhão de tokens de saída contra US$ 0,34 do Gemma, mas o Gemma cobra US$ 0,07 de entrada contra US$ 0,10 do MiMo. Em workloads com mais saída, o MiMo ganha; com mais entrada, o Gemma ganha.
Qual dos dois entende imagem e vídeo?
Só o Gemma 4 26B A4B. A ficha do catálogo lista `text+image+video->text` para ele, enquanto o MiMo-V2-Flash é `text->text` apenas.
Os dois modelos têm pesos abertos?
Sim. Tanto o MiMo-V2-Flash quanto o Gemma 4 26B A4B estão marcados como open_weights no catálogo, então é possível baixar e rodar localmente, sujeito ao hardware que cada um exige.