FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

MiMo-V2-Flash lidera catálogo inteiro e custa 26 vezes menos que o3

MoE assume o topo do ranking de inteligência do catálogo nesta data. A diferença de preço para os modelos densos é o que muda a conta em produção.

Redação FalaVIP IA 3 min de leitura
US$ 0,30/Mpreço de saída do Xiaomi MiMo-V2-Flash, o MoE mais inteligente do catálogo
26 vezesmais barato que o OpenAI o3 na mesma métrica de saída
11 modeloscom arquitetura MoE no catálogo de mais de 314 hoje

O catálogo guarda mais de 314 modelos hoje. Olhando só os que adotam mistura de especialistas (MoE), você encontra 11 — e o primeiro da lista geral é exatamente um deles. Xiaomi MiMo-V2-Flash aparece no topo do ranking de inteligência com IQ 34,024, à frente do OpenAI o3 (31,096) e do Anthropic Claude Haiku 4.5 (29,892). A diferença de preço, porém, é o que chama atenção: o MiMo custa US$ 0,30 por milhão de tokens de saída, contra US$ 8,00 do o3.

O topo do ranking agora é MoE

Dos cinco modelos mais bem pontuados do catálogo, dois são MoE: o MiMo da Xiaomi e o gpt-oss-120b da OpenAI (IQ 24,126). Os outros três — o3, Claude Haiku 4.5 e o Mistral Devstral 2 — são modelos densos, do tipo clássico. A faixa alta do ranking, portanto, não é mais ocupada por um único paradigma de arquitetura.

Inteligência × preço no recorte
MiMo-V2-Flashgpt-oss-120bQwen3 Next 80B A3B ThinkingMistral Large 3 2512INTELLECT-3gpt-oss-20bNemotron 3 Nano 30B A3BLlama 4 MaverickUS$ por milhão (saída, escala log)índice de inteligência

A mistura de especialistas funciona como uma equipe de chefs em que cada pedido só aciona alguns deles. Para cada token, o modelo escolhe quais sub-redes consultar; o resto do peso fica em disco mas não pesa na GPU. É por isso que o MiMo ativa só 15B dos seus 309B totais por consulta, e mesmo assim lidera o ranking.

A conta, traduzida

Quando o release da Xiaomi diz que o MiMo é competitivo, a tradução prática é esta: US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de saída. Em comparação, o gpt-oss-120b — segundo MoE mais inteligente da lista — sai a US$ 0,17/M de saída, quase metade do preço do o3 e cerca de trinta vezes mais barato que o Claude Haiku 4.5 (US$ 5,00/M) na mesma métrica.

Destaques do recorte: mistura de especialistas (MoE)
ModeloCriadorInteligênciaSaída US$/MContexto
MiMo-V2-Flashxiaomi34.00.3262k
gpt-oss-120bopenai24.10.17131k
Qwen3 Next 80B A3B Thinkingqwen16.91.2262k
Mistral Large 3 2512mistralai15.91.5262k
INTELLECT-3prime-intellect15.71.1131k
gpt-oss-20bopenai15.20.13131k
Nemotron 3 Nano 30B A3Bnvidia14.50.2262k
Llama 4 Maverickmeta-llama14.50.6961.05M

Os dois MoE da OpenAI ocupam os extremos do recorte. O gpt-oss-120b é o que entrega melhor raciocínio entre os abertos da empresa (coding 30,441); o gpt-oss-20b, com apenas 3,6B parâmetros ativos, é o chão de preço do catálogo: US$ 0,03/M de entrada e US$ 0,13/M de saída.

Nem todo MoE é igual

O recorte mostra uma dispersão grande. De um lado, o gpt-oss-20b da OpenAI a US$ 0,13/M de saída. Do outro, o Mistral Large 3 2512, a US$ 1,50/M, com 675B parâmetros totais e 41B ativos. A Mistral tem o MoE mais "pesado" da lista em volume absoluto, mas o IQ 15,919 fica abaixo do MiMo, do gpt-oss-120b e até do Qwen3 Next 80B A3B Thinking (IQ 16,867). Mais parâmetros totais, neste recorte, não compram mais inteligência por dólar.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 314 modelos disponíveis no catálogo nesta data.

O MiMo atinge o topo do catálogo com 309B totais e só 15B ativos — uma taxa de ativação de 4,85%. O Mistral Large 3 ativa 6,07%; o Llama 4 Maverick, 4,23% dos seus 402B totais. A taxa varia, mas o que parece importar mais é o treinamento e os dados, não o tamanho bruto.

Para quem essa arquitetura faz sentido — e para quem não

MoE vale para quem roda raciocínio em alto volume e quer pagar centavos por token de saída. O MiMo, o gpt-oss-120b e o Qwen3 Next Thinking entregam reasoning nativo com preços que viabilizam agentes. Vale também para quem quer pesos abertos: todos os oito do recorte listam pesos abertos.

Não muda nada para quem já está feliz com um modelo denso de fronteira ou tem contrato com desconto agressivo. E não muda nada para workloads onde latência é crítica: o Mistral Large 3 roda a 77 tokens por segundo, contra 247 do Nemotron 3 Nano da NVIDIA, também MoE. O MoE mais rápido do recorte é justamente o menor.

O que fazer com isso hoje

Se a fatura de API está pesando em tarefas de raciocínio, comece pelo MiMo-V2-Flash e pelo gpt-oss-120b. São os dois MoE com melhor IQ do catálogo agora, custam centavos por milhão e entregam reasoning de verdade. O Mistral Large 3 só se justifica se você precisa especificamente da janela multimodal de 262k ou se roda on-prem e quer o modelo aberto mais pesado da Mistral. Para prototipagem barata, o gpt-oss-20b a US$ 0,03 de entrada é imbatível.

Em uma frase

Para raciocínio em alto volume, troque o modelo denso de fronteira por um MoE como MiMo-V2-Flash ou gpt-oss-120b — a economia no token de saída chega a uma ordem de grandeza sem perda mensurável de capacidade.

Perguntas frequentes

O que é mistura de especialistas (MoE)?

É uma arquitetura em que o modelo tem vários submodelos internos chamados especialistas. Para cada token, apenas alguns são ativados. Isso reduz o custo de inferência porque só uma fração dos parâmetros roda por consulta, sem abrir mão do tamanho total do modelo.

MoE é sempre mais barato que modelo denso?

Não. No recorte de hoje, o Mistral Large 3 (MoE) sai a US$ 1,50/M de saída, mais caro que vários modelos densos. O que define o custo é a combinação entre taxa de ativação, infraestrutura e o preço tabelado pelo provedor — a arquitetura por si só não garante economia.

MoE serve para qualquer tipo de tarefa?

Serve bem para raciocínio e tarefas em que o volume de tokens de saída é alto, porque o custo por token cai. Para workloads com latência crítica, vale comparar a velocidade: o Mistral Large 3 entrega 77 tokens/s, contra 247 do Nemotron 3 Nano, ambos MoE.

Leia também