MiMo-V2-Flash lidera catálogo inteiro e custa 26 vezes menos que o3
MoE assume o topo do ranking de inteligência do catálogo nesta data. A diferença de preço para os modelos densos é o que muda a conta em produção.
O catálogo guarda mais de 314 modelos hoje. Olhando só os que adotam mistura de especialistas (MoE), você encontra 11 — e o primeiro da lista geral é exatamente um deles. Xiaomi MiMo-V2-Flash aparece no topo do ranking de inteligência com IQ 34,024, à frente do OpenAI o3 (31,096) e do Anthropic Claude Haiku 4.5 (29,892). A diferença de preço, porém, é o que chama atenção: o MiMo custa US$ 0,30 por milhão de tokens de saída, contra US$ 8,00 do o3.
O topo do ranking agora é MoE
Dos cinco modelos mais bem pontuados do catálogo, dois são MoE: o MiMo da Xiaomi e o gpt-oss-120b da OpenAI (IQ 24,126). Os outros três — o3, Claude Haiku 4.5 e o Mistral Devstral 2 — são modelos densos, do tipo clássico. A faixa alta do ranking, portanto, não é mais ocupada por um único paradigma de arquitetura.
A mistura de especialistas funciona como uma equipe de chefs em que cada pedido só aciona alguns deles. Para cada token, o modelo escolhe quais sub-redes consultar; o resto do peso fica em disco mas não pesa na GPU. É por isso que o MiMo ativa só 15B dos seus 309B totais por consulta, e mesmo assim lidera o ranking.
A conta, traduzida
Quando o release da Xiaomi diz que o MiMo é competitivo, a tradução prática é esta: US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de saída. Em comparação, o gpt-oss-120b — segundo MoE mais inteligente da lista — sai a US$ 0,17/M de saída, quase metade do preço do o3 e cerca de trinta vezes mais barato que o Claude Haiku 4.5 (US$ 5,00/M) na mesma métrica.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| MiMo-V2-Flash | xiaomi | 34.0 | 0.3 | 262k |
| gpt-oss-120b | openai | 24.1 | 0.17 | 131k |
| Qwen3 Next 80B A3B Thinking | qwen | 16.9 | 1.2 | 262k |
| Mistral Large 3 2512 | mistralai | 15.9 | 1.5 | 262k |
| INTELLECT-3 | prime-intellect | 15.7 | 1.1 | 131k |
| gpt-oss-20b | openai | 15.2 | 0.13 | 131k |
| Nemotron 3 Nano 30B A3B | nvidia | 14.5 | 0.2 | 262k |
| Llama 4 Maverick | meta-llama | 14.5 | 0.696 | 1.05M |
Os dois MoE da OpenAI ocupam os extremos do recorte. O gpt-oss-120b é o que entrega melhor raciocínio entre os abertos da empresa (coding 30,441); o gpt-oss-20b, com apenas 3,6B parâmetros ativos, é o chão de preço do catálogo: US$ 0,03/M de entrada e US$ 0,13/M de saída.
Nem todo MoE é igual
O recorte mostra uma dispersão grande. De um lado, o gpt-oss-20b da OpenAI a US$ 0,13/M de saída. Do outro, o Mistral Large 3 2512, a US$ 1,50/M, com 675B parâmetros totais e 41B ativos. A Mistral tem o MoE mais "pesado" da lista em volume absoluto, mas o IQ 15,919 fica abaixo do MiMo, do gpt-oss-120b e até do Qwen3 Next 80B A3B Thinking (IQ 16,867). Mais parâmetros totais, neste recorte, não compram mais inteligência por dólar.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
O MiMo atinge o topo do catálogo com 309B totais e só 15B ativos — uma taxa de ativação de 4,85%. O Mistral Large 3 ativa 6,07%; o Llama 4 Maverick, 4,23% dos seus 402B totais. A taxa varia, mas o que parece importar mais é o treinamento e os dados, não o tamanho bruto.
Para quem essa arquitetura faz sentido — e para quem não
MoE vale para quem roda raciocínio em alto volume e quer pagar centavos por token de saída. O MiMo, o gpt-oss-120b e o Qwen3 Next Thinking entregam reasoning nativo com preços que viabilizam agentes. Vale também para quem quer pesos abertos: todos os oito do recorte listam pesos abertos.
Não muda nada para quem já está feliz com um modelo denso de fronteira ou tem contrato com desconto agressivo. E não muda nada para workloads onde latência é crítica: o Mistral Large 3 roda a 77 tokens por segundo, contra 247 do Nemotron 3 Nano da NVIDIA, também MoE. O MoE mais rápido do recorte é justamente o menor.
O que fazer com isso hoje
Se a fatura de API está pesando em tarefas de raciocínio, comece pelo MiMo-V2-Flash e pelo gpt-oss-120b. São os dois MoE com melhor IQ do catálogo agora, custam centavos por milhão e entregam reasoning de verdade. O Mistral Large 3 só se justifica se você precisa especificamente da janela multimodal de 262k ou se roda on-prem e quer o modelo aberto mais pesado da Mistral. Para prototipagem barata, o gpt-oss-20b a US$ 0,03 de entrada é imbatível.
Para raciocínio em alto volume, troque o modelo denso de fronteira por um MoE como MiMo-V2-Flash ou gpt-oss-120b — a economia no token de saída chega a uma ordem de grandeza sem perda mensurável de capacidade.
Perguntas frequentes
O que é mistura de especialistas (MoE)?
É uma arquitetura em que o modelo tem vários submodelos internos chamados especialistas. Para cada token, apenas alguns são ativados. Isso reduz o custo de inferência porque só uma fração dos parâmetros roda por consulta, sem abrir mão do tamanho total do modelo.
MoE é sempre mais barato que modelo denso?
Não. No recorte de hoje, o Mistral Large 3 (MoE) sai a US$ 1,50/M de saída, mais caro que vários modelos densos. O que define o custo é a combinação entre taxa de ativação, infraestrutura e o preço tabelado pelo provedor — a arquitetura por si só não garante economia.
MoE serve para qualquer tipo de tarefa?
Serve bem para raciocínio e tarefas em que o volume de tokens de saída é alto, porque o custo por token cai. Para workloads com latência crítica, vale comparar a velocidade: o Mistral Large 3 entrega 77 tokens/s, contra 247 do Nemotron 3 Nano, ambos MoE.