Os 11 modelos MoE que seguram o topo e o preço baixo do catálogo
Mistura de especialistas responde por 3% dos modelos listados, mas abriga o IQ mais alto e a saída mais barata entre os cinco primeiros do ranking.
3% do catálogo, dois extremos do ranking
Em 30 de janeiro de 2026, o catálogo soma 326 modelos. Desses, 11 são de mistura de especialistas — Mixture-of-Experts, ou MoE. É 3,4%, quase um arredondamento. Só que esses 11 seguram as duas pontas do espectro custo-inteligência: o IQ mais alto de todo o catálogo (Xiaomi MiMo-V2-Flash, 34,024) e a saída mais barata entre os cinco primeiros (OpenAI gpt-oss-120b, a US$ 0,17 por milhão de tokens).
O padrão fica óbvio quando se plota.
Como MoE paga a conta
MoE funciona como um hospital com 50 médicos no quadro, mas só dois ou três atendem você a cada consulta. O modelo tem centenas de bilhões de parâmetros no total, mas só uma fração — os parâmetros "ativos" — dispara em cada token. Você paga pelo prédio, não por cada médico a cada hora.
É por isso que o gpt-oss-120b carrega 117B de parâmetros, mas ativa apenas 5,1B por passagem. O custo de computação por token cai, e o preço da API cai junto.
A conta que aparece nos números
Compare dois modelos com IQ parecido:
- OpenAI o3 (denso): IQ 31,096, US$ 8,00/M de saída
- gpt-oss-120b (MoE): IQ 24,126, US$ 0,17/M de saída
Por 1/47 do preço, você leva 78% do IQ. Esse é o desconto MoE — e ele se repete em todo o recorte.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| MiMo-V2-Flash | xiaomi | 34.0 | 0.3 | 262k |
| gpt-oss-120b | openai | 24.1 | 0.17 | 131k |
| Qwen3 Next 80B A3B Thinking | qwen | 16.9 | 1.2 | 262k |
| Mistral Large 3 2512 | mistralai | 15.9 | 1.5 | 262k |
| INTELLECT-3 | prime-intellect | 15.7 | 1.1 | 131k |
| gpt-oss-20b | openai | 15.2 | 0.13 | 131k |
| Nemotron 3 Nano 30B A3B | nvidia | 14.5 | 0.2 | 262k |
| Llama 4 Maverick | meta-llama | 14.5 | 0.696 | 1.05M |
O MoE mais barato entre os tops do ranking: gpt-oss-20b, a US$ 0,13/M de saída. O mais caro: Mistral Large 3 2512, a US$ 1,50/M — ainda abaixo do OpenAI o3 denso e do Anthropic Claude Haiku 4.5.
De onde vêm e quem pesa mais
Todos os 8 modelos MoE visíveis no recorte são open-weights. Cinco vêm dos EUA (OpenAI com dois, Prime Intellect, NVIDIA, Meta), dois da China (Xiaomi, Qwen), um da França (Mistral).
A dispersão de tamanho é grande:
- Menor pegada ativa: Qwen3 Next 80B A3B Thinking, com 3B ativos de 80B totais
- Maior pegada ativa: Mistral Large 3 2512, com 41B ativos de 675B totais
- Maior janela de contexto: Meta Llama 4 Maverick, com 1M de tokens
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Para quem isso vale — e para quem não muda nada
Vale olhar o recorte MoE se você:
- roda muito volume (chatbot, batch, RAG em escala) e o custo por token é o gargalo
- quer self-host e precisa de modelo que caiba em GPU menor sem abrir mão de IQ
- está comparando custo-benefício entre APIs e quer o melhor IQ por dólar
Não muda nada se você:
- tem baixa volumetria e a diferença de centavos não paga a dor de cabeça de migrar
- precisa do IQ absoluto mais alto — Xiaomi lidera, mas a margem sobre modelos densos caros é pequena
- depende de multimodal nativo: só Llama 4 Maverick e Mistral Large 3 aceitam imagem no recorte
O que fazer com isso
Se a fatura da API está doendo, o recorte MoE é por onde começar a procurar. O gpt-oss-120b, a US$ 0,17 por milhão de tokens de saída, é o ponto de entrada óbvio para quem busca volume. Se o caso de uso exige mais IQ bruto, o Xiaomi MiMo-V2-Flash, a US$ 0,30, entrega o topo do ranking inteiro — denso ou não.
Se a conta da API pesa, comece pelo gpt-oss-120b: 78% do IQ do o3 por 1/47 do preço — e é só o segundo MoE mais barato do ranking.
Perguntas frequentes
O que é MoE em modelos de linguagem?
É uma arquitetura em que o modelo tem centenas de bilhões de parâmetros no total, mas só uma fração (os "ativos", entre 3B e 41B nos modelos do recorte) dispara a cada token. Isso reduz o custo de computação e, em geral, o preço da API.
MoE é sempre mais barato que modelo denso?
Não necessariamente. O Mistral Large 3 2512, que é MoE, custa US$ 1,50/M de saída — mais caro que vários modelos densos. A vantagem do MoE aparece no IQ por dólar, não no preço absoluto.
Por que todos os MoE do catálogo são open-weights?
É coincidência do recorte atual, não regra técnica. Os grandes laboratórios que vendem API proprietária (OpenAI, Anthropic, Mistral em outros modelos) também poderiam lançar MoE fechados — o catálogo só não tem nenhum hoje.