FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Os 11 modelos MoE que seguram o topo e o preço baixo do catálogo

Mistura de especialistas responde por 3% dos modelos listados, mas abriga o IQ mais alto e a saída mais barata entre os cinco primeiros do ranking.

Redação FalaVIP IA 2 min de leitura
11 de 326modelos MoE no catálogo (3,4%)
US$ 0,17/Msaída do gpt-oss-120b, o mais barato do top 5
5,1B de 117Bparâmetros ativos por passagem no gpt-oss-120b

3% do catálogo, dois extremos do ranking

Em 30 de janeiro de 2026, o catálogo soma 326 modelos. Desses, 11 são de mistura de especialistas — Mixture-of-Experts, ou MoE. É 3,4%, quase um arredondamento. Só que esses 11 seguram as duas pontas do espectro custo-inteligência: o IQ mais alto de todo o catálogo (Xiaomi MiMo-V2-Flash, 34,024) e a saída mais barata entre os cinco primeiros (OpenAI gpt-oss-120b, a US$ 0,17 por milhão de tokens).

O padrão fica óbvio quando se plota.

Inteligência × preço no recorte
MiMo-V2-Flashgpt-oss-120bQwen3 Next 80B A3B ThinkingMistral Large 3 2512INTELLECT-3gpt-oss-20bNemotron 3 Nano 30B A3BLlama 4 MaverickUS$ por milhão (saída, escala log)índice de inteligência

Como MoE paga a conta

MoE funciona como um hospital com 50 médicos no quadro, mas só dois ou três atendem você a cada consulta. O modelo tem centenas de bilhões de parâmetros no total, mas só uma fração — os parâmetros "ativos" — dispara em cada token. Você paga pelo prédio, não por cada médico a cada hora.

É por isso que o gpt-oss-120b carrega 117B de parâmetros, mas ativa apenas 5,1B por passagem. O custo de computação por token cai, e o preço da API cai junto.

A conta que aparece nos números

Compare dois modelos com IQ parecido:

  • OpenAI o3 (denso): IQ 31,096, US$ 8,00/M de saída
  • gpt-oss-120b (MoE): IQ 24,126, US$ 0,17/M de saída

Por 1/47 do preço, você leva 78% do IQ. Esse é o desconto MoE — e ele se repete em todo o recorte.

Destaques do recorte: mistura de especialistas (MoE)
ModeloCriadorInteligênciaSaída US$/MContexto
MiMo-V2-Flashxiaomi34.00.3262k
gpt-oss-120bopenai24.10.17131k
Qwen3 Next 80B A3B Thinkingqwen16.91.2262k
Mistral Large 3 2512mistralai15.91.5262k
INTELLECT-3prime-intellect15.71.1131k
gpt-oss-20bopenai15.20.13131k
Nemotron 3 Nano 30B A3Bnvidia14.50.2262k
Llama 4 Maverickmeta-llama14.50.6961.05M

O MoE mais barato entre os tops do ranking: gpt-oss-20b, a US$ 0,13/M de saída. O mais caro: Mistral Large 3 2512, a US$ 1,50/M — ainda abaixo do OpenAI o3 denso e do Anthropic Claude Haiku 4.5.

De onde vêm e quem pesa mais

Todos os 8 modelos MoE visíveis no recorte são open-weights. Cinco vêm dos EUA (OpenAI com dois, Prime Intellect, NVIDIA, Meta), dois da China (Xiaomi, Qwen), um da França (Mistral).

A dispersão de tamanho é grande:

  • Menor pegada ativa: Qwen3 Next 80B A3B Thinking, com 3B ativos de 80B totais
  • Maior pegada ativa: Mistral Large 3 2512, com 41B ativos de 675B totais
  • Maior janela de contexto: Meta Llama 4 Maverick, com 1M de tokens
O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 326 modelos disponíveis no catálogo nesta data.

Para quem isso vale — e para quem não muda nada

Vale olhar o recorte MoE se você:

  • roda muito volume (chatbot, batch, RAG em escala) e o custo por token é o gargalo
  • quer self-host e precisa de modelo que caiba em GPU menor sem abrir mão de IQ
  • está comparando custo-benefício entre APIs e quer o melhor IQ por dólar

Não muda nada se você:

  • tem baixa volumetria e a diferença de centavos não paga a dor de cabeça de migrar
  • precisa do IQ absoluto mais alto — Xiaomi lidera, mas a margem sobre modelos densos caros é pequena
  • depende de multimodal nativo: só Llama 4 Maverick e Mistral Large 3 aceitam imagem no recorte

O que fazer com isso

Se a fatura da API está doendo, o recorte MoE é por onde começar a procurar. O gpt-oss-120b, a US$ 0,17 por milhão de tokens de saída, é o ponto de entrada óbvio para quem busca volume. Se o caso de uso exige mais IQ bruto, o Xiaomi MiMo-V2-Flash, a US$ 0,30, entrega o topo do ranking inteiro — denso ou não.

Em uma frase

Se a conta da API pesa, comece pelo gpt-oss-120b: 78% do IQ do o3 por 1/47 do preço — e é só o segundo MoE mais barato do ranking.

Perguntas frequentes

O que é MoE em modelos de linguagem?

É uma arquitetura em que o modelo tem centenas de bilhões de parâmetros no total, mas só uma fração (os "ativos", entre 3B e 41B nos modelos do recorte) dispara a cada token. Isso reduz o custo de computação e, em geral, o preço da API.

MoE é sempre mais barato que modelo denso?

Não necessariamente. O Mistral Large 3 2512, que é MoE, custa US$ 1,50/M de saída — mais caro que vários modelos densos. A vantagem do MoE aparece no IQ por dólar, não no preço absoluto.

Por que todos os MoE do catálogo são open-weights?

É coincidência do recorte atual, não regra técnica. Os grandes laboratórios que vendem API proprietária (OpenAI, Anthropic, Mistral em outros modelos) também poderiam lançar MoE fechados — o catálogo só não tem nenhum hoje.

Leia também