Oito modelos MoE, todos com pesos abertos, preços de US$ 0,13 a US$ 1,20
A arquitetura virou o atalho padrão para entregar 'quase fronteira' a preço baixo. Mas os 8 MoE do catálogo contam uma história mais bagunçada do que o release sugere.
Oito modelos, todos com pesos abertos, e a conta que ninguém te explica
O recorte MoE do catálogo de hoje tem 8 modelos. E aqui está o primeiro padrão que ninguém comenta no release: todos os 8 são open weights. A combinação MoE + pesos abertos virou a configuração dominante para entregar um modelo com cara de gigante cobrando preço de anão — porque é exatamente isso que a arquitetura permite.
MoE, em uma frase: em vez de ativar todos os parâmetros a cada token, o modelo consulta um pequeno grupo de "especialistas" por vez. O gpt-oss-120b tem 117 bilhões de parâmetros no papel e 5,1 bilhões ativos por passada. É como um restaurante com 200 itens no cardápio, mas o garçom só te serve 3 de cada vez — você paga cozinheiro de 3, mas tem cardápio de 200.
A escada de preço é mais larga do que parece
Preço de saída, em dólar por milhão de tokens, no recorte MoE:
- gpt-oss-20b: US$ 0,13 (piso)
- gpt-oss-120b: US$ 0,17
- Llama 4 Scout: US$ 0,30
- Llama 4 Maverick: US$ 0,70
- Qwen3 Next 80B A3B Instruct: US$ 1,10
- INTELLECT-3: US$ 1,10
- Qwen3 Next 80B A3B Thinking: US$ 1,20 (teto)
A diferença entre o piso e o teto é de aproximadamente 9x — e estamos falando da mesma arquitetura, do mesmo porte de modelo. O que decide o preço não é "ser MoE", é ser ou não um modelo de raciocínio, e qual fornecedor assina a nota fiscal.
Para comparar com o topo absoluto do catálogo: o o3 da OpenAI, hoje com IQ 31,096, cobra US$ 8 por milhão de saída. O gpt-oss-120b entrega IQ 24,126 por US$ 0,17. Você paga 47 vezes menos por cerca de 78% da inteligência. Esse é o quase-fronteira que o marketing costuma prometer para a arquitetura — traduzido em fatura.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| gpt-oss-120b | openai | 24.1 | 0.17 | 131k |
| Qwen3 Next 80B A3B Thinking | qwen | 16.9 | 1.2 | 262k |
| INTELLECT-3 | prime-intellect | 15.7 | 1.1 | 131k |
| gpt-oss-20b | openai | 15.2 | 0.13 | 131k |
| Llama 4 Maverick | meta-llama | 14.5 | 0.696 | 1.05M |
| Qwen3 Next 80B A3B Instruct | qwen | 13.8 | 1.1 | 262k |
| Llama 4 Scout | meta-llama | 10.3 | 0.3 | 1.31M |
| ERNIE 4.5 300B A47B | baidu | 8.9 | 1.1 | 131k |
Para quem isso muda alguma coisa
Vale muito a pena se você roda alto volume de tarefas de raciocínio ou código e a fatura de saída é seu principal custo. O gpt-oss-120b, com 131k de contexto, IQ 24 e 0,17/M, virou o padrão informal de "modelo de produção barato com cérebro". O gpt-oss-20b é o botão de emergência quando a planilha começa a doer.
Vale também se você quer fazer deploy próprio. Como os pesos são abertos, dá para hospedar em GPU própria ou em provedores de inferência mais baratos, e o número de "ativos por passada" (5,1B, 3,6B, 17B) é o que define o que você precisa de hardware, não o total de parâmetros.
Não muda nada se seu gargalo é a parte de cima do ranking. O melhor MoE do catálogo (gpt-oss-120b, IQ 24,126) ainda fica abaixo do o3 (IQ 31,096) e do Claude Haiku 4.5 (IQ 29,892). Para tarefas que precisam de qualidade absoluta máxima, o caminho continua sendo modelo denso de fronteira, e a conta continua salgada.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| INTELLECT-3 | 15.7 | 1.1 |
A geografia do recorte, e um lançamento de ontem
Dos 8, 5 vêm dos Estados Unidos (OpenAI, Meta, Prime Intellect) e 3 da China (Qwen, Baidu). A divisão não é só de origem: os chineses ocupam mais a faixa "modelo de raciocínio via API" (Qwen3 Next Thinking é o mais caro do recorte, a US$ 1,20/M), enquanto os americanos dominam o andar de baixo com pesos abertos (gpt-oss-20b e 120b).
Detalhe novo: o INTELLECT-3 entrou no catálogo ontem, 27 de novembro de 2025. É MoE, 107B totais com 12B ativos, pós-treinado em cima do GLM-4.5-Air-Base. A régua de IQ dele (15,718) já foi medida, mas as colunas de coding e agentic ainda estão vazias no catálogo. Fique de olho.
O que fazer com isso hoje
Se "barato com bom cérebro" é o critério, o gpt-oss-120b é o padrão atual. Se é "o mais barato possível com pesos abertos", o gpt-oss-20b. E se você precisa de raciocínio forte via API e o orçamento permite, o Qwen3 Next Thinking é a aposta chinesa do mês — mas a US$ 1,20 por milhão de saída, não é o mesmo jogo de preço do 120b.
A leitura prática: MoE não é mais curiosidade de arquitetura. Virou o mecanismo padrão para entregar "inteligência suficiente" a preço que escala. Os 8 do catálogo de hoje são a evidência.
Para escolher hoje no recorte MoE: gpt-oss-20b quando o orçamento dita e gpt-oss-120b quando a qualidade do raciocínio ainda importa — o resto do recorte só compensa em deploy próprio ou em raciocínio de fronteira via API chinesa.
Perguntas frequentes
O que é um modelo MoE (mistura de especialistas)?
É um modelo que, em vez de ativar todos os parâmetros a cada token, consulta só um subconjunto pequeno de "especialistas" por vez. O gpt-oss-120b, por exemplo, tem 117B de parâmetros totais e só 5,1B ativos por passada — você paga o custo de rodar 5B, mas o modelo tem a capacidade de 117B.
gpt-oss-120b substitui o o3 ou o Claude Haiku 4.5?
Não substitui em qualidade absoluta: o o3 lidera o catálogo com IQ 31,096 e o Haiku 4.5 vem logo atrás com 29,892, contra 24,126 do gpt-oss-120b. O que ele troca é preço: custa 47× menos por milhão de tokens de saída que o o3 e é open weights — então vale como modelo de produção em volume, não como referência máxima de qualidade.
Por que todos os MoE do catálogo têm pesos abertos?
Os 8 modelos MoE listados hoje saíram com pesos abertos, enquanto boa parte do catálogo é proprietária. A combinação MoE + open weights virou o atalho padrão para entregar capacidade alta (centenas de bilhões de parâmetros totais) cobrando preço de modelo pequeno — porque só uma fração dos parâmetros roda a cada token.