FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Oito modelos MoE, todos com pesos abertos, preços de US$ 0,13 a US$ 1,20

A arquitetura virou o atalho padrão para entregar 'quase fronteira' a preço baixo. Mas os 8 MoE do catálogo contam uma história mais bagunçada do que o release sugere.

Redação FalaVIP IA 3 min de leitura
US$ 0,17por milhão de tokens de saída no gpt-oss-120b
47×mais barato que o o3, com cerca de 78% do IQ
8 de 8modelos MoE do catálogo com pesos abertos

Oito modelos, todos com pesos abertos, e a conta que ninguém te explica

O recorte MoE do catálogo de hoje tem 8 modelos. E aqui está o primeiro padrão que ninguém comenta no release: todos os 8 são open weights. A combinação MoE + pesos abertos virou a configuração dominante para entregar um modelo com cara de gigante cobrando preço de anão — porque é exatamente isso que a arquitetura permite.

MoE, em uma frase: em vez de ativar todos os parâmetros a cada token, o modelo consulta um pequeno grupo de "especialistas" por vez. O gpt-oss-120b tem 117 bilhões de parâmetros no papel e 5,1 bilhões ativos por passada. É como um restaurante com 200 itens no cardápio, mas o garçom só te serve 3 de cada vez — você paga cozinheiro de 3, mas tem cardápio de 200.

Inteligência × preço no recorte
gpt-oss-120bQwen3 Next 80B A3B ThinkingINTELLECT-3gpt-oss-20bLlama 4 MaverickQwen3 Next 80B A3B InstructLlama 4 ScoutERNIE 4.5 300B A47B US$ por milhão (saída, escala log)índice de inteligência

A escada de preço é mais larga do que parece

Preço de saída, em dólar por milhão de tokens, no recorte MoE:

  • gpt-oss-20b: US$ 0,13 (piso)
  • gpt-oss-120b: US$ 0,17
  • Llama 4 Scout: US$ 0,30
  • Llama 4 Maverick: US$ 0,70
  • Qwen3 Next 80B A3B Instruct: US$ 1,10
  • INTELLECT-3: US$ 1,10
  • Qwen3 Next 80B A3B Thinking: US$ 1,20 (teto)

A diferença entre o piso e o teto é de aproximadamente 9x — e estamos falando da mesma arquitetura, do mesmo porte de modelo. O que decide o preço não é "ser MoE", é ser ou não um modelo de raciocínio, e qual fornecedor assina a nota fiscal.

Para comparar com o topo absoluto do catálogo: o o3 da OpenAI, hoje com IQ 31,096, cobra US$ 8 por milhão de saída. O gpt-oss-120b entrega IQ 24,126 por US$ 0,17. Você paga 47 vezes menos por cerca de 78% da inteligência. Esse é o quase-fronteira que o marketing costuma prometer para a arquitetura — traduzido em fatura.

Destaques do recorte: mistura de especialistas (MoE)
ModeloCriadorInteligênciaSaída US$/MContexto
gpt-oss-120bopenai24.10.17131k
Qwen3 Next 80B A3B Thinkingqwen16.91.2262k
INTELLECT-3prime-intellect15.71.1131k
gpt-oss-20bopenai15.20.13131k
Llama 4 Maverickmeta-llama14.50.6961.05M
Qwen3 Next 80B A3B Instructqwen13.81.1262k
Llama 4 Scoutmeta-llama10.30.31.31M
ERNIE 4.5 300B A47B baidu8.91.1131k

Para quem isso muda alguma coisa

Vale muito a pena se você roda alto volume de tarefas de raciocínio ou código e a fatura de saída é seu principal custo. O gpt-oss-120b, com 131k de contexto, IQ 24 e 0,17/M, virou o padrão informal de "modelo de produção barato com cérebro". O gpt-oss-20b é o botão de emergência quando a planilha começa a doer.

Vale também se você quer fazer deploy próprio. Como os pesos são abertos, dá para hospedar em GPU própria ou em provedores de inferência mais baratos, e o número de "ativos por passada" (5,1B, 3,6B, 17B) é o que define o que você precisa de hardware, não o total de parâmetros.

Não muda nada se seu gargalo é a parte de cima do ranking. O melhor MoE do catálogo (gpt-oss-120b, IQ 24,126) ainda fica abaixo do o3 (IQ 31,096) e do Claude Haiku 4.5 (IQ 29,892). Para tarefas que precisam de qualidade absoluta máxima, o caminho continua sendo modelo denso de fronteira, e a conta continua salgada.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
INTELLECT-315.71.1
Entre os 282 modelos disponíveis no catálogo nesta data.

A geografia do recorte, e um lançamento de ontem

Dos 8, 5 vêm dos Estados Unidos (OpenAI, Meta, Prime Intellect) e 3 da China (Qwen, Baidu). A divisão não é só de origem: os chineses ocupam mais a faixa "modelo de raciocínio via API" (Qwen3 Next Thinking é o mais caro do recorte, a US$ 1,20/M), enquanto os americanos dominam o andar de baixo com pesos abertos (gpt-oss-20b e 120b).

Detalhe novo: o INTELLECT-3 entrou no catálogo ontem, 27 de novembro de 2025. É MoE, 107B totais com 12B ativos, pós-treinado em cima do GLM-4.5-Air-Base. A régua de IQ dele (15,718) já foi medida, mas as colunas de coding e agentic ainda estão vazias no catálogo. Fique de olho.

O que fazer com isso hoje

Se "barato com bom cérebro" é o critério, o gpt-oss-120b é o padrão atual. Se é "o mais barato possível com pesos abertos", o gpt-oss-20b. E se você precisa de raciocínio forte via API e o orçamento permite, o Qwen3 Next Thinking é a aposta chinesa do mês — mas a US$ 1,20 por milhão de saída, não é o mesmo jogo de preço do 120b.

A leitura prática: MoE não é mais curiosidade de arquitetura. Virou o mecanismo padrão para entregar "inteligência suficiente" a preço que escala. Os 8 do catálogo de hoje são a evidência.

Em uma frase

Para escolher hoje no recorte MoE: gpt-oss-20b quando o orçamento dita e gpt-oss-120b quando a qualidade do raciocínio ainda importa — o resto do recorte só compensa em deploy próprio ou em raciocínio de fronteira via API chinesa.

Perguntas frequentes

O que é um modelo MoE (mistura de especialistas)?

É um modelo que, em vez de ativar todos os parâmetros a cada token, consulta só um subconjunto pequeno de "especialistas" por vez. O gpt-oss-120b, por exemplo, tem 117B de parâmetros totais e só 5,1B ativos por passada — você paga o custo de rodar 5B, mas o modelo tem a capacidade de 117B.

gpt-oss-120b substitui o o3 ou o Claude Haiku 4.5?

Não substitui em qualidade absoluta: o o3 lidera o catálogo com IQ 31,096 e o Haiku 4.5 vem logo atrás com 29,892, contra 24,126 do gpt-oss-120b. O que ele troca é preço: custa 47× menos por milhão de tokens de saída que o o3 e é open weights — então vale como modelo de produção em volume, não como referência máxima de qualidade.

Por que todos os MoE do catálogo têm pesos abertos?

Os 8 modelos MoE listados hoje saíram com pesos abertos, enquanto boa parte do catálogo é proprietária. A combinação MoE + open weights virou o atalho padrão para entregar capacidade alta (centenas de bilhões de parâmetros totais) cobrando preço de modelo pequeno — porque só uma fração dos parâmetros roda a cada token.

Leia também