FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Por que MoE com 117B custa só US$ 0,17 por milhão de tokens

Porque só 5,1 bilhões de parâmetros ligam por token. Sete MoE estão no catálogo hoje — e os dois da OpenAI entregam o melhor IQ por dólar do recorte.

Redação FalaVIP IA 3 min de leitura
US$ 0,17por milhão de tokens de saída do gpt-oss-120b
5,1 bilhõesde parâmetros ativos por passagem no gpt-oss-120b
24.126de IQ do gpt-oss-120b, 3º do catálogo inteiro

Você lê "117 bilhões de parâmetros" no release do OpenAI gpt-oss-120b e já calcula o estrago na fatura. Só que esse mesmo modelo cobra US$ 0,17 por milhão de tokens de saída e ocupa o terceiro lugar em IQ no catálogo inteiro de hoje, atrás apenas do o3 e do Claude Haiku 4.5. A diferença mora em 5,1 bilhões — os parâmetros que de fato ligam a cada token.

O que MoE realmente muda na fatura

Modelos densos tradicionais ativam todos os parâmetros em cada passagem. Modelos MoE — mistura de especialistas — dividem a rede em blocos e só acionam alguns por vez. Pense num restaurante com 20 chefs no quadro, mas só três cozinham o seu prato: a cozinha é grande, o ticket do seu pedido é pequeno.

O gpt-oss-120b é o exemplo mais nítido do catálogo: 117B totais, 5,1B ativos, razão de 23 para 1. O Llama 4 Maverick, da Meta, vai além — 402B totais, 128 especialistas, 17B ativos por passagem, e cobra US$ 0,696 por milhão de tokens de saída. O Llama 4 Scout, mesmo pacote, ativa 17B de 109B e sai por US$ 0,30.

Inteligência × preço no recorte
gpt-oss-120bQwen3 Next 80B A3B Thinkinggpt-oss-20bLlama 4 MaverickQwen3 Next 80B A3B InstructLlama 4 ScoutERNIE 4.5 300B A47B US$ por milhão (saída, escala log)índice de inteligência

Os sete MoE do catálogo hoje

São sete modelos MoE ativos em 7 de novembro de 2025 — cerca de 2,6% dos mais de 270 listados. Todos têm pesos abertos. Quatro vêm dos EUA (dois da OpenAI, dois da Meta) e três da China (dois da Qwen, um da Baidu).

Destaques do recorte: mistura de especialistas (MoE)
ModeloCriadorInteligênciaSaída US$/MContexto
gpt-oss-120bopenai24.10.17131k
Qwen3 Next 80B A3B Thinkingqwen16.91.2262k
gpt-oss-20bopenai15.20.13131k
Llama 4 Maverickmeta-llama14.50.6961.05M
Qwen3 Next 80B A3B Instructqwen13.81.1262k
Llama 4 Scoutmeta-llama10.30.31.31M
ERNIE 4.5 300B A47B baidu8.91.1131k

O gpt-oss-120b lidera o recorte em inteligência: IQ 24.126. Logo abaixo, o Qwen3 Next 80B A3B Thinking (IQ 16.867) e o gpt-oss-20b (IQ 15.225) — esse último com apenas 3,6B de parâmetros ativos e 21B totais, é o MoE mais barato do grupo, a US$ 0,13 por milhão de tokens de saída.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 270 modelos disponíveis no catálogo nesta data.

A conta que importa: inteligência por dólar

Quando você divide o IQ pelo preço do token de saída, os dois gpt-oss da OpenAI se destacam. O de 120B entrega cerca de 142 pontos de IQ por dólar; o de 20B entrega 117. Os Llama 4 da Meta ficam na casa dos 21 (Maverick) e 34 (Scout). Os modelos chineses do recorte — Qwen3 Next Thinking e Instruct, ERNIE 4.5 — pagam cerca de 7 vezes mais por ponto de IQ que o gpt-oss-120b, apesar da arquitetura aberta equivalente.

A leitura é desconfortável para quem achava que MoE era categoria dominada pelos chineses. Os dois pesos abertos da OpenAI estão entre os melhores negócios do catálogo inteiro, em qualquer recorte de preço.

Para quem MoE vale — e para quem não muda nada

Vale olhar MoE se você roda volume alto de inferência e quer manter a conta sob controle sem abrir mão de raciocínio: os dois gpt-oss e o Llama 4 Scout são os casos óbvios. Os Qwen3 Next fazem sentido quando você precisa de contexto mais longo — 262K tokens contra 131K do gpt-oss-120b — ou quer ajustar pesos localmente para um domínio específico.

Não muda nada para quem já está satisfeito com um modelo denso via API e não vê a fatura apertando. Também não muda nada para quem precisa de multimodalidade nativa texto e imagem: só os Llama 4 do recorte entregam isso; os demais são text→text.

O que fazer com isso na segunda-feira

Se a próxima sprint envolve classificar documentos, resumir logs ou gerar código de caixinha, teste o gpt-oss-20b primeiro — US$ 0,03 de entrada e US$ 0,13 de saída, raciocínio ativo, só 3,6B de parâmetros ativos. Para tarefas que pedem mais cabeça, o gpt-oss-120b entrega IQ de top 3 do catálogo por US$ 0,17 de saída. MoE não é mais categoria de nicho: é onde o melhor custo por inteligência está parado hoje.

Em uma frase

Antes de escolher um modelo, divida o IQ pelo preço do token de saída: os dois gpt-oss da OpenAI entregam hoje o melhor custo por inteligência do catálogo inteiro, e custam centavos por milhão.

Perguntas frequentes

O que é MoE (mistura de especialistas)?

É uma arquitetura em que o modelo é dividido em 'especialistas' e só uma fração dos parâmetros é ativada por token. Isso permite ter redes muito grandes no total, mas leves no custo por token gerado.

Modelos MoE são melhores que modelos densos?

No recorte de hoje, os dois modelos mais inteligentes do catálogo (o3 e Claude Haiku 4.5) não são MoE. Mas o gpt-oss-120b, que é MoE, já aparece em terceiro lugar no IQ geral — mostrando que MoE deixou de ser sinônimo de modelo fraco.

Quais são os MoE mais baratos do catálogo?

Os dois gpt-oss da OpenAI dominam: gpt-oss-20b sai a US$ 0,13 por milhão de tokens de saída e gpt-oss-120b a US$ 0,17. Os demais MoE do recorte custam entre US$ 0,30 (Llama 4 Scout) e US$ 0,696 (Llama 4 Maverick).

Leia também