FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Sete modelos MoE no catálogo, e o mais barato deles custa centavos

Mistura de especialistas virou o padrão de quem quer baratear a conta sem abrir mão de raciocínio — mas só três dos sete modelos do recorte são de raciocínio.

Redação FalaVIP IA 3 min de leitura
US$ 0,13por milhão de tokens de saída do gpt-oss-20b
5,1 bilhõesparâmetros ativos do gpt-oss-120b em 117B totais
7 de 270modelos do catálogo marcados como MoE

O que a MoE entrega — e o que ela esconde

Sete dos 270 modelos do catálogo desta sexta-feira são oficialmente de mistura de especialistas. É um número pequeno, mas o recorte inteiro cabe numa frase que importa para a sua fatura: os três mais baratos do recorte são os que custam menos de US$ 0,20 por milhão de tokens de saída. Em comparação, o OpenAI o3 — o modelo mais inteligente do catálogo hoje — custa US$ 8 por milhão de saída. A conta não mente.

A ideia por trás da MoE é simples o suficiente para caber numa analogia: em vez de carregar um único médico especialista para qualquer consulta, o hospital mantém 117 profissionais no quadro, mas só 5,1 atendem por vez — e o sistema escolhe quais. É isso que o gpt-oss-120b faz: 117 bilhões de parâmetros no total, 5,1 bilhões ativos a cada token que sai. Você paga a conta de um clínico, não a de uma equipe inteira.

Destaques do recorte: mistura de especialistas (MoE)
ModeloCriadorInteligênciaSaída US$/MContexto
gpt-oss-120bopenai24.10.17131k
Qwen3 Next 80B A3B Thinkingqwen16.91.2262k
gpt-oss-20bopenai15.20.13131k
Llama 4 Maverickmeta-llama14.50.6961.05M
Qwen3 Next 80B A3B Instructqwen13.81.1262k
Llama 4 Scoutmeta-llama10.30.31.31M
ERNIE 4.5 300B A47B baidu8.91.1131k

Os três que valem a pena olhar

O ranking do recorte, em inteligência medida hoje, coloca o gpt-oss-120b da OpenAI na frente com 24,1 de IQ, seguido do Qwen3 Next 80B A3B Thinking, com 16,9, e do gpt-oss-20b, com 15,2. Os três são modelos de raciocínio, os três são abertos e os três custam menos de US$ 1,30 por milhão de tokens de saída.

O detalhe que ninguém comenta: o gpt-oss-120b é o único MoE de raciocínio do recorte com mais de 100 mil tokens de contexto (131 mil) e velocidade de 155 tokens por segundo. O Qwen3 Next Thinking dobra o contexto para 262 mil e ainda acelera para quase 197 t/s — mas cobra US$ 1,20 por milhão de saída, quase sete vezes mais caro que o gpt-oss-120b. O gpt-oss-20b, por sua vez, é o mais barato do recorte inteiro: US$ 0,03 de entrada e US$ 0,13 de saída por milhão de tokens, com cache de leitura pelo mesmo preço da entrada.

Inteligência × preço no recorte
gpt-oss-120bQwen3 Next 80B A3B Thinkinggpt-oss-20bLlama 4 MaverickQwen3 Next 80B A3B InstructLlama 4 ScoutERNIE 4.5 300B A47B US$ por milhão (saída, escala log)índice de inteligência

E os outros quatro?

O Llama 4 Maverick e o Llama 4 Scout, da Meta, são multimodais (aceitam imagem) e têm contextos enormes — 1M e 1,3M de tokens, respectivamente. Mas nenhum dos dois é de raciocínio, e os dois cobram mais caro na saída do que o gpt-oss-20b cobra na entrada: US$ 0,696 e US$ 0,30 por milhão. O Qwen3 Next Instruct repete a fórmula do Thinking sem o trace de raciocínio, cobrando US$ 1,10 por milhão de saída — útil quando você quer velocidade sem pagar pelo thinking, mas não é o用例 mais barato do recorte.

O ERNIE 4.5 300B A47B, da Baidu, é o caso curioso: 300 bilhões de parâmetros totais, 47 bilhões ativos por token, e o pior IQ do recorte (8,9). É o que mais cobra por entrada (US$ 0,28 por milhão) e não traz dado público de velocidade. Está no catálogo porque é aberto e porque vem da China — mas não está aqui pelo custo-benefício.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 270 modelos disponíveis no catálogo nesta data.

Para quem isso muda a conta

Se você roda agente, cadeia longa ou qualquer coisa que dependa de thinking trace, o gpt-oss-120b é o achado do recorte: 24 de IQ por US$ 0,17 de saída. O Claude Haiku 4.5 da Anthropic, segundo colocado geral do catálogo, cobra US$ 5 por milhão de saída — quase 30 vezes mais caro. Para volume alto de raciocínio, a conta muda de patamar.

Se você só quer baratear texto simples e não precisa de thinking, o gpt-oss-20b continua sendo o piso do catálogo entre modelos de raciocínio. E se multimodalidade é requisito (entrada com imagem), o Llama 4 Scout é a única opção MoE do recorte que aceita imagem e custa menos de US$ 0,30 de saída.

Para quem já está pagando Claude Opus ou GPT-4o por tarefas que não exigem o topo do topo, vale rodar um piloto de duas semanas com gpt-oss-120b em workloads de raciocínio e medir a diferença na fatura antes de migrar de vez.

Em uma frase

Se sua carga é raciocínio e você ainda não testou gpt-oss-120b, está pagando caro sem motivo — rode um piloto de duas semanas e meça a fatura.

Perguntas frequentes

O que é um modelo MoE e por que importa para o preço?

MoE (mistura de especialistas) é uma arquitetura em que só uma fração dos parâmetros é ativada por token. No gpt-oss-120b, por exemplo, são 5,1B ativos em 117B totais — o que barateia a inferência porque a GPU trabalha menos a cada passo.

Qual o modelo MoE mais barato do catálogo hoje?

O gpt-oss-20b, da OpenAI: US$ 0,03 por milhão de tokens de entrada e US$ 0,13 por milhão de saída, com cache de leitura no mesmo preço da entrada.

Modelos MoE são piores que modelos densos?

Não necessariamente. O gpt-oss-120b tem 24,1 de IQ no recorte MoE, contra 31,1 do OpenAI o3 (modelo denso). A diferença existe, mas o custo por token é até 47 vezes menor — então vale testar antes de descartar.

Leia também