Sete modelos MoE no catálogo, e o mais barato deles custa centavos
Mistura de especialistas virou o padrão de quem quer baratear a conta sem abrir mão de raciocínio — mas só três dos sete modelos do recorte são de raciocínio.
O que a MoE entrega — e o que ela esconde
Sete dos 270 modelos do catálogo desta sexta-feira são oficialmente de mistura de especialistas. É um número pequeno, mas o recorte inteiro cabe numa frase que importa para a sua fatura: os três mais baratos do recorte são os que custam menos de US$ 0,20 por milhão de tokens de saída. Em comparação, o OpenAI o3 — o modelo mais inteligente do catálogo hoje — custa US$ 8 por milhão de saída. A conta não mente.
A ideia por trás da MoE é simples o suficiente para caber numa analogia: em vez de carregar um único médico especialista para qualquer consulta, o hospital mantém 117 profissionais no quadro, mas só 5,1 atendem por vez — e o sistema escolhe quais. É isso que o gpt-oss-120b faz: 117 bilhões de parâmetros no total, 5,1 bilhões ativos a cada token que sai. Você paga a conta de um clínico, não a de uma equipe inteira.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| gpt-oss-120b | openai | 24.1 | 0.17 | 131k |
| Qwen3 Next 80B A3B Thinking | qwen | 16.9 | 1.2 | 262k |
| gpt-oss-20b | openai | 15.2 | 0.13 | 131k |
| Llama 4 Maverick | meta-llama | 14.5 | 0.696 | 1.05M |
| Qwen3 Next 80B A3B Instruct | qwen | 13.8 | 1.1 | 262k |
| Llama 4 Scout | meta-llama | 10.3 | 0.3 | 1.31M |
| ERNIE 4.5 300B A47B | baidu | 8.9 | 1.1 | 131k |
Os três que valem a pena olhar
O ranking do recorte, em inteligência medida hoje, coloca o gpt-oss-120b da OpenAI na frente com 24,1 de IQ, seguido do Qwen3 Next 80B A3B Thinking, com 16,9, e do gpt-oss-20b, com 15,2. Os três são modelos de raciocínio, os três são abertos e os três custam menos de US$ 1,30 por milhão de tokens de saída.
O detalhe que ninguém comenta: o gpt-oss-120b é o único MoE de raciocínio do recorte com mais de 100 mil tokens de contexto (131 mil) e velocidade de 155 tokens por segundo. O Qwen3 Next Thinking dobra o contexto para 262 mil e ainda acelera para quase 197 t/s — mas cobra US$ 1,20 por milhão de saída, quase sete vezes mais caro que o gpt-oss-120b. O gpt-oss-20b, por sua vez, é o mais barato do recorte inteiro: US$ 0,03 de entrada e US$ 0,13 de saída por milhão de tokens, com cache de leitura pelo mesmo preço da entrada.
E os outros quatro?
O Llama 4 Maverick e o Llama 4 Scout, da Meta, são multimodais (aceitam imagem) e têm contextos enormes — 1M e 1,3M de tokens, respectivamente. Mas nenhum dos dois é de raciocínio, e os dois cobram mais caro na saída do que o gpt-oss-20b cobra na entrada: US$ 0,696 e US$ 0,30 por milhão. O Qwen3 Next Instruct repete a fórmula do Thinking sem o trace de raciocínio, cobrando US$ 1,10 por milhão de saída — útil quando você quer velocidade sem pagar pelo thinking, mas não é o用例 mais barato do recorte.
O ERNIE 4.5 300B A47B, da Baidu, é o caso curioso: 300 bilhões de parâmetros totais, 47 bilhões ativos por token, e o pior IQ do recorte (8,9). É o que mais cobra por entrada (US$ 0,28 por milhão) e não traz dado público de velocidade. Está no catálogo porque é aberto e porque vem da China — mas não está aqui pelo custo-benefício.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
Para quem isso muda a conta
Se você roda agente, cadeia longa ou qualquer coisa que dependa de thinking trace, o gpt-oss-120b é o achado do recorte: 24 de IQ por US$ 0,17 de saída. O Claude Haiku 4.5 da Anthropic, segundo colocado geral do catálogo, cobra US$ 5 por milhão de saída — quase 30 vezes mais caro. Para volume alto de raciocínio, a conta muda de patamar.
Se você só quer baratear texto simples e não precisa de thinking, o gpt-oss-20b continua sendo o piso do catálogo entre modelos de raciocínio. E se multimodalidade é requisito (entrada com imagem), o Llama 4 Scout é a única opção MoE do recorte que aceita imagem e custa menos de US$ 0,30 de saída.
Para quem já está pagando Claude Opus ou GPT-4o por tarefas que não exigem o topo do topo, vale rodar um piloto de duas semanas com gpt-oss-120b em workloads de raciocínio e medir a diferença na fatura antes de migrar de vez.
Se sua carga é raciocínio e você ainda não testou gpt-oss-120b, está pagando caro sem motivo — rode um piloto de duas semanas e meça a fatura.
Perguntas frequentes
O que é um modelo MoE e por que importa para o preço?
MoE (mistura de especialistas) é uma arquitetura em que só uma fração dos parâmetros é ativada por token. No gpt-oss-120b, por exemplo, são 5,1B ativos em 117B totais — o que barateia a inferência porque a GPU trabalha menos a cada passo.
Qual o modelo MoE mais barato do catálogo hoje?
O gpt-oss-20b, da OpenAI: US$ 0,03 por milhão de tokens de entrada e US$ 0,13 por milhão de saída, com cache de leitura no mesmo preço da entrada.
Modelos MoE são piores que modelos densos?
Não necessariamente. O gpt-oss-120b tem 24,1 de IQ no recorte MoE, contra 31,1 do OpenAI o3 (modelo denso). A diferença existe, mas o custo por token é até 47 vezes menor — então vale testar antes de descartar.