FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Os 12 modelos de pesos abertos do catálogo custam 90% menos que o topo

O melhor open-weight hoje tem IQ 24,1 e cobra US$ 0,17 por milhão de tokens de saída — quase 50 vezes mais barato que o líder absoluto do catálogo.

Redação FalaVIP IA 3 min de leitura
US$ 0,17por milhão de tokens de saída do gpt-oss-120b
12modelos de pesos abertos no catálogo de 227
47xdiferença de preço de saída entre gpt-oss-120b e OpenAI o3

O que aparece quando se olha o recorte inteiro

São 227 modelos no catálogo hoje. Deles, só 12 têm pesos abertos — pouco mais de 5%. É um número pequeno, mas é o suficiente para virar a chave de como você paga a sua API.

A conta é simples: o modelo mais inteligente do catálogo, OpenAI o3, cobra US$ 8 por milhão de tokens de saída. O melhor open-weight, o gpt-oss-120b da própria OpenAI, cobra US$ 0,17 pelo mesmo milhão. São 47 vezes de diferença pelo mesmo tipo de trabalho — gerar texto — sem que ninguém esteja distribuindo brinde.

Inteligência × preço no recorte
gpt-oss-120bQwen3 Next 80B A3B Thinkinggpt-oss-20bLlama 4 MaverickQwen3 Next 80B A3B InstructLlama 4 ScoutLlama 3.3 70B InstructERNIE 4.5 300B A47B US$ por milhão (saída, escala log)índice de inteligência

O padrão que ninguém anuncia no release

Os 12 modelos abertos não são um amontoado aleatório. Olhando o recorte, três coisas aparecem de cara:

  • A maioria é chinesa ou americana, e quase todo mundo usa Mixture of Experts (MoE) — ativa poucos parâmetros por token, mas o modelo total é enorme. É a mesma arquitetura que domina o topo do mercado.
  • O melhor deles, o gpt-oss-120b, foi lançado em 5 de agosto de 2025 e tem IQ 24,1 — distante do o3 (31,1), mas acima de qualquer outro peso aberto.
  • O chinês Qwen3 Next 80B A3B Thinking, lançado há cinco dias (11 de setembro), já aparece em terceiro no recorte, com IQ 16,9 e contexto de 262 mil tokens — o dobro do que a OpenAI entrega no gpt-oss.
Destaques do recorte: pesos abertos
ModeloCriadorInteligênciaSaída US$/MContexto
gpt-oss-120bopenai24.10.17131k
Qwen3 Next 80B A3B Thinkingqwen16.91.2262k
gpt-oss-20bopenai15.20.13131k
Llama 4 Maverickmeta-llama14.50.6961.05M
Qwen3 Next 80B A3B Instructqwen13.81.1262k
Llama 4 Scoutmeta-llama10.30.31.31M
Llama 3.3 70B Instructmeta-llama9.30.32131k
ERNIE 4.5 300B A47B baidu8.91.1131k

O que o MoE faz pelo seu custo — e pelo seu hardware

Pesa 117 bilhões de parâmetros no total, mas só ativa 5,1 por token. É como ter um arquivo de 117 GB no HD e usar 5 GB por consulta. Para quem roda na própria infra, isso muda o cálculo de GPU; para quem chama via API, muda o preço — e muda muito.

O Llama 4 Maverick é o caso mais curioso do recorte: são 402 bilhões de parâmetros totais, 17 ativos por token, multimodal (aceita imagem), e cobra US$ 0,696 por milhão de saída. Mais caro que o gpt-oss, mas com olho para imagem e contexto de 1 milhão de tokens — um recurso que nenhum modelo fechado pequeno entrega.

Para quem vale — e para quem não muda nada

Vale para você se: está montando produto com margem apertada, precisa de auditoria do modelo (pesos abertos permitem inspeção), ou roda carga em GPU própria e quer escapar do mark-up da API.

Não muda nada se: você já está pagando Claude ou GPT-4o em tarefas onde cada ponto percentual de qualidade vira receita — o o3 e o topo fechado ainda ganham em raciocínio pesado, e a conta fecha porque o resultado também é melhor.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 227 modelos disponíveis no catálogo nesta data.

A geopolítica do peso aberto

Dos 12, 5 são dos EUA (OpenAI e Meta), 4 da China (Qwen e Baidu). A OpenAI entrou no jogo em agosto com dois tamanhos; a Meta segura a linhagem Llama desde 2024; a Qwen atualizou a linha Next em 11 de setembro; a Baidu mantém o ERNIE 4.5 desde junho. É um mercado pequeno, mas com players sérios dos dois lados do Pacífico — e sem europeu no recorte.

O que fazer com isso hoje

Se a sua fila de inferência é grande e o orçamento é pequeno, o gpt-oss-120b é a primeira coisa a testar. Se você precisa de contexto longo (acima de 200 mil tokens) ou multimodalidade nativa, o Llama 4 Scout (contexto de 1,3 milhão) e o Maverick são as opções abertas com melhor ficha. E se o seu caso é raciocínio com cadeia de pensamento explícita, o Qwen3 Next Thinking entrega saída estruturada por US$ 1,20 por milhão — ainda uma fração do que se paga no topo fechado.

Em uma frase

Antes de pagar o topo do catálogo, teste o gpt-oss-120b: para muita carga de produção, a perda de qualidade é menor que o ganho de 47x no custo de saída.

Perguntas frequentes

O que é um modelo de pesos abertos?

É um modelo cujo arquivo de pesos (os números que definem o comportamento da rede) é publicado, permitindo que qualquer pessoa rode, audite ou ajuste o modelo localmente. No recorte de hoje, são 12 dos 227 modelos do catálogo.

Qual o modelo open-weight mais barato com bom desempenho?

O gpt-oss-20b, da OpenAI, custa US$ 0,03 por milhão de tokens de entrada e US$ 0,13 de saída — o mais barato do recorte. O irmão maior, gpt-oss-120b, é o que entrega o melhor IQ entre os abertos (24,1).

Modelos abertos são piores que os fechados?

Em média, sim — o topo do catálogo (OpenAI o3, IQ 31,1) não tem equivalente aberto. Mas a distância diminuiu: o melhor open-weight de hoje já passa de 75% do IQ do líder, e custa uma fração do preço.

Leia também