Os 12 modelos de pesos abertos do catálogo custam 90% menos que o topo
O melhor open-weight hoje tem IQ 24,1 e cobra US$ 0,17 por milhão de tokens de saída — quase 50 vezes mais barato que o líder absoluto do catálogo.
O que aparece quando se olha o recorte inteiro
São 227 modelos no catálogo hoje. Deles, só 12 têm pesos abertos — pouco mais de 5%. É um número pequeno, mas é o suficiente para virar a chave de como você paga a sua API.
A conta é simples: o modelo mais inteligente do catálogo, OpenAI o3, cobra US$ 8 por milhão de tokens de saída. O melhor open-weight, o gpt-oss-120b da própria OpenAI, cobra US$ 0,17 pelo mesmo milhão. São 47 vezes de diferença pelo mesmo tipo de trabalho — gerar texto — sem que ninguém esteja distribuindo brinde.
O padrão que ninguém anuncia no release
Os 12 modelos abertos não são um amontoado aleatório. Olhando o recorte, três coisas aparecem de cara:
- A maioria é chinesa ou americana, e quase todo mundo usa Mixture of Experts (MoE) — ativa poucos parâmetros por token, mas o modelo total é enorme. É a mesma arquitetura que domina o topo do mercado.
- O melhor deles, o gpt-oss-120b, foi lançado em 5 de agosto de 2025 e tem IQ 24,1 — distante do o3 (31,1), mas acima de qualquer outro peso aberto.
- O chinês Qwen3 Next 80B A3B Thinking, lançado há cinco dias (11 de setembro), já aparece em terceiro no recorte, com IQ 16,9 e contexto de 262 mil tokens — o dobro do que a OpenAI entrega no gpt-oss.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| gpt-oss-120b | openai | 24.1 | 0.17 | 131k |
| Qwen3 Next 80B A3B Thinking | qwen | 16.9 | 1.2 | 262k |
| gpt-oss-20b | openai | 15.2 | 0.13 | 131k |
| Llama 4 Maverick | meta-llama | 14.5 | 0.696 | 1.05M |
| Qwen3 Next 80B A3B Instruct | qwen | 13.8 | 1.1 | 262k |
| Llama 4 Scout | meta-llama | 10.3 | 0.3 | 1.31M |
| Llama 3.3 70B Instruct | meta-llama | 9.3 | 0.32 | 131k |
| ERNIE 4.5 300B A47B | baidu | 8.9 | 1.1 | 131k |
O que o MoE faz pelo seu custo — e pelo seu hardware
Pesa 117 bilhões de parâmetros no total, mas só ativa 5,1 por token. É como ter um arquivo de 117 GB no HD e usar 5 GB por consulta. Para quem roda na própria infra, isso muda o cálculo de GPU; para quem chama via API, muda o preço — e muda muito.
O Llama 4 Maverick é o caso mais curioso do recorte: são 402 bilhões de parâmetros totais, 17 ativos por token, multimodal (aceita imagem), e cobra US$ 0,696 por milhão de saída. Mais caro que o gpt-oss, mas com olho para imagem e contexto de 1 milhão de tokens — um recurso que nenhum modelo fechado pequeno entrega.
Para quem vale — e para quem não muda nada
Vale para você se: está montando produto com margem apertada, precisa de auditoria do modelo (pesos abertos permitem inspeção), ou roda carga em GPU própria e quer escapar do mark-up da API.
Não muda nada se: você já está pagando Claude ou GPT-4o em tarefas onde cada ponto percentual de qualidade vira receita — o o3 e o topo fechado ainda ganham em raciocínio pesado, e a conta fecha porque o resultado também é melhor.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
A geopolítica do peso aberto
Dos 12, 5 são dos EUA (OpenAI e Meta), 4 da China (Qwen e Baidu). A OpenAI entrou no jogo em agosto com dois tamanhos; a Meta segura a linhagem Llama desde 2024; a Qwen atualizou a linha Next em 11 de setembro; a Baidu mantém o ERNIE 4.5 desde junho. É um mercado pequeno, mas com players sérios dos dois lados do Pacífico — e sem europeu no recorte.
O que fazer com isso hoje
Se a sua fila de inferência é grande e o orçamento é pequeno, o gpt-oss-120b é a primeira coisa a testar. Se você precisa de contexto longo (acima de 200 mil tokens) ou multimodalidade nativa, o Llama 4 Scout (contexto de 1,3 milhão) e o Maverick são as opções abertas com melhor ficha. E se o seu caso é raciocínio com cadeia de pensamento explícita, o Qwen3 Next Thinking entrega saída estruturada por US$ 1,20 por milhão — ainda uma fração do que se paga no topo fechado.
Antes de pagar o topo do catálogo, teste o gpt-oss-120b: para muita carga de produção, a perda de qualidade é menor que o ganho de 47x no custo de saída.
Perguntas frequentes
O que é um modelo de pesos abertos?
É um modelo cujo arquivo de pesos (os números que definem o comportamento da rede) é publicado, permitindo que qualquer pessoa rode, audite ou ajuste o modelo localmente. No recorte de hoje, são 12 dos 227 modelos do catálogo.
Qual o modelo open-weight mais barato com bom desempenho?
O gpt-oss-20b, da OpenAI, custa US$ 0,03 por milhão de tokens de entrada e US$ 0,13 de saída — o mais barato do recorte. O irmão maior, gpt-oss-120b, é o que entrega o melhor IQ entre os abertos (24,1).
Modelos abertos são piores que os fechados?
Em média, sim — o topo do catálogo (OpenAI o3, IQ 31,1) não tem equivalente aberto. Mas a distância diminuiu: o melhor open-weight de hoje já passa de 75% do IQ do líder, e custa uma fração do preço.