Pesos abertos já respondem por 15 dos 270 modelos do catálogo — e o mais barato custa US$ 0,13
OpenAI, Meta, Qwen e NVIDIA disputam um nicho que saiu da promessa e entrou na conta da API.
A conta, não o manifesto
Se você ainda associa "pesos abertos" a uma promessa ideológica, o catálogo desta terça-feira diz outra coisa: é uma linha da fatura. Dos mais de 270 modelos listados, 15 trazem a etiqueta open_weights, e entre eles está o gpt-oss-20b, da própria OpenAI, cobrando US$ 0,13 por milhão de tokens de saída — valor mais baixo que qualquer modelo fechado da casa. O recorte inteiro cabe numa disputa de centavos, e o vencedor de cada categoria raramente é quem você esperaria.
O cenário antes do gráfico
Olhe o recorte inteiro como um tabuleiro, não modelo por modelo. Estados Unidos e China dividem as oito vagas do recorte com algum destaque: OpenAI, Meta e NVIDIA de um lado; Qwen do outro. Os preços de entrada giram entre US$ 0,03 e US$ 0,71 por milhão de tokens de entrada — uma amplitude de mais de 20 vezes para produtos com a mesma etiqueta. A diferença não está só no marketing, está na arquitetura: quase todos os modelos do recorte são Mixture-of-Experts (MoE), onde só uma fração dos parâmetros totais é ativada por token. É como pagar a conta de luz de um galpão, mas usar só as salas que você precisa.
Quem lidera em quê, sem marketing no meio
O topo do recorte por índice de inteligência medido hoje pertence ao gpt-oss-120b, com 24,1. Em segundo vem o Qwen3 Next 80B A3B Thinking, com 16,9, seguido pelo gpt-oss-20b, com 15,2. Os dois modelos da OpenAI são MoE com 117B e 21B parâmetros totais, mas só 5,1B e 3,6B ativos por passada — daí o preço de gpt-oss-20b em US$ 0,03 de entrada e US$ 0,03 de cache por milhão de tokens. Já os pesos abertos da Meta — Llama 4 Maverick (IQ 14,5) e Llama 4 Scout (IQ 10,3) — vendem multimodalidade: ambos aceitam imagem e texto, enquanto quase todo o resto do recorte é só texto. O Llama 4 Maverick tem janela de 1 milhão de tokens, a maior do recorte; o Scout empilha 1,3 milhão.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| gpt-oss-120b | openai | 24.1 | 0.17 | 131k |
| Qwen3 Next 80B A3B Thinking | qwen | 16.9 | 1.2 | 262k |
| gpt-oss-20b | openai | 15.2 | 0.13 | 131k |
| Llama 4 Maverick | meta-llama | 14.5 | 0.696 | 1.05M |
| Qwen3 Next 80B A3B Instruct | qwen | 13.8 | 1.1 | 262k |
| Llama 3.3 Nemotron Super 49B | nvidia | 12.4 | 0.4 | 131k |
| Llama 4 Scout | meta-llama | 10.3 | 0.3 | 1.31M |
| Llama 3.3 70B Instruct | meta-llama | 9.3 | 0.32 | 131k |
O que o recorte inteiro mostra
Três padrões saltam aos olhos quando se olha a lista junta. Primeiro: a OpenAI entrou no nicho com preços de queima de margem — gpt-oss-20b é o mais barato do recorte na entrada e na saída, e o cache de leitura também é o mais barato. Segundo: a Qwen aposta em raciocínio embutido — tanto o Thinking quanto o Instruct da família Qwen3 Next cobram preços parecidos (US$ 1,1 e US$ 1,2 de saída), mas o Thinking vem com cadeia de "pensamento" por padrão, custando latência e qualidade de resposta. Terceiro: o Llama 3.3 70B Instruct, de dezembro de 2024, segue listado a US$ 0,71 nos três sentidos — entrada, saída e cache. É o modelo mais caro do recorte, e não por capacidade: é herança de uma janela em que pesos abertos custavam mais caro.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
Para quem isso muda algo
Vale a pena olhar se você roda volume alto com tarefas de raciocínio moderado, se quer fazer inferência local para tirar dado sensível da API, ou se precisa de multimodalidade barata — o Llama 4 Scout, a US$ 0,30 de saída, é o único do recorte que aceita imagem e custa menos de US$ 0,50. Não muda nada se você precisa do topo absoluto da categoria: o o3, modelo fechado da OpenAI, lidera o catálogo geral com IQ 31,1 a US$ 8 por milhão de tokens de saída — quase 62 vezes o preço do gpt-oss-20b por uma margem bruta de 29% em inteligência. Para cargas sensíveis a latência, repare na coluna speed: o Qwen3 Next Thinking roda a 196,94 tokens por segundo, o mais rápido do recorte.
O que fazer com isso
Se você está pagando a conta da API, a pergunta de hoje não é "devemos adotar pesos abertos?", e sim em qual fila da fatura eles entram. Comece pela tarefa mais barata do seu pipeline, meça o gpt-oss-20b e o gpt-oss-120b em paralelo, e só então decida se vale migrar. O recorte inteiro cabe num orçamento apertado — e essa é a parte que o release da OpenAI em agosto não contou.
Trocar um modelo fechado por um de pesos abertos raramente é sobre ideologia; é sobre mover uma linha da fatura — e, neste recorte, o movimento pode ser de 20 vezes.
Perguntas frequentes
Qual o modelo de pesos abertos mais barato do catálogo hoje?
O gpt-oss-20b, da OpenAI, cobra US$ 0,03 por milhão de tokens de entrada, US$ 0,13 de saída e US$ 0,03 de cache — o menor preço entre os 15 modelos com pesos abertos listados.
Quantos modelos de pesos abertos estão no catálogo em novembro de 2025?
São 15 modelos com a etiqueta `open_weights` num catálogo de mais de 270. O recorte reúne principalmente OpenAI, Meta, Qwen e NVIDIA.
Modelo aberto é sempre mais barato que modelo fechado?
Não. O Llama 3.3 70B Instruct, de dezembro de 2024, cobra US$ 0,71 por milhão de tokens nos três sentidos — mais caro que vários modelos fechados do catálogo geral.