FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Pesos abertos já respondem por 15 dos 270 modelos do catálogo — e o mais barato custa US$ 0,13

OpenAI, Meta, Qwen e NVIDIA disputam um nicho que saiu da promessa e entrou na conta da API.

Redação FalaVIP IA 3 min de leitura
US$ 0,13por milhão de tokens de saída do gpt-oss-20b
15modelos com pesos abertos num catálogo de 270
24,1índice de inteligência do gpt-oss-120b, o mais alto do recorte

A conta, não o manifesto

Se você ainda associa "pesos abertos" a uma promessa ideológica, o catálogo desta terça-feira diz outra coisa: é uma linha da fatura. Dos mais de 270 modelos listados, 15 trazem a etiqueta open_weights, e entre eles está o gpt-oss-20b, da própria OpenAI, cobrando US$ 0,13 por milhão de tokens de saída — valor mais baixo que qualquer modelo fechado da casa. O recorte inteiro cabe numa disputa de centavos, e o vencedor de cada categoria raramente é quem você esperaria.

O cenário antes do gráfico

Olhe o recorte inteiro como um tabuleiro, não modelo por modelo. Estados Unidos e China dividem as oito vagas do recorte com algum destaque: OpenAI, Meta e NVIDIA de um lado; Qwen do outro. Os preços de entrada giram entre US$ 0,03 e US$ 0,71 por milhão de tokens de entrada — uma amplitude de mais de 20 vezes para produtos com a mesma etiqueta. A diferença não está só no marketing, está na arquitetura: quase todos os modelos do recorte são Mixture-of-Experts (MoE), onde só uma fração dos parâmetros totais é ativada por token. É como pagar a conta de luz de um galpão, mas usar só as salas que você precisa.

Inteligência × preço no recorte
gpt-oss-120bQwen3 Next 80B A3B Thinkinggpt-oss-20bLlama 4 MaverickQwen3 Next 80B A3B InstructLlama 3.3 Nemotron Super 49BLlama 4 ScoutLlama 3.3 70B InstructUS$ por milhão (saída, escala log)índice de inteligência

Quem lidera em quê, sem marketing no meio

O topo do recorte por índice de inteligência medido hoje pertence ao gpt-oss-120b, com 24,1. Em segundo vem o Qwen3 Next 80B A3B Thinking, com 16,9, seguido pelo gpt-oss-20b, com 15,2. Os dois modelos da OpenAI são MoE com 117B e 21B parâmetros totais, mas só 5,1B e 3,6B ativos por passada — daí o preço de gpt-oss-20b em US$ 0,03 de entrada e US$ 0,03 de cache por milhão de tokens. Já os pesos abertos da Meta — Llama 4 Maverick (IQ 14,5) e Llama 4 Scout (IQ 10,3) — vendem multimodalidade: ambos aceitam imagem e texto, enquanto quase todo o resto do recorte é só texto. O Llama 4 Maverick tem janela de 1 milhão de tokens, a maior do recorte; o Scout empilha 1,3 milhão.

Destaques do recorte: pesos abertos
ModeloCriadorInteligênciaSaída US$/MContexto
gpt-oss-120bopenai24.10.17131k
Qwen3 Next 80B A3B Thinkingqwen16.91.2262k
gpt-oss-20bopenai15.20.13131k
Llama 4 Maverickmeta-llama14.50.6961.05M
Qwen3 Next 80B A3B Instructqwen13.81.1262k
Llama 3.3 Nemotron Super 49Bnvidia12.40.4131k
Llama 4 Scoutmeta-llama10.30.31.31M
Llama 3.3 70B Instructmeta-llama9.30.32131k

O que o recorte inteiro mostra

Três padrões saltam aos olhos quando se olha a lista junta. Primeiro: a OpenAI entrou no nicho com preços de queima de margem — gpt-oss-20b é o mais barato do recorte na entrada e na saída, e o cache de leitura também é o mais barato. Segundo: a Qwen aposta em raciocínio embutido — tanto o Thinking quanto o Instruct da família Qwen3 Next cobram preços parecidos (US$ 1,1 e US$ 1,2 de saída), mas o Thinking vem com cadeia de "pensamento" por padrão, custando latência e qualidade de resposta. Terceiro: o Llama 3.3 70B Instruct, de dezembro de 2024, segue listado a US$ 0,71 nos três sentidos — entrada, saída e cache. É o modelo mais caro do recorte, e não por capacidade: é herança de uma janela em que pesos abertos custavam mais caro.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 270 modelos disponíveis no catálogo nesta data.

Para quem isso muda algo

Vale a pena olhar se você roda volume alto com tarefas de raciocínio moderado, se quer fazer inferência local para tirar dado sensível da API, ou se precisa de multimodalidade barata — o Llama 4 Scout, a US$ 0,30 de saída, é o único do recorte que aceita imagem e custa menos de US$ 0,50. Não muda nada se você precisa do topo absoluto da categoria: o o3, modelo fechado da OpenAI, lidera o catálogo geral com IQ 31,1 a US$ 8 por milhão de tokens de saída — quase 62 vezes o preço do gpt-oss-20b por uma margem bruta de 29% em inteligência. Para cargas sensíveis a latência, repare na coluna speed: o Qwen3 Next Thinking roda a 196,94 tokens por segundo, o mais rápido do recorte.

O que fazer com isso

Se você está pagando a conta da API, a pergunta de hoje não é "devemos adotar pesos abertos?", e sim em qual fila da fatura eles entram. Comece pela tarefa mais barata do seu pipeline, meça o gpt-oss-20b e o gpt-oss-120b em paralelo, e só então decida se vale migrar. O recorte inteiro cabe num orçamento apertado — e essa é a parte que o release da OpenAI em agosto não contou.

Em uma frase

Trocar um modelo fechado por um de pesos abertos raramente é sobre ideologia; é sobre mover uma linha da fatura — e, neste recorte, o movimento pode ser de 20 vezes.

Perguntas frequentes

Qual o modelo de pesos abertos mais barato do catálogo hoje?

O gpt-oss-20b, da OpenAI, cobra US$ 0,03 por milhão de tokens de entrada, US$ 0,13 de saída e US$ 0,03 de cache — o menor preço entre os 15 modelos com pesos abertos listados.

Quantos modelos de pesos abertos estão no catálogo em novembro de 2025?

São 15 modelos com a etiqueta `open_weights` num catálogo de mais de 270. O recorte reúne principalmente OpenAI, Meta, Qwen e NVIDIA.

Modelo aberto é sempre mais barato que modelo fechado?

Não. O Llama 3.3 70B Instruct, de dezembro de 2024, cobra US$ 0,71 por milhão de tokens nos três sentidos — mais caro que vários modelos fechados do catálogo geral.

Leia também