FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

gpt-oss-20b cobra metade do preço, mas a janela de contexto muda tudo

OpenAI e Meta disputam a faixa de modelos abertos pequenos; um vence em custo, o outro em multimodal e contexto.

Redação FalaVIP IA 3 min de leitura
US$ 0,13por milhão de tokens de saída no gpt-oss-20b
US$ 0,30por milhão de tokens de saída no Llama 4 Scout
131.072tokens de contexto no gpt-oss-20b (10× menos que o Scout)

A conta que ninguém mostra no release

O lançamento do gpt-oss-20b em agosto de 2025 chegou com a narrativa de "modelo aberto pequeno da OpenAI". Bonito no marketing. Mas a pergunta de quem paga a API é outra: quanto custa cada token de saída na prática? A resposta está em 13 centavos de dólar por milhão. O Llama 4 Scout, da Meta, cobra 30. Mais que o dobro.

Preço de saída (US$ por milhão de tokens)
gpt-oss-20b0,13Llama 4 Scout0,3US$/M
Fonte: OpenRouter

Traduzindo o marketing: a OpenAI está posicionando o gpt-oss-20b como a opção barata da casa para workloads que não precisam do o3. E, no papel, a conta fecha — o preço de saída é 57% menor. Só que preço é metade da história.

Inteligência: o gpt-oss-20b lidera, mas com ressalva

No índice de inteligência medido pela Artificial Analysis, o gpt-oss-20b marca 15,2 contra 10,3 do Scout. Diferença real, não cosmético. Em coding, a vantagem da OpenAI fica ainda mais explícita: 20,7 contra 8,2 — quase 2,5 vezes melhor no recorte de programação.

Índice de inteligência (Artificial Analysis)
gpt-oss-20b15,2Llama 4 Scout10,3índice
Fonte: Artificial Analysis

Tem um "mas" aqui. Esse índice é a medição atual, não a da época do lançamento. Dá para dizer que o gpt-oss-20b lidera o Scout hoje; não dá para afirmar que "subiu" ou "mudou de posição" ao longo do tempo — não tem série histórica para isso.

Onde o Scout ainda vence — e é por muito

Coloque os dois lado a lado e o cenário muda de figura em três pontos:

gpt-oss-20b × Llama 4 Scout
Critériogpt-oss-20bLlama 4 Scout
Índice de inteligência15.210.3
Entrada US$/M0.030.1
Saída US$/M0.130.3
Contexto131k1.31M
Pesos abertossimsim
Velocidade (tok/s)113112
Índice de código20.78.2
Índice agêntico3.11.1
  • Janela de contexto: 1.310.720 tokens no Scout contra 131.072 no gpt-oss-20b. São 10× mais tokens processáveis de uma vez. Para resumir livros, analisar codebases inteiras ou manter conversas longas com anexos grandes, isso não é detalhe — é bloqueante.
  • Multimodalidade: o Scout aceita imagem além de texto; o gpt-oss-20b é text-only. Se você precisa descrever uma foto, ler um print de erro ou analisar um PDF com figuras, o Scout é o único dos dois que entra em campo.
  • Velocidade: empate técnico. 112,6 tokens/s no gpt-oss-20b contra 111,5 no Scout. Diferença dentro do ruído.

E o tal do "open weights"?

Os dois são open weights, então ambos rodam em infraestrutura própria se você tiver GPU sobrando. O gpt-oss-20b tem 21B de parâmetros totais com 3,6B ativos por passada — mais leve para servir. O Scout é um monstro de 109B com 17B ativos por forward pass. Em self-hosting, o gpt-oss-20b cabe em hardware muito mais modesto. O Scout exige cluster.

Para quem cada um ganha — sem "depende"

gpt-oss-20b ganha quando o trabalho é texto puro, cabe em 128k de contexto, e o que importa é pagar menos por token mantendo raciocínio decente. Chatbots de atendimento, geração de código em snippets, pipelines de NLP em lote, classificação. A nota de coding 20,7 pesa aqui.

Llama 4 Scout ganha quando você precisa processar documentos longos, analisar imagens, ou quer a opção de rodar multimodal sem trocar de provedor. Resumo de papers, análise de repositórios inteiros, agentes que leem screenshots, qualquer coisa que estoure os 128k.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Llama 4 Scout10.30.3
Entre os 219 modelos disponíveis no catálogo nesta data.

No tabuleiro maior, o topo do mercado hoje em inteligência segue dominado pelo o3 (31,1), seguido pelo gpt-oss-120b (24,1). O gpt-oss-20b e o Scout brigam na faixa intermediária — e essa briga é justamente sobre orçamento versus capacidade.

O que fazer com isso na segunda-feira

Se você está pagando API e roda majoritariamente texto curto a médio, migre workloads de teste para o gpt-oss-20b e meça a diferença de qualidade. Se o pipeline depende de contexto longo ou multimodal, o Scout continua sendo a escolha certa — e o preço maior é o custo de ter 10× mais janela e entrada de imagem.

Em uma frase

Use gpt-oss-20b para texto puro dentro de 128k e corte a fatura pela metade; escolha Llama 4 Scout quando precisar de contexto longo ou imagem — o preço maior paga por uma capacidade que o outro simplesmente não tem.

Perguntas frequentes

gpt-oss-20b ou Llama 4 Scout: qual é mais barato?

O gpt-oss-20b custa US$ 0,13 por milhão de tokens de saída contra US$ 0,30 do Scout — diferença de 57%. No preço de entrada a vantagem se mantém: US$ 0,03 contra US$ 0,10 por milhão.

Qual dos dois aceita imagem?

Só o Llama 4 Scout. O gpt-oss-20b é text-only. Para qualquer fluxo multimodal — análise de prints, descrição de fotos, OCR com contexto — o Scout é a única opção entre os dois.

Posso rodar os dois localmente?

Sim, ambos são open weights. O gpt-oss-20b é bem mais leve (3,6B ativos por passada) e roda em hardware modesto. O Scout tem 17B ativos e exige cluster de GPUs para self-hosting.

Leia também