gpt-oss-20b cobra metade do preço, mas a janela de contexto muda tudo
OpenAI e Meta disputam a faixa de modelos abertos pequenos; um vence em custo, o outro em multimodal e contexto.
A conta que ninguém mostra no release
O lançamento do gpt-oss-20b em agosto de 2025 chegou com a narrativa de "modelo aberto pequeno da OpenAI". Bonito no marketing. Mas a pergunta de quem paga a API é outra: quanto custa cada token de saída na prática? A resposta está em 13 centavos de dólar por milhão. O Llama 4 Scout, da Meta, cobra 30. Mais que o dobro.
Traduzindo o marketing: a OpenAI está posicionando o gpt-oss-20b como a opção barata da casa para workloads que não precisam do o3. E, no papel, a conta fecha — o preço de saída é 57% menor. Só que preço é metade da história.
Inteligência: o gpt-oss-20b lidera, mas com ressalva
No índice de inteligência medido pela Artificial Analysis, o gpt-oss-20b marca 15,2 contra 10,3 do Scout. Diferença real, não cosmético. Em coding, a vantagem da OpenAI fica ainda mais explícita: 20,7 contra 8,2 — quase 2,5 vezes melhor no recorte de programação.
Tem um "mas" aqui. Esse índice é a medição atual, não a da época do lançamento. Dá para dizer que o gpt-oss-20b lidera o Scout hoje; não dá para afirmar que "subiu" ou "mudou de posição" ao longo do tempo — não tem série histórica para isso.
Onde o Scout ainda vence — e é por muito
Coloque os dois lado a lado e o cenário muda de figura em três pontos:
| Critério | gpt-oss-20b | Llama 4 Scout |
|---|---|---|
| Índice de inteligência | 15.2 | 10.3 |
| Entrada US$/M | 0.03 | 0.1 |
| Saída US$/M | 0.13 | 0.3 |
| Contexto | 131k | 1.31M |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 113 | 112 |
| Índice de código | 20.7 | 8.2 |
| Índice agêntico | 3.1 | 1.1 |
- Janela de contexto: 1.310.720 tokens no Scout contra 131.072 no gpt-oss-20b. São 10× mais tokens processáveis de uma vez. Para resumir livros, analisar codebases inteiras ou manter conversas longas com anexos grandes, isso não é detalhe — é bloqueante.
- Multimodalidade: o Scout aceita imagem além de texto; o gpt-oss-20b é text-only. Se você precisa descrever uma foto, ler um print de erro ou analisar um PDF com figuras, o Scout é o único dos dois que entra em campo.
- Velocidade: empate técnico. 112,6 tokens/s no gpt-oss-20b contra 111,5 no Scout. Diferença dentro do ruído.
E o tal do "open weights"?
Os dois são open weights, então ambos rodam em infraestrutura própria se você tiver GPU sobrando. O gpt-oss-20b tem 21B de parâmetros totais com 3,6B ativos por passada — mais leve para servir. O Scout é um monstro de 109B com 17B ativos por forward pass. Em self-hosting, o gpt-oss-20b cabe em hardware muito mais modesto. O Scout exige cluster.
Para quem cada um ganha — sem "depende"
gpt-oss-20b ganha quando o trabalho é texto puro, cabe em 128k de contexto, e o que importa é pagar menos por token mantendo raciocínio decente. Chatbots de atendimento, geração de código em snippets, pipelines de NLP em lote, classificação. A nota de coding 20,7 pesa aqui.
Llama 4 Scout ganha quando você precisa processar documentos longos, analisar imagens, ou quer a opção de rodar multimodal sem trocar de provedor. Resumo de papers, análise de repositórios inteiros, agentes que leem screenshots, qualquer coisa que estoure os 128k.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
| Llama 4 Scout | 10.3 | 0.3 |
No tabuleiro maior, o topo do mercado hoje em inteligência segue dominado pelo o3 (31,1), seguido pelo gpt-oss-120b (24,1). O gpt-oss-20b e o Scout brigam na faixa intermediária — e essa briga é justamente sobre orçamento versus capacidade.
O que fazer com isso na segunda-feira
Se você está pagando API e roda majoritariamente texto curto a médio, migre workloads de teste para o gpt-oss-20b e meça a diferença de qualidade. Se o pipeline depende de contexto longo ou multimodal, o Scout continua sendo a escolha certa — e o preço maior é o custo de ter 10× mais janela e entrada de imagem.
Use gpt-oss-20b para texto puro dentro de 128k e corte a fatura pela metade; escolha Llama 4 Scout quando precisar de contexto longo ou imagem — o preço maior paga por uma capacidade que o outro simplesmente não tem.
Perguntas frequentes
gpt-oss-20b ou Llama 4 Scout: qual é mais barato?
O gpt-oss-20b custa US$ 0,13 por milhão de tokens de saída contra US$ 0,30 do Scout — diferença de 57%. No preço de entrada a vantagem se mantém: US$ 0,03 contra US$ 0,10 por milhão.
Qual dos dois aceita imagem?
Só o Llama 4 Scout. O gpt-oss-20b é text-only. Para qualquer fluxo multimodal — análise de prints, descrição de fotos, OCR com contexto — o Scout é a única opção entre os dois.
Posso rodar os dois localmente?
Sim, ambos são open weights. O gpt-oss-20b é bem mais leve (3,6B ativos por passada) e roda em hardware modesto. O Scout tem 17B ativos e exige cluster de GPUs para self-hosting.