gpt-oss-20b custa 5,5x menos e bate Llama 3.3 70B em inteligência
No comparativo direto, o modelo open-weight da OpenAI ganha em preço, velocidade, raciocínio e no índice de inteligência. Llama 3.3 70B sobrevive só em nichos específicos.
A conta que o release não mostra
OpenAI soltou o gpt-oss-20b no começo de agosto com a narrativa de "modelo open-weight para todo mundo". O número que importa para quem paga API, porém, está na tabela de preços: US$ 0,13 por milhão de tokens de saída contra US$ 0,71 do Llama 3.3 70B Instruct. São 5,5 vezes mais barato. E antes que você conclua que é a típica troca "barato mas burro", olha o índice de inteligência Artificial Analysis desta data: 15,2 contra 9,3. O modelo mais em conta também é o mais esperto nesta comparação.
O que o MoE tem a ver com a fatura
gpt-oss-20b não é um modelo pequeno — são 21 bilhões de parâmetros totais, dos quais 3,6 bilhões ficam ativos a cada token processado. É a arquitetura Mixture-of-Experts: pensa num hospital com 21 médicos no quadro, mas só quatro atendem por vez. O custo de inferência cai, a velocidade sobe — 112,6 tokens por segundo contra 84,6 do Llama 3.3, cerca de 33% mais rápido — e o modelo consegue carregar mais conhecimento por unidade de compute. O Llama 3.3 70B é denso: os 70 bilhões de parâmetros trabalham em todo token, sem economia possível.
Traduzindo o release da OpenAI
Quando o anúncio diz "modelo aberto otimizado para baixa latência", o que está na fatura: input a US$ 0,03, output a US$ 0,13, e cache na faixa do input. O Llama 3.3 cobra tarifa única de US$ 0,71 nos três fluxos. Em um workload típico de chat com 70% de input e 30% de output, o gpt-oss-20b sai por US$ 0,10 por milhão contra US$ 0,71 do concorrente. Em cargas com cache pesado (prompt de sistema repetido, RAG com contexto fixo), a economia dobra de novo porque o cache do gpt-oss-20b custa US$ 0,03.
| Critério | gpt-oss-20b | Llama 3.3 70B Instruct |
|---|---|---|
| Índice de inteligência | 15.2 | 9.3 |
| Entrada US$/M | 0.03 | 0.1 |
| Saída US$/M | 0.13 | 0.32 |
| Contexto | 131k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 113 | 85 |
| Índice de código | 20.7 | 11.9 |
| Índice agêntico | 3.1 | — |
O release também destaca raciocínio nativo — o campo reasoning está marcado como true. O Llama 3.3 não tem modo de raciocínio dedicado e responde direto. Em benchmark de código, isso se traduz em 20,7 contra 11,9 para o modelo da OpenAI. O knowledge cutoff também é mais recente: junho de 2024 contra dezembro de 2023. Ambos têm 131 mil tokens de contexto e ambos são open-weight, então servem para self-hosting.
Para quem cada um vale a pena
gpt-oss-20b ganha em quase todo cenário de API comercial: produção de texto, geração de código, agentes que precisam de chain-of-thought, qualquer workload onde custo pesa. É também a escolha natural para self-hosting com orçamento apertado de GPU, porque os 3,6 bilhões ativos cabem em hardware de consumidor.
Llama 3.3 70B Instruct ainda tem um nicho: quando você precisa de um modelo denso para servir em uma stack que não está otimizada para o roteamento de experts do MoE, ou quando quer respostas curtas sem o overhead do chain-of-thought para tarefas triviais em altíssimo volume. Vale também para quem já tem fine-tunes e pipelines construídos em cima dele — o custo de migração pesa mais que a economia da troca.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
| Llama 4 Scout | 10.3 | 0.3 |
No tabuleiro desta data, gpt-oss-20b ocupa a terceira posição em inteligência entre os modelos listados, atrás do o3 e do irmão maior gpt-oss-120b. O Llama 3.3 70B está abaixo do top 5 — e abaixo de qualquer modelo recente da OpenAI. São 15 modelos lançados nos últimos 30 dias, e a maioria joga nesse mesmo intervalo de preço e capacidade.
O que fazer com isso hoje
Se o seu caso é API paga, migre o que der para gpt-oss-20b e meça custo total — não só o preço por token, mas o blended (0,09 contra 0,67), que pondera qualidade por dólar. Se você roda self-hosting e já tem 70B rodando liso, avalie se o MoE não te dá ganho próximo de 2x em throughput na mesma GPU. O Llama 3.3 só se sustenta quando modelo denso e sem raciocínio forem requisitos técnicos, não preferência de stack.
Para a maioria dos workloads de API, gpt-oss-20b ganha em tudo: custa 5,5x menos, é mais inteligente, mais rápido e tem raciocínio nativo; Llama 3.3 70B só fica quando você precisa de arquitetura densa ou já tem pipelines caros demais para migrar.
Perguntas frequentes
gpt-oss-20b é mesmo mais barato que Llama 3.3 70B em todos os fluxos?
Sim. Output custa US$ 0,13 contra US$ 0,71 por milhão de tokens. O input é ainda mais discrepante: US$ 0,03 contra US$ 0,71, quase 24 vezes de diferença. Em workloads típicos de chat, a economia supera 80%.
O que significa 3,6 bilhões de parâmetros ativos no gpt-oss-20b?
É arquitetura Mixture-of-Experts: dos 21B totais, apenas 3,6B rodam por token. É o motivo de o modelo custar menos para inferir e rodar mais rápido, mesmo sendo mais inteligente que modelos densos bem maiores em vários benchmarks.
Quando ainda vale a pena usar Llama 3.3 70B Instruct?
Em dois cenários: quando a sua stack de serving não está otimizada para o roteamento MoE e você precisa de um modelo denso, ou quando você já tem fine-tunes e pipelines críticos em cima do Llama 3.3 e o custo de migração não compensa a economia na fatura.