FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

gpt-oss-20b custa 5,5x menos e bate Llama 3.3 70B em inteligência

No comparativo direto, o modelo open-weight da OpenAI ganha em preço, velocidade, raciocínio e no índice de inteligência. Llama 3.3 70B sobrevive só em nichos específicos.

Redação FalaVIP IA 3 min de leitura
US$ 0,13por milhão de tokens de saída (gpt-oss-20b)
US$ 0,71por milhão de tokens de saída (Llama 3.3 70B)
15,2índice de inteligência do gpt-oss-20b, contra 9,3 do Llama 3.3 70B

A conta que o release não mostra

OpenAI soltou o gpt-oss-20b no começo de agosto com a narrativa de "modelo open-weight para todo mundo". O número que importa para quem paga API, porém, está na tabela de preços: US$ 0,13 por milhão de tokens de saída contra US$ 0,71 do Llama 3.3 70B Instruct. São 5,5 vezes mais barato. E antes que você conclua que é a típica troca "barato mas burro", olha o índice de inteligência Artificial Analysis desta data: 15,2 contra 9,3. O modelo mais em conta também é o mais esperto nesta comparação.

Preço de saída (US$ por milhão de tokens)
gpt-oss-20b0,13Llama 3.3 70B Instruct0,32US$/M
Fonte: OpenRouter
Índice de inteligência (Artificial Analysis)
gpt-oss-20b15,2Llama 3.3 70B Instruct9,3índice
Fonte: Artificial Analysis

O que o MoE tem a ver com a fatura

gpt-oss-20b não é um modelo pequeno — são 21 bilhões de parâmetros totais, dos quais 3,6 bilhões ficam ativos a cada token processado. É a arquitetura Mixture-of-Experts: pensa num hospital com 21 médicos no quadro, mas só quatro atendem por vez. O custo de inferência cai, a velocidade sobe — 112,6 tokens por segundo contra 84,6 do Llama 3.3, cerca de 33% mais rápido — e o modelo consegue carregar mais conhecimento por unidade de compute. O Llama 3.3 70B é denso: os 70 bilhões de parâmetros trabalham em todo token, sem economia possível.

Traduzindo o release da OpenAI

Quando o anúncio diz "modelo aberto otimizado para baixa latência", o que está na fatura: input a US$ 0,03, output a US$ 0,13, e cache na faixa do input. O Llama 3.3 cobra tarifa única de US$ 0,71 nos três fluxos. Em um workload típico de chat com 70% de input e 30% de output, o gpt-oss-20b sai por US$ 0,10 por milhão contra US$ 0,71 do concorrente. Em cargas com cache pesado (prompt de sistema repetido, RAG com contexto fixo), a economia dobra de novo porque o cache do gpt-oss-20b custa US$ 0,03.

gpt-oss-20b × Llama 3.3 70B Instruct
Critériogpt-oss-20bLlama 3.3 70B Instruct
Índice de inteligência15.29.3
Entrada US$/M0.030.1
Saída US$/M0.130.32
Contexto131k131k
Pesos abertossimsim
Velocidade (tok/s)11385
Índice de código20.711.9
Índice agêntico3.1

O release também destaca raciocínio nativo — o campo reasoning está marcado como true. O Llama 3.3 não tem modo de raciocínio dedicado e responde direto. Em benchmark de código, isso se traduz em 20,7 contra 11,9 para o modelo da OpenAI. O knowledge cutoff também é mais recente: junho de 2024 contra dezembro de 2023. Ambos têm 131 mil tokens de contexto e ambos são open-weight, então servem para self-hosting.

Para quem cada um vale a pena

gpt-oss-20b ganha em quase todo cenário de API comercial: produção de texto, geração de código, agentes que precisam de chain-of-thought, qualquer workload onde custo pesa. É também a escolha natural para self-hosting com orçamento apertado de GPU, porque os 3,6 bilhões ativos cabem em hardware de consumidor.

Llama 3.3 70B Instruct ainda tem um nicho: quando você precisa de um modelo denso para servir em uma stack que não está otimizada para o roteamento de experts do MoE, ou quando quer respostas curtas sem o overhead do chain-of-thought para tarefas triviais em altíssimo volume. Vale também para quem já tem fine-tunes e pipelines construídos em cima dele — o custo de migração pesa mais que a economia da troca.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Llama 4 Scout10.30.3
Entre os 222 modelos disponíveis no catálogo nesta data.

No tabuleiro desta data, gpt-oss-20b ocupa a terceira posição em inteligência entre os modelos listados, atrás do o3 e do irmão maior gpt-oss-120b. O Llama 3.3 70B está abaixo do top 5 — e abaixo de qualquer modelo recente da OpenAI. São 15 modelos lançados nos últimos 30 dias, e a maioria joga nesse mesmo intervalo de preço e capacidade.

O que fazer com isso hoje

Se o seu caso é API paga, migre o que der para gpt-oss-20b e meça custo total — não só o preço por token, mas o blended (0,09 contra 0,67), que pondera qualidade por dólar. Se você roda self-hosting e já tem 70B rodando liso, avalie se o MoE não te dá ganho próximo de 2x em throughput na mesma GPU. O Llama 3.3 só se sustenta quando modelo denso e sem raciocínio forem requisitos técnicos, não preferência de stack.

Em uma frase

Para a maioria dos workloads de API, gpt-oss-20b ganha em tudo: custa 5,5x menos, é mais inteligente, mais rápido e tem raciocínio nativo; Llama 3.3 70B só fica quando você precisa de arquitetura densa ou já tem pipelines caros demais para migrar.

Perguntas frequentes

gpt-oss-20b é mesmo mais barato que Llama 3.3 70B em todos os fluxos?

Sim. Output custa US$ 0,13 contra US$ 0,71 por milhão de tokens. O input é ainda mais discrepante: US$ 0,03 contra US$ 0,71, quase 24 vezes de diferença. Em workloads típicos de chat, a economia supera 80%.

O que significa 3,6 bilhões de parâmetros ativos no gpt-oss-20b?

É arquitetura Mixture-of-Experts: dos 21B totais, apenas 3,6B rodam por token. É o motivo de o modelo custar menos para inferir e rodar mais rápido, mesmo sendo mais inteligente que modelos densos bem maiores em vários benchmarks.

Quando ainda vale a pena usar Llama 3.3 70B Instruct?

Em dois cenários: quando a sua stack de serving não está otimizada para o roteamento MoE e você precisa de um modelo denso, ou quando você já tem fine-tunes e pipelines críticos em cima do Llama 3.3 e o custo de migração não compensa a economia na fatura.

Leia também