FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

gpt-oss-20b custa 5x menos que o Llama 4 Maverick — e quase empata em inteligência

Dois modelos abertos, preços opostos, capacidade parecida. Qual deles cabe no seu pipeline?

Redação FalaVIP IA 3 min de leitura
US$ 0,13por milhão de tokens de saída do gpt-oss-20b
US$ 0,696por milhão de tokens de saída do Llama 4 Maverick
15,2 vs 14,5índice de inteligência (Artificial Analysis)

A diferença não está na capacidade — está na conta

Você está olhando o índice de inteligência, vê 15,2 e 14,5, e pensa: "praticamente iguais". Aí abre a tabela de preços e o Maverick custa US$ 0,696 por milhão de tokens de saída enquanto o gpt-oss-20b cobra US$ 0,13. 5,3 vezes mais caro para entregar um ponto de IQ a menos. Em volume, isso vira uma diferença de milhares de reais na fatura do fim do mês.

Índice de inteligência (Artificial Analysis)
gpt-oss-20b15,2Llama 4 Maverick14,5índice
Fonte: Artificial Analysis

Os dois são abertos (licença Apache 2.0 no gpt-oss-20b, licença comunitária no Maverick), os dois são MoE, e os dois foram lançados em 2025. Mas foram pensados para resolver problemas diferentes — e é isso que decide qual entra no seu stack.

A arquitetura por trás do preço

O gpt-oss-20b é um modelo de 21 bilhões de parâmetros totais com apenas 3,6 bilhões ativos por passada. É como ter um restaurante com cardápio enorme mas só três cozinheiros na cozinha por pedido — você paga para manter o catálogo todo, mas a conta de luz é de poucos. O Llama 4 Maverick inverte a lógica: 402 bilhões de parâmetros totais, 17 bilhões ativos, 128 especialistas. Cardápio ainda maior, cozinha maior, conta maior.

Preço de saída (US$ por milhão de tokens)
gpt-oss-20b0,13Llama 4 Maverick0,696US$/M
Fonte: OpenRouter

Para o desenvolvedor, isso significa duas coisas concretas:

  • Velocidade. O gpt-oss-20b entrega 112,6 tokens/s contra 86,45 do Maverick. Em workloads interativos, essa diferença aparece.
  • Custo de entrada. US$ 0,03 por milhão de tokens de input no gpt-oss-20b, US$ 0,20 no Maverick. Para pipelines que ingerem muito texto (RAG, classificação em massa, sumarização de logs), o multiplicador é brutal.

Onde cada um ganha no benchmark

Olhando os números por capacidade, a história muda de figura:

gpt-oss-20b × Llama 4 Maverick
Critériogpt-oss-20bLlama 4 Maverick
Índice de inteligência15.214.5
Entrada US$/M0.030.2
Saída US$/M0.130.696
Contexto131k1.05M
Pesos abertossimsim
Velocidade (tok/s)11386
Índice de código20.716.3
Índice agêntico3.11.2
  • Coding (20,7 vs 16,3): o gpt-oss-20b lidera com folga. Se você está montando um agente que escreve código, sugere patches ou revisa PRs, o modelo da OpenAI entrega mais.
  • Agentic (3,1 vs 1,2): mesma direção, vantagem de 2,5x para o gpt-oss-20b. Em tarefas que exigem múltiplos passos coordenados, a diferença pesa.
  • Coding e agentic juntos são onde mora a maioria das aplicações de produção hoje. É aqui que o preço menor encontra a capacidade maior.

O Maverick só lidera em um quesito mensurável: contexto de 1M de tokens contra 131k do gpt-oss-20b. Se você precisa enfiar uma codebase inteira, um PDF de 800 páginas ou um histórico longo de conversa em uma única janela, a janela do Maverick é 7,6 vezes maior.

Multimodalidade: o divisor real

Esse é o ponto que o preço não conta. O Llama 4 Maverick é text+image → text. Ele lê imagem. O gpt-oss-20b é text → text, ponto. Se o seu produto envolve análise de foto, OCR de documento escaneado, screenshot de UI ou qualquer coisa que precise "ver", o Maverick é o único dos dois que serve — e o gpt-oss-20b nem entra na conversa.

Para workload puramente textual, multimodalidade não é argumento — é ruído.

Onde cada um ganha

gpt-oss-20b ganha quando: o workload é 100% texto, você quer minimizar custo por token, precisa de velocidade acima de 100 tokens/s, e tarefas de código/agente estão no centro do produto. O fato de ser Apache 2.0 (sem as restrições da licença Meta) também facilita redistribuição e fine-tune comercial.

Llama 4 Maverick ganha quando: você precisa processar imagem junto com texto, ou quando a janela de contexto de 1M tokens é requisito (documentos longos, codebases inteiras, sessões extensas). Paga 5x mais por milhão de tokens de saída e 6,7x mais por entrada — mas leva contexto e visão por esse preço.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Llama 4 Scout10.30.3
Entre os 219 modelos disponíveis no catálogo nesta data.

E sobre o tabuleiro: ambos vêm dos EUA, ambos são abertos, ambos estão no catálogo de 219 modelos ativos hoje. O gpt-oss-20b foi lançado em 5 de agosto de 2025, o Maverick em 5 de abril — quatro meses de diferença que se traduzem em preço mais agressivo do lado da OpenAI. Em capacidade bruta, o topo continua sendo o o3 (IQ 31,1), que custa US$ 8 por milhão de tokens de saída — 60 vezes o preço do gpt-oss-20b. Os dois modelos desta pauta sentam no meio do ranking: não são os mais inteligentes, mas entregam 80% do valor de um frontier por uma fração do custo.

Em uma frase

Se o seu produto é texto puro e código, migre para o gpt-oss-20b e meça a queda na fatura no fim do mês; só vale pagar 5x mais no Maverick se você precisa de imagem ou de janela de 1M de tokens.

Perguntas frequentes

gpt-oss-20b ou Llama 4 Maverick para agente de código?

gpt-oss-20b. Ele marca 20,7 em coding e 3,1 em agentic, contra 16,3 e 1,2 do Maverick, e custa uma fração do preço. Para fluxo puramente textual, é a escolha racional.

Posso usar o gpt-oss-20b comercialmente?

Sim. Ele é distribuído sob Apache 2.0, uma das licenças abertas mais permissivas. O Llama 4 Maverick também é aberto, mas usa a licença comunitária da Meta, que tem restrições adicionais para usuários muito grandes.

Qual dos dois tem a maior janela de contexto?

Llama 4 Maverick, com 1.048.576 tokens (1M) contra 131.072 do gpt-oss-20b. Para documentos muito longos ou codebases inteiras em uma única janela, o Maverick é a única opção entre os dois.

Leia também