gpt-oss-20b custa 5x menos que o Llama 4 Maverick — e quase empata em inteligência
Dois modelos abertos, preços opostos, capacidade parecida. Qual deles cabe no seu pipeline?
A diferença não está na capacidade — está na conta
Você está olhando o índice de inteligência, vê 15,2 e 14,5, e pensa: "praticamente iguais". Aí abre a tabela de preços e o Maverick custa US$ 0,696 por milhão de tokens de saída enquanto o gpt-oss-20b cobra US$ 0,13. 5,3 vezes mais caro para entregar um ponto de IQ a menos. Em volume, isso vira uma diferença de milhares de reais na fatura do fim do mês.
Os dois são abertos (licença Apache 2.0 no gpt-oss-20b, licença comunitária no Maverick), os dois são MoE, e os dois foram lançados em 2025. Mas foram pensados para resolver problemas diferentes — e é isso que decide qual entra no seu stack.
A arquitetura por trás do preço
O gpt-oss-20b é um modelo de 21 bilhões de parâmetros totais com apenas 3,6 bilhões ativos por passada. É como ter um restaurante com cardápio enorme mas só três cozinheiros na cozinha por pedido — você paga para manter o catálogo todo, mas a conta de luz é de poucos. O Llama 4 Maverick inverte a lógica: 402 bilhões de parâmetros totais, 17 bilhões ativos, 128 especialistas. Cardápio ainda maior, cozinha maior, conta maior.
Para o desenvolvedor, isso significa duas coisas concretas:
- Velocidade. O gpt-oss-20b entrega 112,6 tokens/s contra 86,45 do Maverick. Em workloads interativos, essa diferença aparece.
- Custo de entrada. US$ 0,03 por milhão de tokens de input no gpt-oss-20b, US$ 0,20 no Maverick. Para pipelines que ingerem muito texto (RAG, classificação em massa, sumarização de logs), o multiplicador é brutal.
Onde cada um ganha no benchmark
Olhando os números por capacidade, a história muda de figura:
| Critério | gpt-oss-20b | Llama 4 Maverick |
|---|---|---|
| Índice de inteligência | 15.2 | 14.5 |
| Entrada US$/M | 0.03 | 0.2 |
| Saída US$/M | 0.13 | 0.696 |
| Contexto | 131k | 1.05M |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 113 | 86 |
| Índice de código | 20.7 | 16.3 |
| Índice agêntico | 3.1 | 1.2 |
- Coding (20,7 vs 16,3): o gpt-oss-20b lidera com folga. Se você está montando um agente que escreve código, sugere patches ou revisa PRs, o modelo da OpenAI entrega mais.
- Agentic (3,1 vs 1,2): mesma direção, vantagem de 2,5x para o gpt-oss-20b. Em tarefas que exigem múltiplos passos coordenados, a diferença pesa.
- Coding e agentic juntos são onde mora a maioria das aplicações de produção hoje. É aqui que o preço menor encontra a capacidade maior.
O Maverick só lidera em um quesito mensurável: contexto de 1M de tokens contra 131k do gpt-oss-20b. Se você precisa enfiar uma codebase inteira, um PDF de 800 páginas ou um histórico longo de conversa em uma única janela, a janela do Maverick é 7,6 vezes maior.
Multimodalidade: o divisor real
Esse é o ponto que o preço não conta. O Llama 4 Maverick é text+image → text. Ele lê imagem. O gpt-oss-20b é text → text, ponto. Se o seu produto envolve análise de foto, OCR de documento escaneado, screenshot de UI ou qualquer coisa que precise "ver", o Maverick é o único dos dois que serve — e o gpt-oss-20b nem entra na conversa.
Para workload puramente textual, multimodalidade não é argumento — é ruído.
Onde cada um ganha
gpt-oss-20b ganha quando: o workload é 100% texto, você quer minimizar custo por token, precisa de velocidade acima de 100 tokens/s, e tarefas de código/agente estão no centro do produto. O fato de ser Apache 2.0 (sem as restrições da licença Meta) também facilita redistribuição e fine-tune comercial.
Llama 4 Maverick ganha quando: você precisa processar imagem junto com texto, ou quando a janela de contexto de 1M tokens é requisito (documentos longos, codebases inteiras, sessões extensas). Paga 5x mais por milhão de tokens de saída e 6,7x mais por entrada — mas leva contexto e visão por esse preço.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
| Llama 4 Scout | 10.3 | 0.3 |
E sobre o tabuleiro: ambos vêm dos EUA, ambos são abertos, ambos estão no catálogo de 219 modelos ativos hoje. O gpt-oss-20b foi lançado em 5 de agosto de 2025, o Maverick em 5 de abril — quatro meses de diferença que se traduzem em preço mais agressivo do lado da OpenAI. Em capacidade bruta, o topo continua sendo o o3 (IQ 31,1), que custa US$ 8 por milhão de tokens de saída — 60 vezes o preço do gpt-oss-20b. Os dois modelos desta pauta sentam no meio do ranking: não são os mais inteligentes, mas entregam 80% do valor de um frontier por uma fração do custo.
Se o seu produto é texto puro e código, migre para o gpt-oss-20b e meça a queda na fatura no fim do mês; só vale pagar 5x mais no Maverick se você precisa de imagem ou de janela de 1M de tokens.
Perguntas frequentes
gpt-oss-20b ou Llama 4 Maverick para agente de código?
gpt-oss-20b. Ele marca 20,7 em coding e 3,1 em agentic, contra 16,3 e 1,2 do Maverick, e custa uma fração do preço. Para fluxo puramente textual, é a escolha racional.
Posso usar o gpt-oss-20b comercialmente?
Sim. Ele é distribuído sob Apache 2.0, uma das licenças abertas mais permissivas. O Llama 4 Maverick também é aberto, mas usa a licença comunitária da Meta, que tem restrições adicionais para usuários muito grandes.
Qual dos dois tem a maior janela de contexto?
Llama 4 Maverick, com 1.048.576 tokens (1M) contra 131.072 do gpt-oss-20b. Para documentos muito longos ou codebases inteiras em uma única janela, o Maverick é a única opção entre os dois.