gpt-oss-20b custa 13 cents; Nemotron 49B pede 40 — vale o triplo?
Comparativo frente a frente entre dois modelos abertos lançados em 2025: o compacto da OpenAI e o novo da NVIDIA, derivado do Llama 3.3.
O que muda quando o token de saída custa três vezes mais
Você olha o preço, faz a conta e pensa: "o mais barato é o mais barato". Só que essa conta ignora o que cada modelo entrega. Hoje, 13 de outubro de 2025, o catálogo tem mais de 253 modelos listados — e entre os dois pesos-pesados abertos lançados no mesmo ano, a diferença de tarifa é grande: o gpt-oss-20b cobra US$ 0,13 por milhão de tokens de saída, enquanto o Llama 3.3 Nemotron Super 49B V1.5, da NVIDIA, cobra US$ 0,40. Três vezes mais caro por token gerado.
A pergunta que fica no ar: esse premium se justifica em qual cenário?
Tamanho não é tudo — e a MoE explica por quê
O gpt-oss-20b tem 21 bilhões de parâmetros totais, mas só 3,6 bilhões ativos por inferência, graças à arquitetura Mixture-of-Experts. É como ter um restaurante com 21 chefs no quadro, mas só 3,6 cozinhando seu prato de cada vez. O Nemotron Super 49B V1.5 é denso: 49 bilhões ativos, todos na jogada a cada token.
Na prática, isso tem duas consequências. A primeira é a velocidade: o gpt-oss-20b entrega 112,6 tokens por segundo contra 52,85 do Nemotron — mais que o dobro. A segunda é o custo de hospedagem: o modelo da OpenAI roda em hardware menor, o que se reflete no preço.
| Critério | gpt-oss-20b | Llama 3.3 Nemotron Super 49B |
|---|---|---|
| Índice de inteligência | 15.2 | 12.4 |
| Entrada US$/M | 0.03 | 0.4 |
| Saída US$/M | 0.13 | 0.4 |
| Contexto | 131k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 113 | 53 |
| Índice de código | 20.7 | — |
| Índice agêntico | 3.1 | — |
Inteligência, raciocínio e a régua que importa
No índice de inteligência da Artificial Analysis medido hoje, o gpt-oss-20b marca 15,225 e o Nemotron 49B fica em 12,401. Em codificação, a vantagem do gpt-oss-20b aparece com 20,697 — o Nemotron não publicou nota nessa categoria. Em agentic (uso de ferramentas, RAG, tool calling), o gpt-oss-20b marca 3,103 e o Nemotron também não publicou.
Onde o Nemotron recupera terreno é na "omnisciência" — um indicador que mede o quanto o modelo erra ao tentar responder sobre o que não sabe. O gpt-oss-20b marca -63,05 e o Nemotron -47,6. Quanto mais perto de zero, melhor: o modelo da NVIDIA alucina menos quando não tem a resposta. Para fluxos onde confiança na resposta importa mais do que volume de tokens, esse número pesa.
Para quem cada um vale — e para quem nenhum dos dois muda nada
O gpt-oss-20b ganha quando: você precisa de alto volume de saída, latência baixa e está rodando tarefas de raciocínio ou geração de código em pipelines com orçamento apertado. O preço de US$ 0,13 por milhão de tokens de saída e os 112 tokens/s fazem dele o canivete suíço para produção em escala.
O Nemotron Super 49B V1.5 ganha quando: o seu fluxo é agentic denso — RAG, tool calling, cadeias longas de raciocínio — e você prefere um modelo denso, com mais parâmetros ativos por inferência, mesmo pagando US$ 0,40 por milhão de tokens de saída. Lançado em 10 de outubro de 2025, ele é herdeiro direto do Llama 3.3 70B Instruct, pós-treinado especificamente para workflows agentic.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Para quem nenhum dos dois muda nada: se você já roda o o3 da OpenAI no topo do índice (31,096 de IQ, US$ 8 por milhão de tokens de saída) ou se o seu caso de uso é multimodal — os dois são text→text puros. Quem precisa de visão, áudio ou imagem sai desse comparativo sem pensar.
O que você faz com isso hoje
Se a sua conta de API está sangrando em tokens de saída, migre cargas de raciocínio e código para o gpt-oss-20b e meça a diferença na fatura antes de reclamar de preço de modelo. Se você está montando um agente que precisa de menos alucinação e mais estabilidade em tool calling, teste o Nemotron 49B — o custo por token é maior, mas a economia vem de menos chamadas de correção.
E se você está decidindo entre os dois agora: comece pelo gpt-oss-20b. O dinheiro que sobra no fim do mês conta uma história que benchmark nenhum conta.
Use gpt-oss-20b para volume e velocidade a US$ 0,13/M de saída; reserve o Nemotron 49B para fluxos agentic onde menos alucinação compensa o US$ 0,40/M.
Perguntas frequentes
Qual a diferença de preço entre gpt-oss-20b e Nemotron Super 49B?
O gpt-oss-20b cobra US$ 0,13 por milhão de tokens de saída e US$ 0,03 por milhão de entrada. O Nemotron Super 49B V1.5 cobra US$ 0,40 tanto para entrada quanto para saída — 3,08 vezes mais caro no token gerado.
Os dois modelos são open weights?
Sim. O gpt-oss-20b é distribuído sob Apache 2.0 e o Nemotron Super 49B V1.5 também tem pesos abertos, derivado do Llama 3.3 70B Instruct da Meta.
Qual é mais rápido?
O gpt-oss-20b entrega 112,6 tokens por segundo contra 52,85 do Nemotron Super 49B V1.5 — mais que o dobro de velocidade, reflexo da arquitetura MoE com só 3,6B de parâmetros ativos por inferência.