gpt-oss-20b custa 13 vezes menos que o Nemotron 70B e ainda é mais inteligente
Modelo aberto da OpenAI sai por US$ 0,13 por milhão de tokens de saída e deixa o Nemotron da NVIDIA para trás em preço, IQ e velocidade em quase todos os eixos.
O NVIDIA Llama 3.1 Nemotron 70B era, até pouco tempo atrás, uma das respostas mais sólidas para quem queria rodar um modelo de 70 bilhões de parâmetros com pesos abertos. Lançado em outubro de 2024, virou referência em instruções e raciocínio geral. Menos de um ano depois, a OpenAI colocou no mercado o gpt-oss-20b — 21 bilhões de parâmetros, arquitetura MoE, e preços que fazem o Nemotron parecer um produto de outra era.
A conta que ninguém quer receber
Olha o preço de saída, em dólar por milhão de tokens:
- gpt-oss-20b: US$ 0,13
- Nemotron 70B: US$ 1,20
São 9,2 vezes mais barato só na saída. Se você somar entrada e cache, a razão blended fica ainda mais brutal: US$ 0,0925 contra US$ 1,20. Cada chamada que custava US$ 1 agora sai por cerca de US$ 0,08. Para uma startup queimando 500 milhões de tokens por mês, isso é a diferença entre uma fatura de US$ 600 e uma de US$ 46.
E a NVIDIA não publicou preço de cache, o que por si só já é um sinal de como a tabela mudou.
Inteligência não se mede só em parâmetro
O detalhe que incomoda quem comprou GPU para rodar Nemotron é o seguinte: o gpt-oss-20b não é só mais barato, é mais inteligente pelo índice da Artificial Analysis. O modelo da OpenAI marca IQ 15,225, contra 7,425 do Nemotron — mais que o dobro. Em coding, a diferença é ainda maior: 20,7 contra um valor que a NVIDIA simplesmente não publicou.
Isso desfaz a objeção clássica de "modelo pequeno é mais barato porque é burro". O gpt-oss-20b é MoE, com 3,6 bilhões de parâmetros ativos por passagem. Os outros 17,4 bilhões ficam em standby até o roteador decidir quais ativar para o token que você está pedindo agora.
Velocidade, contexto e o detalhe do conhecimento
O gpt-oss-20b também roda mais rápido: 112,6 tokens por segundo, contra 44,6 do Nemotron — quase 2,5 vezes mais. A janela de contexto é igual nos dois: 131.072 tokens. Empate.
Onde o Nemotron ainda tem um argumento: o índice de omnisciência, que mede o quanto o modelo erra fatos verificáveis. O gpt-oss-20b marca -63,05; o Nemotron, -40,83. Quem precisa de resposta factual sem alucinação em tarefas curtas ainda pode preferir o modelo da NVIDIA.
E tem mais um porém: o Nemotron não é modelo de raciocínio. Não foi treinado para "pensar em voz alta" antes de responder. O gpt-oss-20b foi. Para prompts simples, isso vira latência extra sem ganho de qualidade. Para problemas que exigem cadeia de raciocínio, vira vantagem grande.
| Critério | gpt-oss-20b | Llama 3.1 Nemotron 70B Instr |
|---|---|---|
| Índice de inteligência | 15.2 | 7.4 |
| Entrada US$/M | 0.03 | 1.2 |
| Saída US$/M | 0.13 | 1.2 |
| Contexto | 131k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 113 | 45 |
| Índice de código | 20.7 | — |
| Índice agêntico | 3.1 | — |
Quando cada um ganha
gpt-oss-20b ganha quando você tem volume alto, precisa de raciocínio encadeado, quer custo baixo por chamada e roda tarefas onde velocidade importa — agentes, tool-use, geração em tempo real. O IQ mais alto e o preço blended fazem dele o padrão para a maioria dos workloads abertos hoje.
Nemotron 70B ainda ganha quando você precisa de respostas factualmente confiáveis em domínios estreitos, sem pagar pela camada de raciocínio extra, e o volume é baixo o suficiente para que US$ 1,20 por milhão não doa. É um modelo simples e direto, sem a sofisticação do chain-of-thought nativo do gpt-oss-20b.
A NVIDIA também não publicou números de coding e agentic no catálogo, então não dá para comparar apples-to-apples nesses dois eixos — o que, para um modelo com quase um ano, já é um sinal.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Se você está montando um stack novo com pesos abertos, não tem razão para começar pelo Nemotron 70B. O gpt-oss-20b custa menos, pensa melhor, roda mais rápido e está no top 4 do mercado inteiro. Reserve o Nemotron para os cantos onde a omnisciência dele ainda compensa — e mesmo assim, teste o gpt-oss-20b com RAG por cima para cobrir a diferença.
Para qualquer stack novo com pesos abertos, comece pelo gpt-oss-20b; só mantenha o Nemotron 70B se a factualidade absoluta for inegociável e o volume justificar a conta de US$ 1,20 por milhão de tokens.
Perguntas frequentes
gpt-oss-20b ou Nemotron 70B: qual é mais barato?
O gpt-oss-20b é drasticamente mais barato. No preço blended, custa cerca de US$ 0,09 por milhão de tokens contra US$ 1,20 do Nemotron — uma diferença de aproximadamente 13 vezes. A NVIDIA nem publicou preço de cache, enquanto a OpenAI cobra US$ 0,03.
O gpt-oss-20b substitui o Nemotron 70B em produção?
Na maioria dos casos, sim. O gpt-oss-20b tem mais que o dobro do IQ (15,2 contra 7,4), é quase 2,5 vezes mais rápido e custa uma fração. O Nemotron ainda vence em factualidade pura, com índice de omnisciência melhor (-40,8 contra -63,0), então só vale mantê-lo em pipelines onde alucinação é inaceitável.
Preciso de GPU potente para rodar o gpt-oss-20b localmente?
Por ser MoE com apenas 3,6 bilhões de parâmetros ativos por passagem, o gpt-oss-20b é bem mais leve na inferência do que os 70B completos do Nemotron sugerem. Os 17,4 bilhões restantes ficam em standby e só são acionados quando o roteador ativa os experts relevantes para cada token.