Nemotron Nano 9B V2 perde em IQ e em preço para o gpt-oss-20b
Lançado há 5 dias pela NVIDIA, o modelo de 9B cobra US$ 0,16 por milhão de tokens de saída — e ainda fica atrás do open-weight da OpenAI no índice de inteligência.
A NVIDIA soltou o Nemotron Nano 9B V2 há cinco dias. A OpenAI publicou o gpt-oss-20b em 5 de agosto. Em catálogo, o lançamento recente perde em inteligência E em preço de saída — e a diferença não é marginal.
Inteligência: gpt-oss-20b abre quase 75% de vantagem
No índice Artificial Analysis, o gpt-oss-20b marca 15,225 contra 8,677 do Nemotron Nano 9B V2. Na prática, isso quer dizer que o modelo da OpenAI entrega respostas mais densas em raciocínio no mesmo tipo de tarefa. Para cadeia lógica longa — análise de contrato, planejamento multi-etapa, debug de código — a folga pesa.
Preço: o "novo" cobra mais caro na saída
Aqui está a surpresa que a planilha revela rápido. O custo por milhão de tokens de saída do gpt-oss-20b é US$ 0,13; o do Nemotron Nano 9B V2 é US$ 0,16 — são 23% a mais por token gerado. No input, a diferença é menor (US$ 0,03 contra US$ 0,04), mas é o output que come a fatura quando o modelo raciocina em voz alta. O cache do gpt-oss-20b está tabelado em US$ 0,03 por milhão; o do Nemotron não foi publicado pela NVIDIA — e isso não é detalhe: se você repete prompts longos, falta o número para comparar de verdade.
Velocidade e knowledge cutoff: onde a NVIDIA vira o jogo
O Nemotron roda a 147,18 tokens por segundo contra 112,6 do gpt-oss-20b — cerca de 30% mais rápido. Em workloads com muito streaming ou UX sensível a latência, isso aparece. E o knowledge cutoff do Nemotron é março de 2025; o do gpt-oss-20b é junho de 2024. Se você está construindo um assistente que precisa saber de eventos do último ano sem RAG, o Nemotron entrega nove meses a mais de mundo.
| Critério | gpt-oss-20b | Nemotron Nano 9B V2 |
|---|---|---|
| Índice de inteligência | 15.2 | 8.7 |
| Entrada US$/M | 0.03 | 0.04 |
| Saída US$/M | 0.13 | 0.16 |
| Contexto | 131k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 113 | 147 |
| Índice de código | 20.7 | — |
| Índice agêntico | 3.1 | — |
Arquitetura: dois jeitos de ser pequeno
Ambos têm pesos abertos e ambos rodam em GPU de consumo. Mas a engenharia interna diverge. O gpt-oss-20b é Mixture-of-Experts com 21 bilhões totais e 3,6 bilhões ativos por passada — gasta pouca memória por inferência. O Nemotron Nano 9B V2 é denso, 9 bilhões ativos em cada forward — mais simples de servir, mais previsível em latência. Para deploy em hardware apertado, o gpt-oss-20b geralmente aperta mais; para throughput previsível, o denso da NVIDIA entrega.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
| Llama 4 Scout | 10.3 | 0.3 |
Veredito: para quem cada um ganha
O gpt-oss-20b ganha quando a tarefa exige raciocínio — coding (20,697 no benchmark, contra dado não publicado pela NVIDIA para o Nemotron), agente, classificação que precisa pensar. Você paga menos por token de saída e ainda leva mais qualidade. É a escolha certa para pipeline batch, agente de código, automação de back-office.
O Nemotron Nano 9B V2 ganha quando velocidade e atualidade do mundo importam mais que profundidade — chatbot de alta cadência, sumarização de notícias recentes, qualquer workload com latência crítica e RAG bem alimentado. Não é pior por tabela; foi desenhado para outro perfil de tráfego.
A implicação prática, direta: se o seu gargalo é qualidade por dólar de output, gpt-oss-20b. Se o gargalo é tempo de resposta e o seu prompt puxa dados de 2025, Nemotron Nano 9B V2.
Para raciocínio e coding abaixo de US$ 0,20/M de saída, o gpt-oss-20b da OpenAI segue imbatível; escolha o Nemotron Nano 9B V2 só quando latência e atualidade do mundo superam profundidade de raciocínio.
Perguntas frequentes
gpt-oss-20b ou Nemotron Nano 9B V2 para agente de código?
gpt-oss-20b. Ele pontua 20,697 no benchmark de coding — a NVIDIA não publicou o número equivalente para o Nemotron —, custa menos por token de saída (US$ 0,13 vs US$ 0,16) e tem IQ 75% mais alto. O Nemotron só vence em velocidade pura e knowledge cutoff mais recente.
O Nemotron Nano 9B V2 é realmente mais barato que o gpt-oss-20b?
Depende da métrica. O preço blended do Nemotron é US$ 0,07/M contra US$ 0,0925/M do gpt-oss-20b, então numa mistura típica de input e output ele sai mais barato no agregado. Mas no preço de saída puro, o gpt-oss-20b é cerca de 19% mais barato (US$ 0,13 vs US$ 0,16) — e é o output que pesa em tarefas de raciocínio.
Os dois modelos têm pesos abertos?
Sim. O gpt-oss-20b foi liberado pela OpenAI sob Apache 2.0; o Nemotron Nano 9B V2 também tem pesos abertos, publicados pela NVIDIA. Você pode fazer self-host dos dois.