FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Nemotron Nano 9B V2 perde em IQ e em preço para o gpt-oss-20b

Lançado há 5 dias pela NVIDIA, o modelo de 9B cobra US$ 0,16 por milhão de tokens de saída — e ainda fica atrás do open-weight da OpenAI no índice de inteligência.

Redação FalaVIP IA 2 min de leitura
US$ 0,13preço por milhão de tokens de saída do gpt-oss-20b
15,225índice de inteligência do gpt-oss-20b (Artificial Analysis)
147,18tokens por segundo do Nemotron Nano 9B V2

A NVIDIA soltou o Nemotron Nano 9B V2 há cinco dias. A OpenAI publicou o gpt-oss-20b em 5 de agosto. Em catálogo, o lançamento recente perde em inteligência E em preço de saída — e a diferença não é marginal.

Inteligência: gpt-oss-20b abre quase 75% de vantagem

No índice Artificial Analysis, o gpt-oss-20b marca 15,225 contra 8,677 do Nemotron Nano 9B V2. Na prática, isso quer dizer que o modelo da OpenAI entrega respostas mais densas em raciocínio no mesmo tipo de tarefa. Para cadeia lógica longa — análise de contrato, planejamento multi-etapa, debug de código — a folga pesa.

Índice de inteligência (Artificial Analysis)
gpt-oss-20b15,2Nemotron Nano 9B V28,7índice
Fonte: Artificial Analysis

Preço: o "novo" cobra mais caro na saída

Aqui está a surpresa que a planilha revela rápido. O custo por milhão de tokens de saída do gpt-oss-20b é US$ 0,13; o do Nemotron Nano 9B V2 é US$ 0,16 — são 23% a mais por token gerado. No input, a diferença é menor (US$ 0,03 contra US$ 0,04), mas é o output que come a fatura quando o modelo raciocina em voz alta. O cache do gpt-oss-20b está tabelado em US$ 0,03 por milhão; o do Nemotron não foi publicado pela NVIDIA — e isso não é detalhe: se você repete prompts longos, falta o número para comparar de verdade.

Preço de saída (US$ por milhão de tokens)
gpt-oss-20b0,13Nemotron Nano 9B V20,16US$/M
Fonte: OpenRouter

Velocidade e knowledge cutoff: onde a NVIDIA vira o jogo

O Nemotron roda a 147,18 tokens por segundo contra 112,6 do gpt-oss-20b — cerca de 30% mais rápido. Em workloads com muito streaming ou UX sensível a latência, isso aparece. E o knowledge cutoff do Nemotron é março de 2025; o do gpt-oss-20b é junho de 2024. Se você está construindo um assistente que precisa saber de eventos do último ano sem RAG, o Nemotron entrega nove meses a mais de mundo.

gpt-oss-20b × Nemotron Nano 9B V2
Critériogpt-oss-20bNemotron Nano 9B V2
Índice de inteligência15.28.7
Entrada US$/M0.030.04
Saída US$/M0.130.16
Contexto131k131k
Pesos abertossimsim
Velocidade (tok/s)113147
Índice de código20.7
Índice agêntico3.1

Arquitetura: dois jeitos de ser pequeno

Ambos têm pesos abertos e ambos rodam em GPU de consumo. Mas a engenharia interna diverge. O gpt-oss-20b é Mixture-of-Experts com 21 bilhões totais e 3,6 bilhões ativos por passada — gasta pouca memória por inferência. O Nemotron Nano 9B V2 é denso, 9 bilhões ativos em cada forward — mais simples de servir, mais previsível em latência. Para deploy em hardware apertado, o gpt-oss-20b geralmente aperta mais; para throughput previsível, o denso da NVIDIA entrega.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Llama 4 Scout10.30.3
Entre os 224 modelos disponíveis no catálogo nesta data.

Veredito: para quem cada um ganha

O gpt-oss-20b ganha quando a tarefa exige raciocínio — coding (20,697 no benchmark, contra dado não publicado pela NVIDIA para o Nemotron), agente, classificação que precisa pensar. Você paga menos por token de saída e ainda leva mais qualidade. É a escolha certa para pipeline batch, agente de código, automação de back-office.

O Nemotron Nano 9B V2 ganha quando velocidade e atualidade do mundo importam mais que profundidade — chatbot de alta cadência, sumarização de notícias recentes, qualquer workload com latência crítica e RAG bem alimentado. Não é pior por tabela; foi desenhado para outro perfil de tráfego.

A implicação prática, direta: se o seu gargalo é qualidade por dólar de output, gpt-oss-20b. Se o gargalo é tempo de resposta e o seu prompt puxa dados de 2025, Nemotron Nano 9B V2.

Em uma frase

Para raciocínio e coding abaixo de US$ 0,20/M de saída, o gpt-oss-20b da OpenAI segue imbatível; escolha o Nemotron Nano 9B V2 só quando latência e atualidade do mundo superam profundidade de raciocínio.

Perguntas frequentes

gpt-oss-20b ou Nemotron Nano 9B V2 para agente de código?

gpt-oss-20b. Ele pontua 20,697 no benchmark de coding — a NVIDIA não publicou o número equivalente para o Nemotron —, custa menos por token de saída (US$ 0,13 vs US$ 0,16) e tem IQ 75% mais alto. O Nemotron só vence em velocidade pura e knowledge cutoff mais recente.

O Nemotron Nano 9B V2 é realmente mais barato que o gpt-oss-20b?

Depende da métrica. O preço blended do Nemotron é US$ 0,07/M contra US$ 0,0925/M do gpt-oss-20b, então numa mistura típica de input e output ele sai mais barato no agregado. Mas no preço de saída puro, o gpt-oss-20b é cerca de 19% mais barato (US$ 0,13 vs US$ 0,16) — e é o output que pesa em tarefas de raciocínio.

Os dois modelos têm pesos abertos?

Sim. O gpt-oss-20b foi liberado pela OpenAI sob Apache 2.0; o Nemotron Nano 9B V2 também tem pesos abertos, publicados pela NVIDIA. Você pode fazer self-host dos dois.

Leia também