NVIDIA Nemotron Nano 9B V2: 9B de reasoning a US$ 0,16/M de saída
Pesos abertos e cabe em GPU única — mas o índice de inteligência fica abaixo de modelos pequenos rivais da OpenAI
US$ 0,16 por milhão de tokens de saída é o que a NVIDIA está cobrando hoje pelo Nemotron Nano 9B V2, modelo de 9 bilhões de parâmetros com reasoning e pesos abertos — e é aqui que o release tropeça na própria narrativa.
O índice de inteligência Artificial Analysis de hoje põe o modelo em 8,68. Compare com dois abertos pequenos já em produção: o gpt-oss-120b (OpenAI) marca 24,13 a US$ 0,17 por milhão de saída; o gpt-oss-20b fica em 15,23 e sai a US$ 0,13 — mais barato e quase o dobro mais inteligente. Em custo-benefício no recorte pequeno-aberto, o Nemotron perde para os dois.
O que US$ 0,16 por milhão realmente compra
Em volume pesado — extração, classificação, sumarização em massa — esse preço vira economia real quando o modelo é capaz. Em raciocínio a conta se inverte: cada chamada custa mais e entrega menos inteligência por dólar do que a alternativa aberta. A NVIDIA chama o lançamento de "modelo unificado para reasoning e tarefas sem reasoning", ou seja, o modelo decide sozinho quando pensar passo a passo e quando responder direto. Capacidade útil, mas que não compensa a distância em IQ que o índice de hoje registra.
Para quem faz sentido
| Campo | Valor |
|---|---|
| Identificador | nvidia/nemotron-nano-9b-v2 |
| Criador | nvidia |
| Preço de entrada | US$ 0.040 / M tokens |
| Preço de saída | US$ 0.160 / M tokens |
| Janela de contexto | 131k |
| Modalidade | text->text |
| Índice de inteligência (AA) | 8.7 |
| Parâmetros | 9B (9B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 147 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
Você já roda hardware NVIDIA em casa ou datacenter — A100, H100, RTX 4090, workstation equivalente. Quer baixar os pesos, evitar custo de API por chamada e hospedar localmente. Com 9B parâmetros, o modelo cabe em GPU única de porte médio. Aí a equação muda: o que parecia caro na API vira gratuito depois do investimento inicial em hardware.
A versão "free" lançada em paralelo — mesma base, tarifa zerada em algumas rotas — serve como piso de teste. Dá para experimentar comportamento e a velocidade medida em 147 tokens por segundo antes de subir uma instância própria.
Para quem não muda nada
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Nemotron Nano 9B V2 (o novo) | 8.7 | 0.04 | 0.16 | 131k |
| o3 | 31.1 | 2 | 8 | 200k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
| gpt-oss-20b | 15.2 | 0.03 | 0.13 | 131k |
Se sua chamada vai pra OpenRouter, Anthropic, Azure ou Google — e reasoning é o que importa — Nemotron não entra na conta. O gpt-oss-20b segue sendo o custo-benefício mais agressivo no mesmo segmento. Para raciocínio pesado, o3 (IQ 31,10 a US$ 8/M) ainda vale o premium mesmo caro. E se você não tem GPU NVIDIA sobrando, hospedar esse modelo sai mais caro do que pagar a API do rival.
O tabuleiro
O catálogo de modelos ativos soma 222 hoje, espalhados por 38 criadores. O top 5 por inteligência segue dominado por OpenAI em três posições (o3, gpt-oss-120b e gpt-oss-20b) e Meta em duas (Llama 4 Maverick e Llama 4 Scout). A NVIDIA entra na sexta posição — respeitável para uma estreia de chipmaker no segmento pequeno, mas longe de ameaçar a liderança.
O que você faz com isso
Se a sua infraestrutura é NVIDIA e o orçamento em API virou gargalo, baixe o Nemotron Nano 9B V2 e hospede localmente. Se a chamada vai pra API mesmo, o gpt-oss-20b segue sendo a escolha racional no segmento pequeno-aberto. A NVIDIA entregou uma opção competitiva — não uma revolução.
Se sua infra é NVIDIA e a conta de API virou gargalo, baixe o Nemotron Nano 9B V2 e rode localmente; se a chamada é via API de pagamento por token, o gpt-oss-20b segue sendo a escolha racional no segmento pequeno.
Perguntas frequentes
Nemotron Nano 9B V2 serve para substituir o GPT-4?
Não. O índice Artificial Analysis de hoje coloca o modelo em 8,68, contra 31,10 do OpenAI o3. É um modelo pequeno de baixo custo, útil em volume onde o orçamento pesa mais que a qualidade do raciocínio.
Quanto custa rodar o Nemotron Nano 9B V2?
Pela API, US$ 0,04 por milhão de tokens de entrada e US$ 0,16 por milhão de saída. Pelo roteador free, tarifa zerada em algumas rotas. Em self-hosting em GPU NVIDIA, o custo vira o da operação do hardware.
Qual a diferença para o gpt-oss-20b da OpenAI?
O gpt-oss-20b entrega IQ de 15,23 contra 8,68 do Nemotron, e sai mais barato por milhão de saída (US$ 0,13). No recorte open-weights pequenos, o modelo da OpenAI lidera em custo-benefício hoje.