FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

NVIDIA Nemotron Nano 9B V2: 9B de reasoning a US$ 0,16/M de saída

Pesos abertos e cabe em GPU única — mas o índice de inteligência fica abaixo de modelos pequenos rivais da OpenAI

Redação FalaVIP IA 2 min de leitura
US$ 0,16por milhão de tokens de saída
8,68Índice de inteligência Artificial Analysis
9 bilhõesde parâmetros, com pesos abertos

US$ 0,16 por milhão de tokens de saída é o que a NVIDIA está cobrando hoje pelo Nemotron Nano 9B V2, modelo de 9 bilhões de parâmetros com reasoning e pesos abertos — e é aqui que o release tropeça na própria narrativa.

Índice de inteligência (Artificial Analysis)
Nemotron Nano 9B V28,7o331,1gpt-oss-120b24,1gpt-oss-20b15,2índice
Fonte: Artificial Analysis

O índice de inteligência Artificial Analysis de hoje põe o modelo em 8,68. Compare com dois abertos pequenos já em produção: o gpt-oss-120b (OpenAI) marca 24,13 a US$ 0,17 por milhão de saída; o gpt-oss-20b fica em 15,23 e sai a US$ 0,13 — mais barato e quase o dobro mais inteligente. Em custo-benefício no recorte pequeno-aberto, o Nemotron perde para os dois.

O que US$ 0,16 por milhão realmente compra

Inteligência × preço de saída
Nemotron Nano 9B V2o3gpt-oss-120bgpt-oss-20bUS$ por milhão (saída, escala log)índice de inteligência

Em volume pesado — extração, classificação, sumarização em massa — esse preço vira economia real quando o modelo é capaz. Em raciocínio a conta se inverte: cada chamada custa mais e entrega menos inteligência por dólar do que a alternativa aberta. A NVIDIA chama o lançamento de "modelo unificado para reasoning e tarefas sem reasoning", ou seja, o modelo decide sozinho quando pensar passo a passo e quando responder direto. Capacidade útil, mas que não compensa a distância em IQ que o índice de hoje registra.

Para quem faz sentido

Ficha técnica — Nemotron Nano 9B V2
CampoValor
Identificadornvidia/nemotron-nano-9b-v2
Criadornvidia
Preço de entradaUS$ 0.040 / M tokens
Preço de saídaUS$ 0.160 / M tokens
Janela de contexto131k
Modalidadetext->text
Índice de inteligência (AA)8.7
Parâmetros9B (9B ativos por token)
Pesosabertos
Velocidade de saída147 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

Você já roda hardware NVIDIA em casa ou datacenter — A100, H100, RTX 4090, workstation equivalente. Quer baixar os pesos, evitar custo de API por chamada e hospedar localmente. Com 9B parâmetros, o modelo cabe em GPU única de porte médio. Aí a equação muda: o que parecia caro na API vira gratuito depois do investimento inicial em hardware.

A versão "free" lançada em paralelo — mesma base, tarifa zerada em algumas rotas — serve como piso de teste. Dá para experimentar comportamento e a velocidade medida em 147 tokens por segundo antes de subir uma instância própria.

Para quem não muda nada

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Nemotron Nano 9B V2 (o novo)8.70.040.16131k
o331.128200k
gpt-oss-120b24.10.0370.17131k
gpt-oss-20b15.20.030.13131k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Se sua chamada vai pra OpenRouter, Anthropic, Azure ou Google — e reasoning é o que importa — Nemotron não entra na conta. O gpt-oss-20b segue sendo o custo-benefício mais agressivo no mesmo segmento. Para raciocínio pesado, o3 (IQ 31,10 a US$ 8/M) ainda vale o premium mesmo caro. E se você não tem GPU NVIDIA sobrando, hospedar esse modelo sai mais caro do que pagar a API do rival.

O tabuleiro

O catálogo de modelos ativos soma 222 hoje, espalhados por 38 criadores. O top 5 por inteligência segue dominado por OpenAI em três posições (o3, gpt-oss-120b e gpt-oss-20b) e Meta em duas (Llama 4 Maverick e Llama 4 Scout). A NVIDIA entra na sexta posição — respeitável para uma estreia de chipmaker no segmento pequeno, mas longe de ameaçar a liderança.

O que você faz com isso

Se a sua infraestrutura é NVIDIA e o orçamento em API virou gargalo, baixe o Nemotron Nano 9B V2 e hospede localmente. Se a chamada vai pra API mesmo, o gpt-oss-20b segue sendo a escolha racional no segmento pequeno-aberto. A NVIDIA entregou uma opção competitiva — não uma revolução.

Em uma frase

Se sua infra é NVIDIA e a conta de API virou gargalo, baixe o Nemotron Nano 9B V2 e rode localmente; se a chamada é via API de pagamento por token, o gpt-oss-20b segue sendo a escolha racional no segmento pequeno.

Perguntas frequentes

Nemotron Nano 9B V2 serve para substituir o GPT-4?

Não. O índice Artificial Analysis de hoje coloca o modelo em 8,68, contra 31,10 do OpenAI o3. É um modelo pequeno de baixo custo, útil em volume onde o orçamento pesa mais que a qualidade do raciocínio.

Quanto custa rodar o Nemotron Nano 9B V2?

Pela API, US$ 0,04 por milhão de tokens de entrada e US$ 0,16 por milhão de saída. Pelo roteador free, tarifa zerada em algumas rotas. Em self-hosting em GPU NVIDIA, o custo vira o da operação do hardware.

Qual a diferença para o gpt-oss-20b da OpenAI?

O gpt-oss-20b entrega IQ de 15,23 contra 8,68 do Nemotron, e sai mais barato por milhão de saída (US$ 0,13). No recorte open-weights pequenos, o modelo da OpenAI lidera em custo-benefício hoje.

Leia também