Nemotron Nano 9B V2 custa US$ 0,16 por milhão de saída e entrega raciocínio de 9 bilhões de parâmetros
Modelo da NVIDIA chega com pesos abertos, contexto de 131k e preço de commodity — mas o índice de inteligência lembra o de um carro popular em pista de Fórmula 1.
O que a NVIDIA botou na mesa hoje
Você está olhando para um lançamento que tem cara de commodity: Nemotron Nano 9B V2 cobra US$ 0,04 por milhão de tokens de entrada e US$ 0,16 por milhão de saída, em modelo de 9 bilhões de parâmetros com pesos abertos e janela de 131.072 tokens. É o tipo de preço que aparece quando o objetivo não é ganhar a corrida de inteligência, mas ocupar prateleira.
A conta fica ainda mais simples quando você junta os dois lados: o blended — média ponderada típica de uso — fica em US$ 0,07 por milhão. Para efeitos de comparação, o Llama 4 Scout, que é o parente mais próximo em proposta (modelo pequeno, multimodal, da Meta), sai por US$ 0,30 de blended. O Nemotron custa menos de um quarto.
Onde ele realmente entrega
O ponto que diferencia o Nano 9B V2 da maioria dos pequenos é que ele foi treinado do zero como modelo unificado de raciocínio e não-raciocínio. Em vez de você escolher entre uma versão "chat" e uma versão "thinking", a NVIDIA entrega um único arquivo que alterna entre os dois modos. Para quem roda localmente — e o público-alvo aqui é exatamente esse, gente que faz self-host — isso significa um modelo só no disco, em vez de dois.
A velocidade reportada é de 147,18 tokens por segundo, número respeitável para 9B em inferência. A janela de 131k casa com o que o Llama 4 Scout entrega (na verdade, o Scout vai a 1,3 milhão, mas isso é outro papo).
| Campo | Valor |
|---|---|
| Identificador | nvidia/nemotron-nano-9b-v2 |
| Criador | nvidia |
| Preço de entrada | US$ 0.040 / M tokens |
| Preço de saída | US$ 0.160 / M tokens |
| Janela de contexto | 131k |
| Modalidade | text->text |
| Índice de inteligência (AA) | 8.7 |
| Parâmetros | 9B (9B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 147 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
E a inteligência?
Aqui é onde o discurso de marketing encontra a realidade da fatura. O índice de inteligência Artificial Analysis do Nemotron Nano 9B V2 está em 8,677. Para situar: o o3 da OpenAI lidera o catálogo com 31,096; o gpt-oss-120b, também da OpenAI, marca 24,126; o Llama 4 Maverick, 14,477; o Llama 4 Scout, 10,256. O Nano 9B V2 fica abaixo do Scout e bem distante do Maverick.
Traduzindo: o Nano 9B V2 não é o carro que vai ganhar a corrida. É o carro popular que faz o trajeto com economia. Pega a referência do Nova Micro 1.0 da Amazon, que marca 4,416 de índice e cobra US$ 0,14 de saída: o Nemotron entrega quase o dobro de inteligência por um acréscimo de US$ 0,02 por milhão. É nesse intervalo — entre o chão do mercado e os modelos intermediários — que ele compete.
Contra quem ele compete de verdade
Os pares naturais são três, e cada um conta uma história diferente.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Nemotron Nano 9B V2 (o novo) | 8.7 | 0.04 | 0.16 | 131k |
| Nova Micro 1.0 | 4.4 | 0.035 | 0.14 | 128k |
| Llama 4 Scout | 10.3 | 0.1 | 0.3 | 1.31M |
| Llama 3.3 70B Instruct | 9.3 | 0.1 | 0.32 | 131k |
| Llama 3.2 11B Vision Instruc | 3.0 | 0.345 | 0.345 | 131k |
- Amazon Nova Micro 1.0 — também pequeno, também text-only, também baratinho (US$ 0,14 de saída). Perde em índice de inteligência (4,416 contra 8,677) e em janela de raciocínio — não tem modo thinking. Vantagem do Nova: 261 tokens/s de velocidade, quase o dobro do Nemotron. Se o seu gargalo é latência pura em tarefas simples, o Nova ainda vence.
- Llama 4 Scout — multimodal (texto + imagem), 17B ativos de 109B totais, contexto de 1,3 milhão. Custa quase o dobro (US$ 0,30 de saída). É claramente superior em capacidade bruta, mas você paga por isso. Para quem não precisa de visão e não precisa de 1M de contexto, o Nemotron entrega o suficiente por um quarto do preço.
- Llama 3.2 11B Vision Instruct — multimodal antigo, 11B, US$ 0,345 de saída (entrada e saída iguais). É o pior cenário: mais caro, mais lento (18 tokens/s) e índice de inteligência de 2,952. Se você ainda usa esse, o Nemotron substitui com folga.
Para quem vale — e para quem não muda nada
Vale a pena considerar se você roda modelos localmente, precisa de um arquivo único que sirva tanto para chat quanto para raciocínio, e está disposto a aceitar índice de inteligência na faixa dos 8 pontos. Casos clássicos: prototipagem rápida, classificação de texto em volume, agentes simples, sumarização, extração estruturada. O preço torna viável processar lotes grandes sem vender um rim.
Não muda nada se você precisa de raciocínio pesado (o3, gpt-oss-120b), multimodal real (Scout, Maverick) ou simplesmente não roda localmente — nesse caso, o catálogo de APIs fechadas entrega mais por menos dor de cabeça.
O tabuleiro em 5 de setembro
O catálogo tem mais de 222 modelos ativos de 38 criadores. Nos últimos 30 dias, 22 modelos foram lançados. O Nano 9B V2 entra nesse fluxo como peça de基础设施 — infraestrutura — para quem quer pesos abertos baratos com modo de raciocínio. Não vai dominar rankings, mas ocupa um nicho que até agora era da Meta com pesos abertos e da Amazon com API barata.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
| Llama 4 Scout | 10.3 | 0.3 |
A implicação prática é direta: se você está montando um stack local com GPU modesta e precisa decidir entre rodar Scout, Nova Micro via API ou Nemotron Nano 9B V2 local, faça a conta do seu volume mensal. Acima de poucos milhões de tokens de saída por mês, o Nemotron local paga o setup em semanas — e ainda deixa o modelo no seu controle.
Para workloads locais de baixo custo com raciocínio básico, o Nemotron Nano 9B V2 é o melhor custo-benefício aberto da faixa dos 9B; para qualquer coisa acima de índice 10 de inteligência, continue olhando Scout, Maverick ou os modelos da OpenAI.
Perguntas frequentes
O que é o Nemotron Nano 9B V2?
É um LLM de 9 bilhões de parâmetros lançado pela NVIDIA em 5 de setembro de 2025, treinado do zero como modelo unificado de raciocínio e não-raciocínio, com pesos abertos e contexto de 131.072 tokens.
Quanto custa usar o Nemotron Nano 9B V2 via API?
US$ 0,04 por milhão de tokens de entrada e US$ 0,16 por milhão de tokens de saída, com custo blended de US$ 0,07 por milhão. O catálogo não publicou preço de cache.
Nemotron Nano 9B V2 ou Llama 4 Scout?
Scout entrega índice de inteligência maior (10,256 contra 8,677), multimodal nativo e contexto de 1,3M, mas custa quase o dobro. Para uso local sem visão e sem necessidade de contexto gigante, o Nemotron é mais econômico.