FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Nemotron Nano 9B V2 custa US$ 0,16 por milhão de saída e entrega raciocínio de 9 bilhões de parâmetros

Modelo da NVIDIA chega com pesos abertos, contexto de 131k e preço de commodity — mas o índice de inteligência lembra o de um carro popular em pista de Fórmula 1.

Redação FalaVIP IA 4 min de leitura
US$ 0,16por milhão de tokens de saída
9 bilhõesde parâmetros ativos
131.072tokens de contexto

O que a NVIDIA botou na mesa hoje

Você está olhando para um lançamento que tem cara de commodity: Nemotron Nano 9B V2 cobra US$ 0,04 por milhão de tokens de entrada e US$ 0,16 por milhão de saída, em modelo de 9 bilhões de parâmetros com pesos abertos e janela de 131.072 tokens. É o tipo de preço que aparece quando o objetivo não é ganhar a corrida de inteligência, mas ocupar prateleira.

A conta fica ainda mais simples quando você junta os dois lados: o blended — média ponderada típica de uso — fica em US$ 0,07 por milhão. Para efeitos de comparação, o Llama 4 Scout, que é o parente mais próximo em proposta (modelo pequeno, multimodal, da Meta), sai por US$ 0,30 de blended. O Nemotron custa menos de um quarto.

Preço de saída (US$ por milhão de tokens)
Nemotron Nano 9B V20,16Nova Micro 1.00,14Llama 4 Scout0,3Llama 3.3 70B Instruct0,32Llama 3.2 11B Vision Instruc0,345US$/M
Fonte: OpenRouter

Onde ele realmente entrega

O ponto que diferencia o Nano 9B V2 da maioria dos pequenos é que ele foi treinado do zero como modelo unificado de raciocínio e não-raciocínio. Em vez de você escolher entre uma versão "chat" e uma versão "thinking", a NVIDIA entrega um único arquivo que alterna entre os dois modos. Para quem roda localmente — e o público-alvo aqui é exatamente esse, gente que faz self-host — isso significa um modelo só no disco, em vez de dois.

A velocidade reportada é de 147,18 tokens por segundo, número respeitável para 9B em inferência. A janela de 131k casa com o que o Llama 4 Scout entrega (na verdade, o Scout vai a 1,3 milhão, mas isso é outro papo).

Ficha técnica — Nemotron Nano 9B V2
CampoValor
Identificadornvidia/nemotron-nano-9b-v2
Criadornvidia
Preço de entradaUS$ 0.040 / M tokens
Preço de saídaUS$ 0.160 / M tokens
Janela de contexto131k
Modalidadetext->text
Índice de inteligência (AA)8.7
Parâmetros9B (9B ativos por token)
Pesosabertos
Velocidade de saída147 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

E a inteligência?

Aqui é onde o discurso de marketing encontra a realidade da fatura. O índice de inteligência Artificial Analysis do Nemotron Nano 9B V2 está em 8,677. Para situar: o o3 da OpenAI lidera o catálogo com 31,096; o gpt-oss-120b, também da OpenAI, marca 24,126; o Llama 4 Maverick, 14,477; o Llama 4 Scout, 10,256. O Nano 9B V2 fica abaixo do Scout e bem distante do Maverick.

Índice de inteligência (Artificial Analysis)
Nemotron Nano 9B V28,7Nova Micro 1.04,4Llama 4 Scout10,3Llama 3.3 70B Instruct9,3Llama 3.2 11B Vision Instruc3índice
Fonte: Artificial Analysis

Traduzindo: o Nano 9B V2 não é o carro que vai ganhar a corrida. É o carro popular que faz o trajeto com economia. Pega a referência do Nova Micro 1.0 da Amazon, que marca 4,416 de índice e cobra US$ 0,14 de saída: o Nemotron entrega quase o dobro de inteligência por um acréscimo de US$ 0,02 por milhão. É nesse intervalo — entre o chão do mercado e os modelos intermediários — que ele compete.

Inteligência × preço de saída
Nemotron Nano 9B V2Nova Micro 1.0Llama 4 ScoutLlama 3.3 70B InstructLlama 3.2 11B Vision InstrucUS$ por milhão (saída, escala log)índice de inteligência

Contra quem ele compete de verdade

Os pares naturais são três, e cada um conta uma história diferente.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Nemotron Nano 9B V2 (o novo)8.70.040.16131k
Nova Micro 1.04.40.0350.14128k
Llama 4 Scout10.30.10.31.31M
Llama 3.3 70B Instruct9.30.10.32131k
Llama 3.2 11B Vision Instruc3.00.3450.345131k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.
  • Amazon Nova Micro 1.0 — também pequeno, também text-only, também baratinho (US$ 0,14 de saída). Perde em índice de inteligência (4,416 contra 8,677) e em janela de raciocínio — não tem modo thinking. Vantagem do Nova: 261 tokens/s de velocidade, quase o dobro do Nemotron. Se o seu gargalo é latência pura em tarefas simples, o Nova ainda vence.
  • Llama 4 Scout — multimodal (texto + imagem), 17B ativos de 109B totais, contexto de 1,3 milhão. Custa quase o dobro (US$ 0,30 de saída). É claramente superior em capacidade bruta, mas você paga por isso. Para quem não precisa de visão e não precisa de 1M de contexto, o Nemotron entrega o suficiente por um quarto do preço.
  • Llama 3.2 11B Vision Instruct — multimodal antigo, 11B, US$ 0,345 de saída (entrada e saída iguais). É o pior cenário: mais caro, mais lento (18 tokens/s) e índice de inteligência de 2,952. Se você ainda usa esse, o Nemotron substitui com folga.

Para quem vale — e para quem não muda nada

Vale a pena considerar se você roda modelos localmente, precisa de um arquivo único que sirva tanto para chat quanto para raciocínio, e está disposto a aceitar índice de inteligência na faixa dos 8 pontos. Casos clássicos: prototipagem rápida, classificação de texto em volume, agentes simples, sumarização, extração estruturada. O preço torna viável processar lotes grandes sem vender um rim.

Não muda nada se você precisa de raciocínio pesado (o3, gpt-oss-120b), multimodal real (Scout, Maverick) ou simplesmente não roda localmente — nesse caso, o catálogo de APIs fechadas entrega mais por menos dor de cabeça.

O tabuleiro em 5 de setembro

O catálogo tem mais de 222 modelos ativos de 38 criadores. Nos últimos 30 dias, 22 modelos foram lançados. O Nano 9B V2 entra nesse fluxo como peça de基础设施 — infraestrutura — para quem quer pesos abertos baratos com modo de raciocínio. Não vai dominar rankings, mas ocupa um nicho que até agora era da Meta com pesos abertos e da Amazon com API barata.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Llama 4 Scout10.30.3
Entre os 222 modelos disponíveis no catálogo nesta data.

A implicação prática é direta: se você está montando um stack local com GPU modesta e precisa decidir entre rodar Scout, Nova Micro via API ou Nemotron Nano 9B V2 local, faça a conta do seu volume mensal. Acima de poucos milhões de tokens de saída por mês, o Nemotron local paga o setup em semanas — e ainda deixa o modelo no seu controle.

Em uma frase

Para workloads locais de baixo custo com raciocínio básico, o Nemotron Nano 9B V2 é o melhor custo-benefício aberto da faixa dos 9B; para qualquer coisa acima de índice 10 de inteligência, continue olhando Scout, Maverick ou os modelos da OpenAI.

Perguntas frequentes

O que é o Nemotron Nano 9B V2?

É um LLM de 9 bilhões de parâmetros lançado pela NVIDIA em 5 de setembro de 2025, treinado do zero como modelo unificado de raciocínio e não-raciocínio, com pesos abertos e contexto de 131.072 tokens.

Quanto custa usar o Nemotron Nano 9B V2 via API?

US$ 0,04 por milhão de tokens de entrada e US$ 0,16 por milhão de tokens de saída, com custo blended de US$ 0,07 por milhão. O catálogo não publicou preço de cache.

Nemotron Nano 9B V2 ou Llama 4 Scout?

Scout entrega índice de inteligência maior (10,256 contra 8,677), multimodal nativo e contexto de 1,3M, mas custa quase o dobro. Para uso local sem visão e sem necessidade de contexto gigante, o Nemotron é mais econômico.

Leia também