Nemotron Nano 9B V2 é grátis, mas falta dado para você comparar
Lançado em 5 de setembro pela NVIDIA, o modelo entra sem índice de inteligência nem benchmark de coding — e disputa o slot free com modelos que já têm nota no catálogo.
Há cinco dias a NVIDIA colocou no catálogo um modelo com preço zero. Em um mercado em que o topo da régua cobra US$ 8 por milhão de tokens de saída (OpenAI o3), "de graça" é um argumento forte. O problema é que, junto com o preço, veio a ausência de nota: não há índice de inteligência publicado, não há benchmark de coding, não há score agentic. Você está olhando para um motor sem velocímetro.
| Campo | Valor |
|---|---|
| Identificador | nvidia/nemotron-nano-9b-v2:free |
| Criador | nvidia |
| Preço de entrada | US$ 0.000 / M tokens |
| Preço de saída | US$ 0.000 / M tokens |
| Janela de contexto | 128k |
| Modalidade | text->text |
O que o catálogo mostra — e o que esconde
A ficha do Nemotron Nano 9B V2 (free) é curta nos pontos que mais importam para quem decide. Está lá que é um modelo texto→texto, com 128 mil tokens de contexto e cutoff de conhecimento em 31 de março de 2025. Está lá que a entrada custa US$ 0 por milhão de tokens e a saída idem — sem cobrança de cache também. Está lá que o lançamento foi em 5 de setembro de 2025.
O que não está lá é o que normalmente pesa na decisão. O campo de IQ está vazio. Coding, vazio. Agentic, vazio. Parâmetros, país de origem e informação sobre pesos também não foram preenchidos. O nome entrega a ordem de grandeza (9B, nano), mas a ficha técnica se recusa a confirmar o resto. Para um modelo pago, essa lacuna já seria incômoda. Para um modelo que vai entrar em produção por causa do custo, é um sinal amarelo.
Disputando espaço com quem já tem nota
A briga pelo slot "free" no catálogo não está vazia. Entre os modelos com IQ medido, os mais baratos do topo custam US$ 0,13 por milhão de tokens de saída (gpt-oss-20b, IQ 15,225) e US$ 0,17 (gpt-oss-120b, IQ 24,126). Mesmo os Llama 4 da Meta, nas variantes Scout e Maverick, custam US$ 0,30 e US$ 0,696 por milhão de saída — com IQ 10,256 e 14,477 respectivamente. O Nemotron Nano entra abaixo deles. Literalmente abaixo de zero.
Mas preço zero vence preço baixo em qualquer cenário? Não. "Grátis mais barato" só vence se a qualidade não for desastre. E aqui o catálogo não te ajuda. O gpt-oss-20b, com IQ 15,2, tem uma referência numérica que você pode comparar com o histórico do seu próprio sistema. O Nemotron Nano, não. Você vai descobrir a qualidade rodando — o que é factível para um chatbot interno e arriscado para um fluxo que mexe com dinheiro ou dado sensível.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
| Llama 4 Scout | 10.3 | 0.3 |
Para quem esse modelo resolve — e para quem não
Ele faz sentido em três cenários. Primeiro: alto volume de chamadas em que cada centavo por milhão de tokens pesa no fim do mês — sumarização de logs, classificação de tickets, geração de rascunhos. Segundo: prototipagem rápida, quando você precisa validar uma ideia de produto antes de comprometer orçamento com um modelo pago. Terceiro: ambientes de desenvolvimento e teste, em que o que importa é o formato da resposta, não a excelência.
Ele não faz sentido quando você precisa de um piso de qualidade verificável por terceiro. Raciocínio matemático pesado, geração de código crítico, fluxos agentic de várias etapas — esses pedem benchmark publicado e nota conhecida. A descrição do modelo fala em uso "unificado" para raciocínio e não raciocínio, mas isso é a promessa do release, não o que o catálogo te entrega para comparar.
O tabuleiro em 10 de setembro de 2025
O catálogo tem mais de 224 modelos listados hoje, vindos de 38 criadores. Nos últimos 30 dias, 15 modelos entraram — um ritmo alto, puxado por variantes "free" e modelos de baixo custo. A NVIDIA, que tem presença forte em hardware de inferência, entra agora com um LLM próprio no nível gratuito. É um movimento de plataforma, não de produto único: ela quer rodapé na sua esteira de desenvolvimento, mesmo que o modelo em si não vença o3 ou gpt-oss-120b em qualidade bruta.
Se você opera uma aplicação com milhares de chamadas por dia e já tem um modelo caro respondendo tarefas fáceis, o Nemotron Nano 9B V2 free é uma ponte para tirar esse tráfego da fatura. Se você precisa de uma referência comparativa antes de colocar em produção, espere — ou monte uma avaliação interna com uma amostra da sua carga real.
Use o Nemotron Nano 9B V2 free para workloads de alto volume em que o custo domina e a saída é fácil de validar na sua própria carga — não para produção crítica onde você precisa de um piso de qualidade publicado.
Perguntas frequentes
O Nemotron Nano 9B V2 é realmente gratuito?
Sim. No catálogo o modelo aparece com preço zero tanto para entrada quanto para saída de tokens, sem cobrança de cache. O custo da inferência fica com quem hospeda o endpoint, não com você.
Por que não tem nota de inteligência (IQ) nem benchmark de coding?
Porque o catálogo ainda não publicou índices para esse modelo. Sem benchmark, você não consegue compará-lo diretamente com o3 (IQ 31) ou gpt-oss-20b (IQ 15) — e precisa rodar uma avaliação na sua própria carga antes de decidir.
Ele serve para colocar em produção hoje?
Serve para tarefas de alto volume em que o custo é o gargalo e a saída é fácil de validar, como sumarização, classificação e geração de rascunhos. Para fluxos críticos com raciocínio pesado ou código sensível, prefira um modelo com benchmark publicado até que surja uma avaliação independente.