Nemotron 3 Nano custa US$ 0,20 por milhão de saída — e é open weights
NVIDIA lança MoE de 31,6B com só 3,6B ativos por token; inteligência fica abaixo do top 5, mas o preço mexe no chão do mercado
Saiu por US$ 0,20 o milhão de tokens de saída. Antes de você ler qualquer outra coisa sobre o Nemotron 3 Nano 30B A3B, anota esse número — porque é ele que vai decidir se o modelo entra ou sai da sua shortlist.
A NVIDIA soltou hoje a linha Nemotron 3 Nano, e o cartão de visita é um modelo MoE (Mistura de Especialistas) com 31,6 bilhões de parâmetros totais, mas só 3,6 bilhões ativos a cada token gerado. Pense num restaurante com 31 chefs na cozinha, mas só 3,6 atendem cada pedido: você paga pela estrutura, mas a conta do gás vem menor. EmLLMês, isso se traduz em velocidade de 247,99 tokens por segundo e um preço de saída que é uma fração do cobrado pelos concorrentes diretos.
O que cabe na conta da API
O preço completo: US$ 0,05 por milhão de tokens de entrada, US$ 0,20 por milhão de saída, e US$ 0,025 para leitura de cache. Para comparar com o que já estava no ar, o Claude Haiku 4.5 cobra US$ 5 por milhão de saída — 25 vezes mais. O o3 da OpenAI, US$ 8 — 40 vezes mais. Mesmo o Xiaomi MiMo-V2-Flash, que lidera o índice de inteligência hoje, cobra US$ 0,30, ou seja, 50% a mais que o Nemotron por uma nota de inteligência bem mais alta.
| Campo | Valor |
|---|---|
| Identificador | nvidia/nemotron-3-nano-30b-a3b |
| Criador | nvidia |
| Preço de entrada | US$ 0.050 / M tokens |
| Preço de saída | US$ 0.200 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.030 / M (40% de desconto) |
| Índice de inteligência (AA) | 14.5 |
| Índice de código | 14.4 |
| Índice agêntico | 2.0 |
| Parâmetros | 31.6B (3.6B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 248 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
Onde ele peca — e onde ele acerta
Olha, não dá para esconder: o índice de inteligência do Nemotron 3 Nano é 14,538. O topo do mercado hoje está em 34,024 (MiMo-V2-Flash). É menos da metade. Em coding, a nota é 14,371; em capacidade agentic, 1,993 — quase irrelevante. Quem precisa de raciocínio pesado vai olhar para outro lado.
Mas tem um "mas" importante. A NVIDIA publicou os pesos (open weights), o contexto é de 262.144 tokens, e existe uma versão gratuita do mesmo modelo no catálogo. Para quem roda local, ajusta fino ou quer montar um agente enxuto sem estourar a fatura, esse desenho começa a fazer sentido — não como substituto do Haiku, mas como outra categoria de ferramenta.
A linha completa lançada hoje
A NVIDIA não soltou só um modelo. O lançamento de hoje traz o Nemotron 3 Nano 30B A3B na versão paga e a versão :free, sem custo de API, com contexto de 256 mil tokens. É o tipo de movimento que costuma acontecer quando o criador quer maximizar adoção e coletar feedback antes de subir preço.
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Nemotron 3 Nano 30B A3B (fre | 0 | 0 | 256k |
Para quem vale — e para quem não muda nada
Vale para você se: está prototipando agentes, quer rodar um modelo pequeno localmente com pesos abertos, ou precisa de uma camada barata para tarefas de classificação, extração e roteamento onde o raciocínio profundo não é o gargalo. A versão gratuita remove a barreira de entrada para experimentar.
Não muda nada para você se: está construindo produto que depende de raciocínio forte, código complexo ou planejamento multi-etapa. A diferença de 20 pontos no índice de inteligência não se resolve com prompt engineering — é capacidade de modelo.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Nemotron 3 Nano 30B A3B (o novo) | 14.5 | 0.05 | 0.2 | 262k |
| MiMo-V2-Flash | 34.0 | 0.1 | 0.3 | 262k |
| o3 | 31.1 | 2 | 8 | 200k |
| Claude Haiku 4.5 | 29.9 | 1 | 5 | 200k |
O tabuleiro em 14 de dezembro
O catálogo tem 307 modelos listados hoje, de 47 criadores, e 31 foram lançados nos últimos 30 dias. O Nemotron entra como o modelo de preço mais baixo entre os rivais diretos que aparecem no top 5 de inteligência — e é o único desse grupo com pesos abertos. O MiMo-V2-Flash lidera em inteligência; o o3, em raciocínio consolidado; o Haiku 4.5, em equilíbrio entre preço e capacidade. O Nemotron ocupa o canto oposto: barato e aberto, mesmo que menos capaz.
O que fazer com isso amanhã
Se você já tem um Haiku ou um gpt-oss-120b em produção, não troca. Se você está montando um pipeline com várias chamadas de modelo — um classificador aqui, um extrator ali, um resumidor acolá — o Nemotron 3 Nano entra como candidato sério para as tarefas leves, especialmente via versão gratuita durante a fase de testes. A pergunta de US$ 0,20 por milhão não é se o modelo é bom; é se ele é bom o suficiente para o trabalho que você quer entregar.
Use o Nemotron 3 Nano para tarefas leves e de alto volume onde cada ponto de inteligência acima dele não se traduz em receita — e mantenha um modelo mais forte para o trabalho pesado.
Perguntas frequentes
Quanto custa o NVIDIA Nemotron 3 Nano 30B A3B?
US$ 0,05 por milhão de tokens de entrada e US$ 0,20 por milhão de tokens de saída, com cache a US$ 0,025 por milhão. Existe também uma versão gratuita no catálogo.
O Nemotron 3 Nano tem pesos abertos?
Sim. A NVIDIA publicou os pesos do modelo, o que permite rodar localmente, fazer ajuste fino e redistribuir — algo raro entre os modelos do topo do índice de inteligência.
Nemotron 3 Nano serve para coding e agentes?
Serve para tarefas simples e de alto volume, mas o índice de coding (14,371) e a nota agentic (1,993) ficam bem abaixo dos rivais do top 5. Para código complexo ou planejamento multi-etapa, escolha um modelo mais capaz.