Nemotron Nano 12B 2 VL: o multimodal da NVIDIA que custa US$ 0,30 por milhão de tokens blended
Modelo de 13 bilhões de parâmetros com arquitetura híbrida Transformer-Mamba entra no catálogo no mesmo dia em que o topo do mercado segue dominado por o3 e Claude Haiku 4.5.
O que a NVIDIA colocou no catálogo hoje
A NVIDIA publicou nesta terça-feira o Nemotron Nano 12B 2 VL, um modelo de 13,2 bilhões de parâmetros com pesos abertos, multimodal (texto, imagem e vídeo como entrada, texto como saída) e uma arquitetura híbrida que mistura Transformer com Mamba. Em tese, é a mesma proposta de sempre: rodar localmente, entender vídeo e documentos, e custar pouco na API. Em tese, porque quando você olha a tabela de preços, o número que aparece é US$ 0,20 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída — o que dá um custo blended de US$ 0,30. Em outras palavras: para cada milhão de tokens que o seu sistema cospe, você paga o dobro do que paga para fazê-lo ler.
| Campo | Valor |
|---|---|
| Identificador | nvidia/nemotron-nano-12b-v2-vl |
| Criador | nvidia |
| Preço de entrada | US$ 0.200 / M tokens |
| Preço de saída | US$ 0.600 / M tokens |
| Janela de contexto | 131k |
| Modalidade | text+image+video->text |
| Índice de inteligência (AA) | 8.8 |
| Parâmetros | 13.2B (13.2B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 43 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
O que o índice de inteligência diz
A medição atual coloca o Nemotron Nano 12B 2 VL em 8,801 de IQ. Parece baixo? É, mas o contexto importa: o topo do catálogo hoje é o OpenAI o3 com 31,096 e o Claude Haiku 4.5 com 29,892. A diferença é brutal. O Nemotron não está brigando com esses. Está brigando com o próprio irmão mais velho, o Nemotron Nano 9B V2 (lançado em 5 de setembro, IQ 8,677), e com o Llama 4 Scout da Meta, que marca 10,256 — e cobra US$ 0,30 por milhão de tokens de saída, o mesmo preço de saída do Nemotron novo.
Traduzindo: em quase dois meses, a NVIDIA conseguiu adicionar vídeo e imagem como entrada e subir o IQ em 0,124 ponto — mantendo o preço de saída idêntico ao do Scout. Não é um salto de geração, é um ajuste fino com multimodalidade de brinde.
Para quem isso vale — e para quem não muda nada
Se você já roda o Nemotron Nano 9B V2 em produção para tarefas de texto e raciocínio, este modelo é a atualização natural: ganha vídeo e imagem sem perder velocidade (42,84 tokens/s contra 147,18 do irmão menor, queda que tem de ser olhada com cuidado — o 9B V2 é texto puro, compará-los em velocidade é como comparar um sedan com uma picape). Se você está avaliando um multimodal pequeno e aberto, o Llama 4 Scout continua à frente em IQ (10,256 vs 8,801) com contexto dez vezes maior (1,3 milhão de tokens contra 131 mil) e o mesmo preço de saída.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Nemotron Nano 12B 2 VL (o novo) | 8.8 | 0.2 | 0.6 | 131k |
| Nova Micro 1.0 | 4.4 | 0.035 | 0.14 | 128k |
| Nemotron Nano 9B V2 | 8.7 | 0.04 | 0.16 | 131k |
| Llama 4 Scout | 10.3 | 0.1 | 0.3 | 1.31M |
| Llama 3.3 70B Instruct | 9.3 | 0.1 | 0.32 | 131k |
Vale para: quem precisa de vídeo e documento num modelo open weights pequeno e quer manter a conta baixa; quem já tem pipeline Nemotron e quer dar um passo adiante sem trocar de fornecedor.
Não vale para: quem está no topo da cadeia — o3 e Claude Haiku 4.5 custam US$ 8 e US$ 5 por milhão de tokens de saída respectivamente, mas entregam IQ quase quatro vezes maior. Para tarefas de raciocínio pesado ou agente, a conta do Nemotron não fecha. Também não vale se você só precisa de texto: o Nova Micro 1.0 da Amazon custa US$ 0,06125 blended e responde a 261 tokens/s, três vezes mais rápido.
Onde ele se situa no tabuleiro
O catálogo tem hoje mais de 265 modelos de 41 criadores, e 25 deles foram lançados nos últimos 30 dias. O Nemotron entra no meio do bolo: não é o mais barato (Nova Micro ganha), não é o mais inteligente (o3 ganha), não é o mais rápido (Nova Micro de novo). A proposta dele é específica — multimodal aberto, vídeo, documento, raciocínio, preço médio. É um canivete suíço para quem não quer pagar pelo canivete de prata.
O que fazer com isso
Se você tem um caso de uso que envolve analisar gravações de reunião, PDFs escaneados ou frames de vídeo e o orçamento não estica até US$ 5 por milhão de tokens de saída, vale testar o Nemotron Nano 12B 2 VL esta semana — o preço de entrada de US$ 0,20 é competitivo e os pesos abertos permitem ajuste fino. Se o seu gargalo é raciocínio ou velocidade pura, continue olhando para cima da tabela. E se você está só experimentando, lembre: o Nova Micro responde mais rápido e custa cinco vezes menos, desde que você não precise de imagem.
Teste o Nemotron Nano 12B 2 VL se multimodal aberto e vídeo entram no escopo; ignore se você precisa de raciocínio de ponta ou velocidade bruta — o catálogo tem opções melhores em cada uma dessas pontas.
Perguntas frequentes
Quanto custa o Nemotron Nano 12B 2 VL na API?
US$ 0,20 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída, o que dá US$ 0,30 no preço blended. É mais caro na saída do que o Llama 4 Scout, mas entrega multimodalidade com vídeo.
O Nemotron Nano 12B 2 VL é melhor que o Llama 4 Scout?
Não em inteligência geral: o Scout marca 10,256 de IQ contra 8,801 do Nemotron, e tem contexto dez vezes maior. O Nemotron ganha na proposta de ser menor e explicitamente voltado para vídeo e documentos.
Posso rodar o Nemotron Nano 12B 2 VL localmente?
Sim, os pesos são abertos e o modelo tem 13,2 bilhões de parâmetros — cabe em uma GPU de 24 GB com quantização, embora o catálogo não tenha publicado preço de cache nem data de corte de conhecimento.