FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Nemotron Nano 12B 2 VL: o multimodal da NVIDIA que custa US$ 0,30 por milhão de tokens blended

Modelo de 13 bilhões de parâmetros com arquitetura híbrida Transformer-Mamba entra no catálogo no mesmo dia em que o topo do mercado segue dominado por o3 e Claude Haiku 4.5.

Redação FalaVIP IA 3 min de leitura
US$ 0,30preço blended por milhão de tokens
13,2 bilhõesparâmetros totais
42,84 tok/svelocidade medida

O que a NVIDIA colocou no catálogo hoje

A NVIDIA publicou nesta terça-feira o Nemotron Nano 12B 2 VL, um modelo de 13,2 bilhões de parâmetros com pesos abertos, multimodal (texto, imagem e vídeo como entrada, texto como saída) e uma arquitetura híbrida que mistura Transformer com Mamba. Em tese, é a mesma proposta de sempre: rodar localmente, entender vídeo e documentos, e custar pouco na API. Em tese, porque quando você olha a tabela de preços, o número que aparece é US$ 0,20 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída — o que dá um custo blended de US$ 0,30. Em outras palavras: para cada milhão de tokens que o seu sistema cospe, você paga o dobro do que paga para fazê-lo ler.

Ficha técnica — Nemotron Nano 12B 2 VL
CampoValor
Identificadornvidia/nemotron-nano-12b-v2-vl
Criadornvidia
Preço de entradaUS$ 0.200 / M tokens
Preço de saídaUS$ 0.600 / M tokens
Janela de contexto131k
Modalidadetext+image+video->text
Índice de inteligência (AA)8.8
Parâmetros13.2B (13.2B ativos por token)
Pesosabertos
Velocidade de saída43 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

O que o índice de inteligência diz

A medição atual coloca o Nemotron Nano 12B 2 VL em 8,801 de IQ. Parece baixo? É, mas o contexto importa: o topo do catálogo hoje é o OpenAI o3 com 31,096 e o Claude Haiku 4.5 com 29,892. A diferença é brutal. O Nemotron não está brigando com esses. Está brigando com o próprio irmão mais velho, o Nemotron Nano 9B V2 (lançado em 5 de setembro, IQ 8,677), e com o Llama 4 Scout da Meta, que marca 10,256 — e cobra US$ 0,30 por milhão de tokens de saída, o mesmo preço de saída do Nemotron novo.

Índice de inteligência (Artificial Analysis)
Nemotron Nano 12B 2 VL8,8Nova Micro 1.04,4Nemotron Nano 9B V28,7Llama 4 Scout10,3Llama 3.3 70B Instruct9,3índice
Fonte: Artificial Analysis

Traduzindo: em quase dois meses, a NVIDIA conseguiu adicionar vídeo e imagem como entrada e subir o IQ em 0,124 ponto — mantendo o preço de saída idêntico ao do Scout. Não é um salto de geração, é um ajuste fino com multimodalidade de brinde.

Para quem isso vale — e para quem não muda nada

Se você já roda o Nemotron Nano 9B V2 em produção para tarefas de texto e raciocínio, este modelo é a atualização natural: ganha vídeo e imagem sem perder velocidade (42,84 tokens/s contra 147,18 do irmão menor, queda que tem de ser olhada com cuidado — o 9B V2 é texto puro, compará-los em velocidade é como comparar um sedan com uma picape). Se você está avaliando um multimodal pequeno e aberto, o Llama 4 Scout continua à frente em IQ (10,256 vs 8,801) com contexto dez vezes maior (1,3 milhão de tokens contra 131 mil) e o mesmo preço de saída.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Nemotron Nano 12B 2 VL (o novo)8.80.20.6131k
Nova Micro 1.04.40.0350.14128k
Nemotron Nano 9B V28.70.040.16131k
Llama 4 Scout10.30.10.31.31M
Llama 3.3 70B Instruct9.30.10.32131k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Vale para: quem precisa de vídeo e documento num modelo open weights pequeno e quer manter a conta baixa; quem já tem pipeline Nemotron e quer dar um passo adiante sem trocar de fornecedor.

Não vale para: quem está no topo da cadeia — o3 e Claude Haiku 4.5 custam US$ 8 e US$ 5 por milhão de tokens de saída respectivamente, mas entregam IQ quase quatro vezes maior. Para tarefas de raciocínio pesado ou agente, a conta do Nemotron não fecha. Também não vale se você só precisa de texto: o Nova Micro 1.0 da Amazon custa US$ 0,06125 blended e responde a 261 tokens/s, três vezes mais rápido.

Preço de saída (US$ por milhão de tokens)
Nemotron Nano 12B 2 VL0,6Nova Micro 1.00,14Nemotron Nano 9B V20,16Llama 4 Scout0,3Llama 3.3 70B Instruct0,32US$/M
Fonte: OpenRouter

Onde ele se situa no tabuleiro

O catálogo tem hoje mais de 265 modelos de 41 criadores, e 25 deles foram lançados nos últimos 30 dias. O Nemotron entra no meio do bolo: não é o mais barato (Nova Micro ganha), não é o mais inteligente (o3 ganha), não é o mais rápido (Nova Micro de novo). A proposta dele é específica — multimodal aberto, vídeo, documento, raciocínio, preço médio. É um canivete suíço para quem não quer pagar pelo canivete de prata.

Inteligência × preço de saída
Nemotron Nano 12B 2 VLNova Micro 1.0Nemotron Nano 9B V2Llama 4 ScoutLlama 3.3 70B InstructUS$ por milhão (saída, escala log)índice de inteligência

O que fazer com isso

Se você tem um caso de uso que envolve analisar gravações de reunião, PDFs escaneados ou frames de vídeo e o orçamento não estica até US$ 5 por milhão de tokens de saída, vale testar o Nemotron Nano 12B 2 VL esta semana — o preço de entrada de US$ 0,20 é competitivo e os pesos abertos permitem ajuste fino. Se o seu gargalo é raciocínio ou velocidade pura, continue olhando para cima da tabela. E se você está só experimentando, lembre: o Nova Micro responde mais rápido e custa cinco vezes menos, desde que você não precise de imagem.

Em uma frase

Teste o Nemotron Nano 12B 2 VL se multimodal aberto e vídeo entram no escopo; ignore se você precisa de raciocínio de ponta ou velocidade bruta — o catálogo tem opções melhores em cada uma dessas pontas.

Perguntas frequentes

Quanto custa o Nemotron Nano 12B 2 VL na API?

US$ 0,20 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída, o que dá US$ 0,30 no preço blended. É mais caro na saída do que o Llama 4 Scout, mas entrega multimodalidade com vídeo.

O Nemotron Nano 12B 2 VL é melhor que o Llama 4 Scout?

Não em inteligência geral: o Scout marca 10,256 de IQ contra 8,801 do Nemotron, e tem contexto dez vezes maior. O Nemotron ganha na proposta de ser menor e explicitamente voltado para vídeo e documentos.

Posso rodar o Nemotron Nano 12B 2 VL localmente?

Sim, os pesos são abertos e o modelo tem 13,2 bilhões de parâmetros — cabe em uma GPU de 24 GB com quantização, embora o catálogo não tenha publicado preço de cache nem data de corte de conhecimento.

Leia também