NVIDIA lança Nemotron Nano 12B 2 VL por US$ 0,60 por milhão de saída
Modelo multimodal de 12B com arquitetura híbrida Transformer-Mamba chega com versão gratuita e mira o segmento pequeno de visão e vídeo.
O que a NVIDIA colocou na mesa hoje
Você já deve ter visto o anúncio: mais um modelo multimodal da NVIDIA, dessa vez com 12 bilhões de parâmetros e a curiosa etiqueta "2 VL". O que interessa para quem paga a conta da API não é a etiqueta, é o preço. A NVIDIA está cobrando US$ 0,20 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída. Em outras palavras: um modelo que entende texto, imagem e vídeo, com janela de 131 mil tokens, custa menos do que muita API de modelo pequeno e "burro".
| Campo | Valor |
|---|---|
| Identificador | nvidia/nemotron-nano-12b-v2-vl |
| Criador | nvidia |
| Preço de entrada | US$ 0.200 / M tokens |
| Preço de saída | US$ 0.600 / M tokens |
| Janela de contexto | 131k |
| Modalidade | text+image+video->text |
| Índice de inteligência (AA) | 8.8 |
| Parâmetros | 13.2B (13.2B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 43 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
O detalhe técnico que vale entender
O release destaca uma arquitetura híbrida Transformer-Mamba. Traduzindo para o seu dia a dia: é como trocar o motor de um carro mantendo o chassi. O Transformer continua fazendo o trabalho pesado de atenção, mas o Mamba entra para processar sequências longas com menos memória. Em modelos que recebem vídeo e documentos grandes, isso significa que o servidor não trava quando o arquivo passa de algumas dezenas de milhares de tokens. Você não precisa entender Mamba para usar, mas vale saber que existe um motivo técnico para a NVIDIA ter escolhido esse caminho em vez de empilhar mais camadas Transformer.
Onde ele se encaixa no tabuleiro
Olhando o catálogo de hoje, o topo continua sendo da OpenAI: o3 lidera com índice de inteligência 31,096 e Claude Haiku 4.5 vem logo atrás com 29,892. O Nemotron Nano 12B 2 VL marca 8,801 no mesmo índice — é um número baixo se você comparar com os líderes, mas precisa de contexto: ele está competindo em outra categoria.
A conta que importa para o desenvolvedor é outra. O o3 cobra US$ 8 por milhão de saída e o Haiku 4.5 cobra US$ 5. O Nemotron Nano 12B 2 VL cobra US$ 0,60. São mais de 13 vezes mais barato que o Haiku e mais de 13 vezes mais barato que o o3, sem contar que tem pesos abertos. O gpt-oss-120b da OpenAI, que também é aberto, cobra US$ 0,17 de saída e tem índice 24,126 — ou seja, é mais inteligente no benchmark e mais barato, mas não é multimodal.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Nemotron Nano 12B 2 VL (o novo) | 8.8 | 0.2 | 0.6 | 131k |
| o3 | 31.1 | 2 | 8 | 200k |
| Claude Haiku 4.5 | 29.9 | 1 | 5 | 200k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
Para quem vale e para quem não muda nada
Vale para você se o seu produto consome multimodal barato: análise de vídeo, OCR de documentos longos, extração de informação de PDFs com imagem, descrição de frames para acessibilidade. A versão gratuita (Nemotron Nano 12B 2 VL free) tem a mesma janela de 128 mil tokens e custa zero — boa para prototipar antes de colocar em produção.
Não muda nada se você precisa do topo de capacidade de raciocínio: o3 e Claude Haiku 4.5 continuam distantes em qualidade medida. Também não muda nada se o seu caso de uso é só texto puro, porque o gpt-oss-120b entrega mais inteligência por menos dinheiro. O diferencial do Nemotron Nano 12B 2 VL é multimodalidade com peso aberto, e é isso que você deveria pesar.
A linha completa da NVIDIA hoje
A NVIDIA não soltou um modelo só. Junto com a versão paga, entrou no catálogo a variante gratuita com a mesma arquitetura.
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Nemotron Nano 12B 2 VL (free | 0 | 0 | 128k |
O que fazer com isso amanhã
Se você tem um pipeline que hoje usa GPT-4o-mini ou Claude Haiku para processar imagem e vídeo, vale rodar o mesmo prompt no Nemotron Nano 12B 2 VL free e comparar qualidade. Se a qualidade for aceitável, a economia por milhão de tokens é grande o suficiente para mudar a margem do produto. Se não for, o Haiku continua sendo a referência de multimodal barato — só que a US$ 5 por milhão de saída, não US$ 0,60.
Rode seu caso multimodal mais simples no Nemotron Nano 12B 2 VL free hoje; se a qualidade segurar, a economia frente ao Haiku 4.5 é de mais de 8 vezes por token de saída.
Perguntas frequentes
O que é a arquitetura Transformer-Mamba do Nemotron Nano 12B 2 VL?
É uma combinação em que o Transformer cuida da atenção tradicional e o Mamba entra para processar sequências longas com menor uso de memória. Na prática, isso permite lidar com vídeos e documentos extensos sem o custo computacional de um Transformer puro.
Quanto custa usar o Nemotron Nano 12B 2 VL pela API?
A versão paga custa US$ 0,20 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída, com janela de 131 mil tokens. Existe também uma versão gratuita com janela de 128 mil tokens, indicada para prototipagem.
O Nemotron Nano 12B 2 VL é melhor que o Claude Haiku 4.5?
Não em capacidade bruta de raciocínio: o índice de inteligência do Haiku 4.5 é 29,892 contra 8,801 do Nemotron. A vantagem do Nemotron está no preço multimodal e nos pesos abertos, não na qualidade medida.