FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

NVIDIA lança Nemotron Nano 12B 2 VL por US$ 0,60 por milhão de saída

Modelo multimodal de 12B com arquitetura híbrida Transformer-Mamba chega com versão gratuita e mira o segmento pequeno de visão e vídeo.

Redação FalaVIP IA 3 min de leitura
US$ 0,60por milhão de tokens de saída
US$ 0,20por milhão de tokens de entrada
12B parâmetrostamanho do modelo, com pesos abertos

O que a NVIDIA colocou na mesa hoje

Você já deve ter visto o anúncio: mais um modelo multimodal da NVIDIA, dessa vez com 12 bilhões de parâmetros e a curiosa etiqueta "2 VL". O que interessa para quem paga a conta da API não é a etiqueta, é o preço. A NVIDIA está cobrando US$ 0,20 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída. Em outras palavras: um modelo que entende texto, imagem e vídeo, com janela de 131 mil tokens, custa menos do que muita API de modelo pequeno e "burro".

Ficha técnica — Nemotron Nano 12B 2 VL
CampoValor
Identificadornvidia/nemotron-nano-12b-v2-vl
Criadornvidia
Preço de entradaUS$ 0.200 / M tokens
Preço de saídaUS$ 0.600 / M tokens
Janela de contexto131k
Modalidadetext+image+video->text
Índice de inteligência (AA)8.8
Parâmetros13.2B (13.2B ativos por token)
Pesosabertos
Velocidade de saída43 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

O detalhe técnico que vale entender

O release destaca uma arquitetura híbrida Transformer-Mamba. Traduzindo para o seu dia a dia: é como trocar o motor de um carro mantendo o chassi. O Transformer continua fazendo o trabalho pesado de atenção, mas o Mamba entra para processar sequências longas com menos memória. Em modelos que recebem vídeo e documentos grandes, isso significa que o servidor não trava quando o arquivo passa de algumas dezenas de milhares de tokens. Você não precisa entender Mamba para usar, mas vale saber que existe um motivo técnico para a NVIDIA ter escolhido esse caminho em vez de empilhar mais camadas Transformer.

Onde ele se encaixa no tabuleiro

Olhando o catálogo de hoje, o topo continua sendo da OpenAI: o3 lidera com índice de inteligência 31,096 e Claude Haiku 4.5 vem logo atrás com 29,892. O Nemotron Nano 12B 2 VL marca 8,801 no mesmo índice — é um número baixo se você comparar com os líderes, mas precisa de contexto: ele está competindo em outra categoria.

Índice de inteligência (Artificial Analysis)
Nemotron Nano 12B 2 VL8,8o331,1Claude Haiku 4.529,9gpt-oss-120b24,1índice
Fonte: Artificial Analysis
Preço de saída (US$ por milhão de tokens)
Nemotron Nano 12B 2 VL0,6o38Claude Haiku 4.55gpt-oss-120b0,17US$/M
Fonte: OpenRouter

A conta que importa para o desenvolvedor é outra. O o3 cobra US$ 8 por milhão de saída e o Haiku 4.5 cobra US$ 5. O Nemotron Nano 12B 2 VL cobra US$ 0,60. São mais de 13 vezes mais barato que o Haiku e mais de 13 vezes mais barato que o o3, sem contar que tem pesos abertos. O gpt-oss-120b da OpenAI, que também é aberto, cobra US$ 0,17 de saída e tem índice 24,126 — ou seja, é mais inteligente no benchmark e mais barato, mas não é multimodal.

Inteligência × preço de saída
Nemotron Nano 12B 2 VLo3Claude Haiku 4.5gpt-oss-120bUS$ por milhão (saída, escala log)índice de inteligência
Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Nemotron Nano 12B 2 VL (o novo)8.80.20.6131k
o331.128200k
Claude Haiku 4.529.915200k
gpt-oss-120b24.10.0370.17131k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Para quem vale e para quem não muda nada

Vale para você se o seu produto consome multimodal barato: análise de vídeo, OCR de documentos longos, extração de informação de PDFs com imagem, descrição de frames para acessibilidade. A versão gratuita (Nemotron Nano 12B 2 VL free) tem a mesma janela de 128 mil tokens e custa zero — boa para prototipar antes de colocar em produção.

Não muda nada se você precisa do topo de capacidade de raciocínio: o3 e Claude Haiku 4.5 continuam distantes em qualidade medida. Também não muda nada se o seu caso de uso é só texto puro, porque o gpt-oss-120b entrega mais inteligência por menos dinheiro. O diferencial do Nemotron Nano 12B 2 VL é multimodalidade com peso aberto, e é isso que você deveria pesar.

A linha completa da NVIDIA hoje

A NVIDIA não soltou um modelo só. Junto com a versão paga, entrou no catálogo a variante gratuita com a mesma arquitetura.

Os outros modelos anunciados no mesmo dia
ModeloEntrada US$/MSaída US$/MContexto
Nemotron Nano 12B 2 VL (free00128k

O que fazer com isso amanhã

Se você tem um pipeline que hoje usa GPT-4o-mini ou Claude Haiku para processar imagem e vídeo, vale rodar o mesmo prompt no Nemotron Nano 12B 2 VL free e comparar qualidade. Se a qualidade for aceitável, a economia por milhão de tokens é grande o suficiente para mudar a margem do produto. Se não for, o Haiku continua sendo a referência de multimodal barato — só que a US$ 5 por milhão de saída, não US$ 0,60.

Em uma frase

Rode seu caso multimodal mais simples no Nemotron Nano 12B 2 VL free hoje; se a qualidade segurar, a economia frente ao Haiku 4.5 é de mais de 8 vezes por token de saída.

Perguntas frequentes

O que é a arquitetura Transformer-Mamba do Nemotron Nano 12B 2 VL?

É uma combinação em que o Transformer cuida da atenção tradicional e o Mamba entra para processar sequências longas com menor uso de memória. Na prática, isso permite lidar com vídeos e documentos extensos sem o custo computacional de um Transformer puro.

Quanto custa usar o Nemotron Nano 12B 2 VL pela API?

A versão paga custa US$ 0,20 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída, com janela de 131 mil tokens. Existe também uma versão gratuita com janela de 128 mil tokens, indicada para prototipagem.

O Nemotron Nano 12B 2 VL é melhor que o Claude Haiku 4.5?

Não em capacidade bruta de raciocínio: o índice de inteligência do Haiku 4.5 é 29,892 contra 8,801 do Nemotron. A vantagem do Nemotron está no preço multimodal e nos pesos abertos, não na qualidade medida.

Leia também