Nemotron 3.5 Content Safety é grátis — e isso muda a conta da sua API
NVIDIA lança guardrail multimodal sem custo de inferência; o que sobra no orçamento quando moderação deixa de pesar na fatura.
O que está na conta hoje
Você paga US$ 9 por milhão de tokens para o Gemini 3.5 Flash fazer a moderação de conteúdo do seu produto. Para um chat de suporte que gera 50 milhões de tokens de saída por mês só em verificações de segurança, são US$ 450 que saem da fatura sem virar feature visível ao usuário. A NVIDIA publicou em 4 de junho um guardrail multimodal com preço zero, e isso é a única coisa que importa nessa história.
Não é lançamento de LLM de uso geral. É uma peça de infraestrutura — e por isso a análise é outra.
O que o modelo faz, de verdade
O Nemotron 3.5 Content Safety é um fine-tune de 4 bilhões de parâmetros do Gemma-3-4B do Google, treinado pela NVIDIA especificamente para moderar tanto entradas quanto saídas de LLMs e VLMs. Aceita texto e imagem, devolve texto, roda em 128 mil tokens de contexto. Não tem índice de inteligência publicado no catálogo — e não precisa. Você não vai usá-lo para gerar copy nem para razonar sobre código; você vai plugar entre o seu usuário e o seu modelo principal, ou entre o seu modelo principal e a resposta final.
A conta aqui é de infraestrutura, não de capacidade. Pensa nele como um filtro de spam do email corporativo: ninguém compra provedor de email pelo filtro, mas todo mundo precisa de um que funcione.
Para quem isso vale a pena hoje
Se o seu produto recebe conteúdo gerado por usuário — chat ao vivo, geração de imagem com prompt livre, upload com OCR, qualquer coisa que toque LLM ou VLM em produção — você provavelmente já tem um guardrail rodando. Se esse guardrail é pago por token, este modelo entra como candidato sério a substituí-lo, porque o preço é literalmente zero tanto na entrada quanto na saída.
| Campo | Valor |
|---|---|
| Identificador | nvidia/nemotron-3.5-content-safety:free |
| Criador | nvidia |
| Preço de entrada | US$ 0.000 / M tokens |
| Preço de saída | US$ 0.000 / M tokens |
| Janela de contexto | 128k |
| Modalidade | text+image->text |
Para uma aplicação que roda 100 milhões de tokens por mês só em moderação, a economia direta é da ordem de quatro dígitos em dólar por mês, dependendo do provedor anterior. Em um estágio que está queimando caixa para validar produto, isso é runway.
Para quem NÃO muda nada
Se o seu pipeline de moderação já usa um classificador próprio baseado em embeddings, ou se você roda Llama Guard on-prem, este lançamento não te afeta — você já não paga por inferência externa. Também não muda nada para quem delega toda a moderação ao modelo principal via system prompt: a abordagem é pior em precisão, mas não tem custo adicional, e o Nemotron não resolve um problema que você optou por não ter.
Vale notar: o catálogo não publicou benchmark de coding, agentic, raciocínio ou velocidade para este modelo. Esses campos simplesmente não fazem sentido para um guardrail, e a ausência deles é informativa — não é omissão, é categoria.
Onde ele se encaixa no tabuleiro
Olhando o topo do mercado hoje, o cenário é de três casas brigando pela atenção em capacidade geral — Anthropic com Claude Fable 5 na frente em índice de inteligência (62), Google com Gemini 3.1 Pro Preview e Gemini 3.5 Flash logo abaixo, OpenAI com GPT-5.3-Codex. O Nemotron 3.5 Content Safety não disputa essa corrida. Ele disputa uma faixa que o catálogo nem mede da mesma forma: a faixa de custo zero em uma tarefa específica.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiniMax M3 | 45.4 | 1.2 |
NVIDIA entra aqui não como concorrente de modelo de fronteira, e sim como fornecedor de peça de infraestrutura — mesmo movimento que fez com CUDA em outro momento. A diferença é que agora a peça vem com fine-tune pronto e preço zero.
O que você faz com isso amanhã
Antes de plugar, teste três coisas: cobertura do seu caso de uso específico (o modelo foi treinado em dataset amplo, mas domínio vertical pode ter lacunas), latência (parâmetros 4B costumam ser rápidos, mas o catálogo não publicou velocidade — meça no seu próprio deployment), e o que acontece quando ele erra (tenha um fallback pago para os 0,5% que escapam). Se os três passarem, migre a moderação para o Nemotron gratuito e use o orçamento que sobra onde a capacidade do modelo principal importa.
Se a moderação é uma linha da sua fatura de API, teste o Nemotron 3.5 Content Safety — preço zero é difícil de argumentar contra, desde que a cobertura do seu caso passe no piloto.
Perguntas frequentes
O NVIDIA Nemotron 3.5 Content Safety é realmente gratuito?
Sim. O catálogo lista US$ 0 por milhão de tokens tanto na entrada quanto na saída. É um modelo gratuito da NVIDIA, fino-tune do Gemma-3-4B do Google, voltado para moderação de conteúdo multimodal.
Ele substitui o Llama Guard ou outros guardrails pagos?
Pode substituir em muitos casos, especialmente quando o guardrail atual é pago por token. Antes de migrar, valide cobertura do seu domínio específico, meça latência no seu deployment e mantenha um fallback para os casos de borda.
Serve para gerar texto ou só para moderar?
Serve para moderar. O modelo foi treinado especificamente como guardrail para entradas e saídas de LLMs e VLMs. Para geração de texto, raciocínio ou código, use um modelo de uso geral — o catálogo tem outras opções nessa faixa.