Nemotron 3.5 Lightning chega a US$ 0,20 por milhão de saída
Versão paga da NVIDIA cobra 125 vezes menos que Claude Opus 5 na saída, mas não traz nota de inteligência no catálogo
O anúncio da NVIDIA em uma frase
A NVIDIA soltou hoje o Nemotron 3.5 Lightning, um modelo open-weight de mistura de especialistas com 3 bilhões de parâmetros ativos sobre 30 bilhões totais. O detalhe que vai parar na planilha de quem paga API é o preço de saída: US$ 0,20 por milhão de tokens. Em tradução direta, gerar 1 milhão de palavras de resposta custa quatro reais — menos que o café da manhã numa boa padaria.
| Campo | Valor |
|---|---|
| Identificador | nvidia/nemotron-3.5-lightning |
| Criador | nvidia |
| Preço de entrada | US$ 0.080 / M tokens |
| Preço de saída | US$ 0.200 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.040 / M (50% de desconto) |
A conta que ninguém quer fazer
Coloque o Nemotron 3.5 Lightning lado a lado com o que ocupa o topo do catálogo hoje. O Claude Opus 5, da Anthropic, sai a US$ 25 por milhão de tokens de saída. O Claude Fable 5, US$ 50. O GPT-5.6 Sol, da OpenAI, US$ 10. A diferença para o modelo da NVIDIA é de 50x, 250x e 125x, nessa ordem. Não é disputa: é outra categoria de cobrança.
Na entrada, a história é parecida: US$ 0,08 por milhão, com cache a US$ 0,04. Para fluxos que ficam repetindo o mesmo prompt longo — varredura de código, RAG sobre uma base estável —, o cache derruba o custo efetivo pela metade sem precisar trocar de modelo.
O elefante na ficha técnica
O catálogo listou o Nemotron 3.5 Lightning sem nota de inteligência, sem benchmark de coding, agentic ou blended. Isso não é falha do seu radar: é o que foi publicado. E muda completamente a leitura do lançamento.
Se você precisa de um modelo que lidere em raciocínio, o ranking de hoje continua com Claude Opus 5 (63,053), Claude Fable 5 (62,073) e GPT-5.6 Sol (60,93) nas três primeiras posições. O Nemotron entra para uma conversa diferente: a de quem roda alto volume de chamadas curtas em agente, onde cada décimo de centavo por token pesa mais do que meio ponto a mais de IQ.
O contexto que você precisa olhar antes de trocar
A NVIDIA publicou duas variantes no mesmo dia. A paga tem 262.144 tokens de contexto. A versão gratuita — listada como "Nemotron 3.5 Lightning (free)" — passa para 1 milhão de tokens de contexto com tarifa zero. Para protótipos e testes locais, é a melhor entrada possível; para produção, vale lembrar que a camada free normalmente tem limites agressivos de taxa e não tem SLA.
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Nemotron 3.5 Lightning (free | 0 | 0 | 1M |
Antes de migrar um pipeline, compare com as alternativas baratas que já estavam no catálogo: DeepSeek V4 Flash 0731 sai a US$ 0,18 por milhão com nota de inteligência 51,767 — é a referência de custo-benefício da casa. O GPT-5.6 Luna, da própria OpenAI, cobra US$ 1,20 com IQ 52,318. O Nemotron é mais barato na saída que o DeepSeek por uma margem pequena, e brutalmente mais barato que o Luna.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Nemotron 3.5 Lightning (o novo) | — | 0.08 | 0.2 | 262k |
| Claude Opus 5 | 63.1 | 5 | 25 | 1M |
| Claude Fable 5 | 62.1 | 10 | 50 | 1M |
| GPT-5.6 Sol | 60.9 | 2 | 10 | 1.05M |
| DeepSeek V4 Flash 0731 | 51.8 | 0.065 | 0.18 | 1.31M |
| MiniMax M3 | 45.4 | 0.3 | 1.2 | 1.05M |
Para quem isso vale — e para quem não muda nada
Vale para você se está montando um loop agêntico que dispara dezenas de chamadas por sessão, se precisa de um modelo pequeno e rápido para classificar, extrair ou rotear, ou se quer um substituto de baixo custo para tarefas onde o modelo topo anterior estava sendo claramente superdimensionado. O desenho MoE com 3B ativos entrega velocidade sem inflar VRAM — é o tipo de peça que se encaixa em pipelines de produção apertados.
Não muda nada para você se o seu gargalo é qualidade bruta de raciocínio, se você roda prompts longos únicos onde cada token de saída carrega decisão de negócio, ou se a sua fila de trabalho cabe em poucas chamadas por dia. Nesses cenários, a diferença de centavos some e a nota de inteligência — que o Nemotron não traz — é o que decide.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Opus 5 | 63.1 | 25 |
| Claude Fable 5 | 62.1 | 50 |
| GPT-5.6 Sol | 60.9 | 10 |
| Kimi K3 | 59.7 | 15 |
| Qwen3.8 Max | 58.1 | 6 |
O tabuleiro em agosto de 2026
O catálogo passou de 530 modelos listados, com 67 criadores diferentes e 36 lançamentos nos últimos 30 dias. A NVIDIA entra nessa fila com um posicionamento claro: não disputa o topo do ranking, disputa o volume. Em um mercado onde o token mais caro do mês custa 250x o mais barato, a pergunta que fica para 2026 não é "qual modelo é o melhor", mas "qual modelo cabe no seu orçamento sem cortar o que importa".
O que fazer com isso amanhã
Se você ainda não testou, peça a chave da versão free com 1M de contexto e meça latência e qualidade nas suas três tarefas mais frequentes. Se os números fecharem, a migração para a variante paga a US$ 0,20 por milhão é da ordem de grandeza que aparece na fatura — não na margem de erro.
Se você roda alto volume de chamadas curtas em agente, vale testar a versão free do Nemotron 3.5 Lightning hoje e migrar para a paga a US$ 0,20 por milhão se a qualidade fechar; se o que você precisa é raciocínio de topo, o catálogo não te deu motivo para trocar.
Perguntas frequentes
Quanto custa o Nemotron 3.5 Lightning da NVIDIA?
US$ 0,08 por milhão de tokens de entrada, US$ 0,20 por milhão de tokens de saída e US$ 0,04 por milhão em cache. A versão free do mesmo modelo tem 1 milhão de tokens de contexto e tarifa zero, mas sem SLA de produção.
O Nemotron 3.5 Lightning tem nota de inteligência no catálogo?
Não. O lançamento de hoje foi publicado sem índice de inteligência, coding, agentic ou blended. Para comparar com Claude Opus 5, Fable 5 ou GPT-5.6 Sol, é preciso esperar medições independentes.
Para que tipo de tarefa o Nemotron 3.5 Lightning foi feito?
A NVIDIA descreve o modelo como adequado para cargas agentic de alto throughput e tarefas especializadas. É um MoE com 3B parâmetros ativos sobre 30B totais, ou seja: barato para rodar muitas chamadas curtas, sem a ambição de liderar em raciocínio.