FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Nemotron 3.5 Lightning chega a US$ 0,20 por milhão de saída

Versão paga da NVIDIA cobra 125 vezes menos que Claude Opus 5 na saída, mas não traz nota de inteligência no catálogo

Redação FalaVIP IA 3 min de leitura
US$ 0,20por milhão de tokens de saída
262.144tokens de contexto na versão paga
125xmais barato que Claude Opus 5 na saída

O anúncio da NVIDIA em uma frase

A NVIDIA soltou hoje o Nemotron 3.5 Lightning, um modelo open-weight de mistura de especialistas com 3 bilhões de parâmetros ativos sobre 30 bilhões totais. O detalhe que vai parar na planilha de quem paga API é o preço de saída: US$ 0,20 por milhão de tokens. Em tradução direta, gerar 1 milhão de palavras de resposta custa quatro reais — menos que o café da manhã numa boa padaria.

Ficha técnica — Nemotron 3.5 Lightning
CampoValor
Identificadornvidia/nemotron-3.5-lightning
Criadornvidia
Preço de entradaUS$ 0.080 / M tokens
Preço de saídaUS$ 0.200 / M tokens
Janela de contexto262k
Modalidadetext->text
Leitura de cacheUS$ 0.040 / M (50% de desconto)

A conta que ninguém quer fazer

Coloque o Nemotron 3.5 Lightning lado a lado com o que ocupa o topo do catálogo hoje. O Claude Opus 5, da Anthropic, sai a US$ 25 por milhão de tokens de saída. O Claude Fable 5, US$ 50. O GPT-5.6 Sol, da OpenAI, US$ 10. A diferença para o modelo da NVIDIA é de 50x, 250x e 125x, nessa ordem. Não é disputa: é outra categoria de cobrança.

Preço de saída (US$ por milhão de tokens)
Nemotron 3.5 Lightning0,2Claude Opus 525Claude Fable 550GPT-5.6 Sol10DeepSeek V4 Flash 07310,18MiniMax M31,2US$/M
Fonte: OpenRouter

Na entrada, a história é parecida: US$ 0,08 por milhão, com cache a US$ 0,04. Para fluxos que ficam repetindo o mesmo prompt longo — varredura de código, RAG sobre uma base estável —, o cache derruba o custo efetivo pela metade sem precisar trocar de modelo.

O elefante na ficha técnica

O catálogo listou o Nemotron 3.5 Lightning sem nota de inteligência, sem benchmark de coding, agentic ou blended. Isso não é falha do seu radar: é o que foi publicado. E muda completamente a leitura do lançamento.

Se você precisa de um modelo que lidere em raciocínio, o ranking de hoje continua com Claude Opus 5 (63,053), Claude Fable 5 (62,073) e GPT-5.6 Sol (60,93) nas três primeiras posições. O Nemotron entra para uma conversa diferente: a de quem roda alto volume de chamadas curtas em agente, onde cada décimo de centavo por token pesa mais do que meio ponto a mais de IQ.

Índice de inteligência (Artificial Analysis)
Claude Opus 563,1Claude Fable 562,1GPT-5.6 Sol60,9DeepSeek V4 Flash 073151,8MiniMax M345,4índice
Fonte: Artificial Analysis
Inteligência × preço de saída
Claude Opus 5Claude Fable 5GPT-5.6 SolDeepSeek V4 Flash 0731MiniMax M3US$ por milhão (saída, escala log)índice de inteligência

O contexto que você precisa olhar antes de trocar

A NVIDIA publicou duas variantes no mesmo dia. A paga tem 262.144 tokens de contexto. A versão gratuita — listada como "Nemotron 3.5 Lightning (free)" — passa para 1 milhão de tokens de contexto com tarifa zero. Para protótipos e testes locais, é a melhor entrada possível; para produção, vale lembrar que a camada free normalmente tem limites agressivos de taxa e não tem SLA.

Os outros modelos anunciados no mesmo dia
ModeloEntrada US$/MSaída US$/MContexto
Nemotron 3.5 Lightning (free001M

Antes de migrar um pipeline, compare com as alternativas baratas que já estavam no catálogo: DeepSeek V4 Flash 0731 sai a US$ 0,18 por milhão com nota de inteligência 51,767 — é a referência de custo-benefício da casa. O GPT-5.6 Luna, da própria OpenAI, cobra US$ 1,20 com IQ 52,318. O Nemotron é mais barato na saída que o DeepSeek por uma margem pequena, e brutalmente mais barato que o Luna.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Nemotron 3.5 Lightning (o novo)0.080.2262k
Claude Opus 563.15251M
Claude Fable 562.110501M
GPT-5.6 Sol60.92101.05M
DeepSeek V4 Flash 073151.80.0650.181.31M
MiniMax M345.40.31.21.05M
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Para quem isso vale — e para quem não muda nada

Vale para você se está montando um loop agêntico que dispara dezenas de chamadas por sessão, se precisa de um modelo pequeno e rápido para classificar, extrair ou rotear, ou se quer um substituto de baixo custo para tarefas onde o modelo topo anterior estava sendo claramente superdimensionado. O desenho MoE com 3B ativos entrega velocidade sem inflar VRAM — é o tipo de peça que se encaixa em pipelines de produção apertados.

Não muda nada para você se o seu gargalo é qualidade bruta de raciocínio, se você roda prompts longos únicos onde cada token de saída carrega decisão de negócio, ou se a sua fila de trabalho cabe em poucas chamadas por dia. Nesses cenários, a diferença de centavos some e a nota de inteligência — que o Nemotron não traz — é o que decide.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Opus 563.125
Claude Fable 562.150
GPT-5.6 Sol60.910
Kimi K359.715
Qwen3.8 Max58.16
Entre os 538 modelos disponíveis no catálogo nesta data.

O tabuleiro em agosto de 2026

O catálogo passou de 530 modelos listados, com 67 criadores diferentes e 36 lançamentos nos últimos 30 dias. A NVIDIA entra nessa fila com um posicionamento claro: não disputa o topo do ranking, disputa o volume. Em um mercado onde o token mais caro do mês custa 250x o mais barato, a pergunta que fica para 2026 não é "qual modelo é o melhor", mas "qual modelo cabe no seu orçamento sem cortar o que importa".

O que fazer com isso amanhã

Se você ainda não testou, peça a chave da versão free com 1M de contexto e meça latência e qualidade nas suas três tarefas mais frequentes. Se os números fecharem, a migração para a variante paga a US$ 0,20 por milhão é da ordem de grandeza que aparece na fatura — não na margem de erro.

Em uma frase

Se você roda alto volume de chamadas curtas em agente, vale testar a versão free do Nemotron 3.5 Lightning hoje e migrar para a paga a US$ 0,20 por milhão se a qualidade fechar; se o que você precisa é raciocínio de topo, o catálogo não te deu motivo para trocar.

Perguntas frequentes

Quanto custa o Nemotron 3.5 Lightning da NVIDIA?

US$ 0,08 por milhão de tokens de entrada, US$ 0,20 por milhão de tokens de saída e US$ 0,04 por milhão em cache. A versão free do mesmo modelo tem 1 milhão de tokens de contexto e tarifa zero, mas sem SLA de produção.

O Nemotron 3.5 Lightning tem nota de inteligência no catálogo?

Não. O lançamento de hoje foi publicado sem índice de inteligência, coding, agentic ou blended. Para comparar com Claude Opus 5, Fable 5 ou GPT-5.6 Sol, é preciso esperar medições independentes.

Para que tipo de tarefa o Nemotron 3.5 Lightning foi feito?

A NVIDIA descreve o modelo como adequado para cargas agentic de alto throughput e tarefas especializadas. É um MoE com 3B parâmetros ativos sobre 30B totais, ou seja: barato para rodar muitas chamadas curtas, sem a ambição de liderar em raciocínio.

Leia também