NVIDIA Nemotron 3 Super é grátis, mas não publica nota de IQ
Modelo aberto aciona só 12B dos 120B a cada token. Contexto de 262 mil cabe numa conta que custa zero.
A NVIDIA colocou no catálogo um modelo com 120 bilhões de parâmetros e disse que você paga zero por ele. Treze dias depois do lançamento, em 24 de março de 2026, essa é a única certeza que existe. O Nemotron 3 Super não traz nota de IQ, não traz score de código, não traz índice agentic. O catálogo, com 374 modelos ainda listados hoje vindos de 53 criadores, mostra-o como gratuito e ponto.
| Campo | Valor |
|---|---|
| Identificador | nvidia/nemotron-3-super-120b-a12b:free |
| Criador | nvidia |
| Preço de entrada | US$ 0.000 / M tokens |
| Preço de saída | US$ 0.000 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text->text |
O que a NVIDIA entregou de fato
Pensa numa frota de vans com 120 lugares cada, mas em cada viagem só 12 vão. É isso que o Nemotron 3 Super faz: 120B de parâmetros no total, 12B ativos por token — uma MoE híbrida (mistura de especialistas) com arquitetura Mamba-Transformer. Esse desenho promete dois benefícios práticos: mais eficiência por real de computação gasta, e a capacidade de esticar o contexto até 262.144 tokens. Em trabalho multi-agente, onde várias chamadas longas se acumulam, esse teto pesa mais do que parece.
A descrição oficial enfatiza "aplicações multi-agente complexas" e "eficiência de computação máxima". Não fala em recorde de benchmark. Não fala em liderança de categoria. Fala em caber mais em menos.
Onde ele senta no tabuleiro atual
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
Os cinco primeiros do catálogo por IQ nesta data: Google Gemini 3.1 Pro Preview com 47,7 a US$ 12 por milhão de saída; OpenAI GPT-5.3-Codex com 45,5 a US$ 14; Xiaomi MiMo-V2-Omni, Anthropic Claude Sonnet 4.6 e Qwen3.5 397B A17B entre 34 e 36. O Nemotron 3 Super não pontua nesse ranking — não porque é fraco, porque ninguém publicou a nota dele ainda.
Vale notar: dos modelos acima de IQ 45, todos são pagos, e só dois custam menos de US$ 15 por milhão de saída (Gemini e GPT). "Barato e bom" continua sendo essa faixa. O Nemotron entra num buraco diferente: gratuito, mas sem medida comparável. Nos últimos 30 dias, 34 modelos foram lançados — e este é um deles, sem custo de teste.
Para quem ele muda o jogo
Se você prototipa um agente que vai trocar 200 mil tokens de contexto por hora, ou se está montando um playground multi-agente para experimentar antes de colocar em produção, este é o tipo de modelo que faz sentido agora. Não paga pela janela, não paga pela resposta, não olha fatura no fim do mês. A combinação 262K de contexto com preço zero praticamente não tem par no catálogo hoje.
Outra frente: exploração de arquitetura. Mamba-Transformer híbrido é direção que NVIDIA, Mistral e outros estão empurrando. Rodar de graça num estágio inicial te dá leitura de comportamento sem custo. Em equipes pequenas — duas, três pessoas construindo agente — o cálculo fica óbvio.
Para quem ele não muda nada
Para quem precisa comparar capacidade antes de colocar em produção, este modelo ainda não responde. Sem nota de IQ, sem score de coding, sem agentic publicado, o Nemotron 3 Super é uma caixa-preta de preço. Você testa porque é de graça, mas não consegue defender a escolha numa review técnica com dados públicos. Aí a régua continua sendo Gemini 3.1 Pro Preview para tarefas amplas e GPT-5.3-Codex para codificação pesada — pagos, medidos, ranqueados.
Também não muda nada em latência previsível: o catálogo não traz dado de velocidade. Se seu agente depende de resposta em menos de 800 ms com SLA, gratuito sem esse número não te protege.
O que fazer com isso amanhã
Use o Nemotron 3 Super como bancada, não como motor. Carrego workloads longos que antes custavam US$ 12 ou US$ 14 por milhão para ele, observo o comportamento, e mantenho Gemini ou GPT como plano A para qualquer coisa que precise de medição. A pergunta que vale guardar: a NVIDIA publica benchmark, ou isso morre na faixa gratuita como curiosidade? Hoje o catálogo não responde — e isso é parte da análise, não omissão minha.
Use o Nemotron 3 Super como bancada gratuita para workloads longos de prototipagem; mantenha Gemini 3.1 Pro Preview ou GPT-5.3-Codex como motor medido até a NVIDIA publicar benchmark do modelo.
Perguntas frequentes
Nemotron 3 Super é gratuito para uso em produção?
O catálogo lista o modelo como free, a US$ 0 por milhão de tokens de entrada e saída. Para protótipos e workloads longos durante desenvolvimento, faz sentido; para produção, faltam benchmarks públicos de IQ, código e agentic, então a régua segue sendo modelos pagos e medidos como Gemini 3.1 Pro Preview ou GPT-5.3-Codex.
O Nemotron 3 Super substitui o Gemini 3.1 Pro Preview?
Não com os dados que existem hoje. O catálogo mostra Gemini com IQ 47,7 e GPT-5.3-Codex com IQ 45,5; o Nemotron não tem nota publicada. Sem medida comparativa, falar em substituição é aposta, não análise.
Quanto de contexto o Nemotron 3 Super aguenta?
262.144 tokens segundo o catálogo. É um teto generoso, útil para fluxos multi-agente com prompts longos, mas o catálogo não traz dado de velocidade para complementar a leitura.