FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Nemotron 3 Ultra de graça: o que sobra quando o preço é zero

A NVIDIA abriu o cofre do modelo de raciocínio mais parrudo que tem — mas sem benchmark, sem contexto e sem preço de tabela, vale pra quem?

Redação FalaVIP IA 3 min de leitura
US$ 0,00preço de entrada e saída por milhão de tokens
1.000.000tokens de janela de contexto
desde o lançamento, em 4 de junho de 2026

O preço que não é preço

Dez dias depois de aparecer no catálogo, o Nemotron 3 Ultra da NVIDIA virou o assunto do dia entre quem paga API — não pelo que ele faz, mas pelo que ele custa. A resposta curta: nada. A entrada e a saída estão em zero, e o selo "free" aparece ao lado do nome. Quando o preço é zero, a pergunta deixa de ser "quanto custa?" e vira "o que estou levando de graça, e por quê?".

O que a NVIDIA entregou

O Nemotron 3 Ultra é descrito pela própria NVIDIA como um modelo de fronteira em raciocínio e orquestração, com 55 bilhões de parâmetros ativos dentro de uma arquitetura MoE de 550 bilhões no total. A mistura é híbrida: Transformer com Mamba, o que na prática significa que o modelo tenta manter a qualidade de raciocínio dos grandes Transformers sem pagar o custo sequencial puro deles. A janela de contexto é de um milhão de tokens — número que, em 14 de junho de 2026, só aparece em modelos que estão claramente mirando workloads longos, como análise de codebase inteiro ou dumps de logs.

Ficha técnica — Nemotron 3 Ultra (batch)
CampoValor
Identificadornvidia/nemotron-3-ultra-550b-a55b:batch
Criadornvidia
Preço de entradaUS$ 0.600 / M tokens
Preço de saídaUS$ 3.60 / M tokens
Janela de contexto512k
Modalidadetext->text
Leitura de cacheUS$ 0.200 / M (67% de desconto)

O que NÃO está no pacote

Aqui começa a parte que o anúncio não grita. O catálogo não publicou índice de inteligência, não publicou nota de coding, não publicou agentic, blended, velocidade, raciocínio, corte de conhecimento, nem país de origem. Nem o preço de cache está informado. Para um modelo que se apresenta como "frontier-reasoning", a ausência de qualquer benchmark é o tipo de lacuna que faz o desenvolvedor pisar em ovos. Você está pagando zero dólares, mas também não tem como comparar antes de colocar em produção.

O tabuleiro em 14 de junho de 2026

Para entender o contexto, vale olhar quem está no topo do catálogo hoje. O Claude Fable 5, da Anthropic, lidera o índice de inteligência com 62,073 e cobra US$ 50 por milhão de tokens de saída. O Gemini 3.1 Pro Preview, do Google, vem em segundo com 47,738 e sai por US$ 12. O GPT-5.3-Codex, da OpenAI, marca 45,512 a US$ 14. O MiniMax M3, da própria casa que mantém o catálogo, está em 45,397 cobrando US$ 1,20. O catálogo tem 469 modelos listados hoje, vindos de 61 criadores, e 26 deles foram lançados nos últimos 30 dias.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
GPT-5.3-Codex45.514
MiniMax M345.41.2
Entre os 469 modelos disponíveis no catálogo nesta data.

Quando você coloca o Nemotron 3 Ultra lado a lado com essa turma, a fotografia é essa: o concorrente mais barato acima de IQ 45 é o DeepSeek V4 Pro, a US$ 1,74 por milhão de tokens de saída. O Nemotron cobra zero. A diferença é de quase dois dólares por milhão — multiplicada por um pipeline que cospe 100 milhões de tokens por mês, são quatro dígitos de economia.

Para quem vale

Se o seu caso de uso é experimentação pura — testar como um MoE híbrido Transformer-Mamba lida com contexto de um milhão de tokens, ou validar se o estilo de raciocínio do Nemotron serve para o seu prompt antes de você migrar de provedor — o free é imbatível. O mesmo vale para protótipos internos, demos para cliente e qualquer workload em que o custo variável é o que trava o projeto.

Se você precisa de SLA, de benchmark público para justificar a escolha para o time, ou de comparação direta com Claude, Gemini e GPT, o free não resolve. A NVIDIA não publicou números, e o catálogo também não. Você vai ter que medir na sua própria régua.

Para quem NÃO muda nada

Quem já roda em Anthropic, OpenAI ou Google com contratos anuais não troca por um modelo sem nota de inteligência e sem preço de tabela publicado — porque, sem preço de tabela, "free" pode significar "free hoje, cobrado amanhã". E quem precisa de velocidade determinística para agente em produção vai esperar o campo speed ser preenchido antes de mover qualquer coisa.

O que fazer com isso

A jogada racional é tratar o Nemotron 3 Ultra free como um sandbox pago com dinheiro de verdade — o seu tempo de avaliação. Reserve um fim de semana, rode os seus 50 prompts mais representativos, meça qualidade e latência, e só então decida se o caso de uso aguenta migrar. Se a régua for custo, a conta é simples: enquanto o selo "free" estiver ali, nenhum concorrente acima de IQ 45 chega perto no preço.

Em uma frase

Use o Nemotron 3 Ultra free como laboratório de avaliação esta semana — mas não coloque em produção crítica sem medir qualidade e latência você mesmo, porque o catálogo não publicou benchmark nem preço de tabela.

Perguntas frequentes

O Nemotron 3 Ultra é realmente de graça?

Sim, no catálogo o modelo aparece com preço de entrada e saída em US$ 0 por milhão de tokens e selo "free". Porém o catálogo não publicou preço de cache nem histórico de cobrança — então o "free" vale enquanto a NVIDIA mantiver essa listagem.

Quantos parâmetros o Nemotron 3 Ultra tem?

São 550 bilhões de parâmetros totais em arquitetura MoE híbrida Transformer-Mamba, com 55 bilhões ativos por inferência, segundo a descrição da NVIDIA no catálogo.

Vale a pena trocar Claude ou GPT pelo Nemotron free?

Só para experimentação e workloads não-críticos. O catálogo não publicou índice de inteligência, notas de coding e agentic, velocidade nem corte de conhecimento — então não dá para comparar com Claude Fable 5, Gemini 3.1 Pro ou GPT-5.3-Codex sem medir por conta própria.

Leia também