FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Nemotron 3 Ultra batch custa R$? O preço que a NVIDIA não grita no release

A versão batch do novo modelo MoE da NVIDIA sai por US$ 3,60 por milhão de tokens de saída — e o detalhe promocional é o que muda a conta.

Redação FalaVIP IA 3 min de leitura
US$ 3,60por milhão de tokens de saída na versão batch
US$ 0,60por milhão de tokens de entrada
US$ 0,20por milhão de tokens de cache (leitura)

Lançado há nove dias, o Nemotron 3 Ultra da NVIDIA aparece no catálogo com um sufixo que pouca gente lê com calma: batch. A diferença entre essa versão e a chamada "normal" é o que decide se ela entra ou não no seu próximo orçamento de inferência.

O que é a versão batch, na prática

Pense em batch como o equivalente a despachar uma carga inteira de caminhão em vez de fazer entrega por motoboy. Você envia um lote de requisições assíncronas, aceita um prazo maior para receber as respostas e, em troca, a NVIDIA cobra menos por token. É um trade-off clássico: tempo de resposta versus custo. Se o seu caso de uso tolera esperar — geração de datasets, classificação em massa, enriquecimento de catálogos, sumarização de backlog documental — batch é onde o custo cai de verdade.

Quanto custa, em moeda de fim de mês

A ficha do modelo no catálogo mostra três preços que merecem ser lidos juntos:

Ficha técnica — Nemotron 3 Ultra (free)
CampoValor
Identificadornvidia/nemotron-3-ultra-550b-a55b:free
Criadornvidia
Preço de entradaUS$ 0.000 / M tokens
Preço de saídaUS$ 0.000 / M tokens
Janela de contexto1M
Modalidadetext->text
  • Entrada: US$ 0,60 por milhão de tokens.
  • Saída: US$ 3,60 por milhão de tokens.
  • Cache (releitura de contexto já enviado): US$ 0,20 por milhão de tokens.

O detalhe promocional é o de cache. Quando você reaproveita um prompt gigante em várias chamadas — algo corriqueiro em RAG e em agentes que compartilham contexto — o custo de releitura cai para um terço do preço de entrada. Em workloads com muito contexto repetido, isso muda o cálculo mais do que o headline de "55B ativos de 550B totais" sugere.

Onde ele se encaixa no tabuleiro

A régua de cima do catálogo hoje é liderada pelo Claude Fable 5, da Anthropic, com índice de inteligência 62,073 e saída a US$ 50 por milhão de tokens. O Gemini 3.1 Pro Preview da Google aparece em segundo, a US$ 12. O Nemotron 3 Ultra batch entra num patamar de preço bem diferente desses dois — e é justamente aí que mora a pergunta que você precisa fazer antes de testar.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
GPT-5.3-Codex45.514
MiniMax M345.41.2
Entre os 469 modelos disponíveis no catálogo nesta data.

Para comparar o que está na faixa de IQ acima de 45 e abaixo de US$ 10 de saída, três nomes disputam a atenção: o MiniMax M3 a US$ 1,20, o DeepSeek V4 Pro a US$ 1,74 e o Gemini 3.5 Flash a US$ 9. O Nemotron batch, a US$ 3,60, fica entre o DeepSeek e o Flash — mais caro que os dois primeiros, mais barato que o terceiro. A arquitetura MoE com 55B ativos sobre 550B totais promete capacidade de fronteira; o preço promete economia. As duas promessas precisam ser testadas no seu caso antes de você migrar qualquer coisa.

Para quem vale a pena

  • Times que processam grandes volumes assíncronos. Se você já tem pipeline de jobs noturnos, classificação de tickets, geração de embeddings textuais ou enriquecimento de base, o endpoint batch paga o investimento de mexer no código.
  • Aplicações com contexto longo reaproveitado. A janela de 512 mil tokens combinada com cache a US$ 0,20 é o cenário onde o modelo entrega o melhor custo por requisição.
  • Quem quer testar capacidade de fronteira sem o preço de fronteira. É uma forma de colocar uma arquitetura MoE híbrida Transformer-Mamba no benchmark interno antes de decidir se vale subir para Claude ou Gemini Pro.

Para quem NÃO muda nada

  • Produtos com usuário esperando resposta na tela. Batch não é para latência baixa. Se o seu fluxo é chat interativo, completion em tempo real ou qualquer coisa onde o usuário percebe o delay, esse endpoint não é o caminho.
  • Times que já rodam Gemini Flash ou DeepSeek V4 Pro em volume. O ganho marginal precisa ser demonstrado em benchmark próprio, porque o preço do Nemotron batch é intermediário — não é o mais barato da prateleira.
  • Quem precisa de medições de IQ, coding ou agentic validadas. O catálogo não publicou nenhum desses índices para o Nemotron 3 Ultra batch. Comprar por capacidade sem número é comprar no escuro; rode sua suíte antes de comprometer orçamento.

O que fazer com isso na segunda-feira

Antes de qualquer migração, meça três coisas no seu workload real: quanto do seu tráfego tolera latência assíncrona, qual fração dos seus prompts reaproveita contexto entre chamadas, e qual é o custo atual por milhão de tokens mistos (entrada + saída + cache). Se a resposta para as duas primeiras for "muito" e a terceira for "alto o suficiente para doer", vale um piloto de 30 dias no endpoint batch da NVIDIA. Se qualquer uma das três não bater, o Nemotron 3 Ultra continua sendo um bom press release — e só.

Em uma frase

Batch é para jobs, não para chat: rode um piloto de 30 dias só se você tem volume assíncrono com contexto reaproveitado e quer gastar menos que Flash sem abrir mão de MoE de fronteira.

Perguntas frequentes

O que é a versão batch do Nemotron 3 Ultra?

É o mesmo modelo MoE de 55B ativos sobre 550B totais, mas exposto via endpoint assíncrono. Você envia um lote de requisições de uma vez, aceita um prazo maior para receber as respostas e paga menos por token — US$ 3,60 por milhão de saída contra US$ 3,60 do preço cheio, com cache a US$ 0,20.

Nemotron 3 Ultra batch serve para chat em tempo real?

Não. O endpoint batch é otimizado para throughput, não latência. Para produtos com usuário esperando resposta na tela, a versão síncrona ou outro modelo (Gemini Flash, Claude, DeepSeek) é o caminho.

Quanto custa em reais, aproximadamente, rodar 10 milhões de tokens de saída no batch?

Considerando US$ 3,60 por milhão e câmbio comercial de referência próximo de R$ 5,20, são cerca de R$ 187 para 10 milhões de tokens só de saída. Some entrada e cache conforme o seu padrão de tráfego para chegar no custo total.

Leia também