Nemotron 3 Ultra chega a US$ 2,40 de saída e mira coding, não topo de inteligência
Modelo aberto da NVIDIA estreia com 55B ativos em 550B totais, preço competitivo e foco em código e agentes — mas fica abaixo do pelotão de elite em IQ
O que a NVIDIA está vendendo — e o que ela não está
A NVIDIA soltou hoje o Nemotron 3 Ultra e o discurso oficial é de "modelo de fronteira aberto para raciocínio e orquestração". Traduzindo: é um MoE híbrido Transformer-Mamba com 55 bilhões de parâmetros ativos sobre 550 bilhões no total, aberto, focado em raciocínio, e vendido a US$ 0,60 o milhão de tokens de entrada e US$ 2,40 o de saída. O cache sai por US$ 0,12 — uma das peças mais baratas do mercado para reusar contexto.
Esse preço de saída coloca o Nemotron 3 Ultra no mesmo patamar do Qwen3.7 Plus (US$ 1,28) e bem abaixo do Gemini 3.5 Flash (US$ 9). Só que, para entender se vale a pena, o número que importa não é esse.
A conta que ninguém faz no release
O índice de inteligência do Nemotron 3 Ultra hoje é 38,3. Em outras palavras: ele não entra no top 5. O topo do catálogo nesta data é do Gemini 3.1 Pro Preview, com 47,7, seguido por Gemini 3.5 Flash (46,7), GPT-5.3-Codex (45,5), MiniMax M3 (45,4) e DeepSeek V4 Pro (45,3). Em IQ, o Nemotron fica mais perto do MiMo-V2.5 (38,0) do que de qualquer coisa que dispute a ponta.
Mas tem um porém: a nota de coding é 49,3 — a mais alta entre os pares diretos. O Qwen3.7 Plus marca 55,9 nesse quesito, o MiMo-V2.5-Pro chega a 60,2 e o MiMo-V2.5 a 56,8. Em agentic, o Nemotron 3 Ultra faz 27,5, acima do MiMo-V2.5 (24,4) e do Qwen3.7 Plus (20,7), mas abaixo do MiMo-V2.5-Pro (29,5).
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Nemotron 3 Ultra (o novo) | 38.3 | 0.6 | 2.4 | 262k |
| MiMo-V2.5 | 38.0 | 0.14 | 0.28 | 1.05M |
| MiMo-V2-Flash | 34.0 | 0.1 | 0.3 | 262k |
| MiMo-V2.5-Pro | 42.9 | 0.435 | 0.87 | 1.05M |
| Qwen3.7 Plus | 39.4 | 0.32 | 1.28 | 1M |
Para quem esse modelo faz sentido
Se você está montando pipeline de código com orçamento apertado, faz sentido testar. O Nemotron 3 Ultra entrega nota de coding superior à do MiMo-V2.5-Pro em agentic? Não — mas custa US$ 2,40 contra US$ 0,87 de saída do Xiaomi Pro, então a conta precisa ser feita em volume.
Se você precisa de raciocínio de fronteira, não é aqui. O IQ 38,3 está fora do pelotão que decide benchmarks pesados hoje. Para isso, o catálogo ainda aponta Gemini 3.1 Pro Preview, GPT-5.3-Codex ou, no segmento de bom custo-benefício acima de IQ 45, o MiniMax M3 (US$ 1,20 de saída) e o DeepSeek V4 Pro (US$ 1,74).
O que ele tem que os pares chineses não
Dois pontos separam o Nemotron 3 Ultra da turma da Xiaomi e da Alibaba: origem americana (importa para contratos com cláusulas de jurisdição) e pesos abertos com 55B ativos — você pode hospedar, ajustar, fine-tunar. O MiMo-V2.5-Pro também é aberto, mas é chinês; o Qwen3.7 Plus nem é aberto. A velocidade reportada é 116 tokens por segundo, mais que o dobro do MiMo-V2.5-Pro (34) e bem acima do Qwen3.7 Plus (57).
| Campo | Valor |
|---|---|
| Identificador | nvidia/nemotron-3-ultra-550b-a55b |
| Criador | nvidia |
| Preço de entrada | US$ 0.600 / M tokens |
| Preço de saída | US$ 2.40 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.120 / M (80% de desconto) |
| Índice de inteligência (AA) | 38.3 |
| Índice de código | 49.3 |
| Índice agêntico | 27.5 |
| Parâmetros | 550B (55B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 116 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
Quando NÃO vale a pena
- Se você já roda Gemini 3.5 Flash ou DeepSeek V4 Pro por API, o salto de IQ não compensa trocar.
- Se seu caso é multimodal (imagem, áudio, vídeo), o Nemotron 3 Ultra é text→text puro — o MiMo-V2.5 é omnimodal nativo.
- Se você precisa de contexto de 1M tokens, ele só entrega 262k — Qwen3.7 Plus e MiMo-V2.5 chegam a 1M.
O tabuleiro hoje
O catálogo tem 459 modelos listados, 61 criadores, e 23 lançamentos nos últimos 30 dias. Em outras palavras: o mercado não está parado, e o Nemotron 3 Ultra entra como mais uma opção de nicho — não como evento de topo.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiniMax M3 | 45.4 | 1.2 |
| DeepSeek V4 Pro 0423 | 45.3 | 2.0845 |
O que você faz com isso: rode o Nemotron 3 Ultra em workload de código onde o orçamento pesa mais que a nota bruta de inteligência, e mantenha um modelo de IQ 45+ no caminho crítico. Para contratos que exigem jurisdição americana e pesos abertos, ele vira default; para o resto, é mais um na prateleira.
Use Nemotron 3 Ultra em coding e agentes onde o orçamento pesa e a origem americana importa; para raciocínio de fronteira, continue pagando Gemini, GPT-5.3 ou DeepSeek V4 Pro.
Perguntas frequentes
Quanto custa o Nemotron 3 Ultra por milhão de tokens?
US$ 0,60 de entrada, US$ 2,40 de saída e US$ 0,12 de cache por milhão de tokens. É mais barato que o Gemini 3.5 Flash (US$ 9 de saída), mas mais caro que o MiniMax M3 (US$ 1,20) e o DeepSeek V4 Pro (US$ 1,74).
O Nemotron 3 Ultra é melhor que o Qwen3.7 Plus para código?
Não. O Qwen3.7 Plus marca 55,9 em coding contra 49,3 do Nemotron 3 Ultra, e custa metade do preço de saída. O ponto do Nemotron está em agentic (27,5 vs 20,7) e em ser modelo aberto americano.
O Nemotron 3 Ultra entra no topo de inteligência?
Não. O índice de inteligência dele hoje é 38,3, fora do top 5 do catálogo. O topo é Gemini 3.1 Pro Preview (47,7), Gemini 3.5 Flash (46,7), GPT-5.3-Codex (45,5), MiniMax M3 (45,4) e DeepSeek V4 Pro (45,3).