Nemotron 3 Ultra cobra US$ 2,40/M, mas perde em inteligência para rivais mais baratos
Modelo da NVIDIA chega com 55B ativos em MoE de 550B, pesos abertos e arquitetura Transformer-Mamba, mas o índice de inteligência de 38,319 fica quase 10 pontos abaixo do Gemini 3.1 Pro.
O preço de tabela do Nemotron 3 Ultra, novo modelo da NVIDIA, é US$ 2,40 por milhão de tokens de saída. Pesos abertos, 55 bilhões de parâmetros ativos em 550 bilhões totais, arquitetura híbrida Transformer-Mamba. À primeira vista, parece a jogada da NVIDIA para entrar no mercado de reasoning. Mas o índice de inteligência de 38,319 deixa claro que essa não é a briga pelo topo — e tem rivais acima de IQ 45 cobrando menos.
O índice de inteligência não segura o topo
A régua do Artificial Analysis, medida hoje, coloca o Gemini 3.1 Pro Preview do Google na frente, com 47,738. O Nemotron 3 Ultra marca 38,319 — quase 10 pontos atrás. O GPT-5.3-Codex, da OpenAI, está em 45,512. O Gemini 3.5 Flash, em 46,673. São modelos de outra faixa em capacidade geral, e o NVIDIA entra nesse pacote com o índice mais baixo entre os reasoning models do momento.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiniMax M3 | 45.4 | 1.2 |
| DeepSeek V4 Pro 0423 | 45.3 | 2.0845 |
Onde o Nemotron se sustenta é em coding: 49,265, acima de praticamente todo o catálogo. Em agentic, cai para 27,498 — abaixo do esperado para um reasoning desse porte. É um modelo forte em código, com gargalo em tarefas autônomas longas.
Preço não é tão agressivo quanto parece
US$ 2,40 por milhão de tokens de saída parece competitivo, mas o catálogo já tem rivais acima de IQ 45 cobrando menos. O MiniMax M3 sai por US$ 1,20 e marca 45,397. O DeepSeek V4 Pro sai por US$ 1,74 e marca 45,268. Para quem compra API por inteligência entregue por dólar, a conta fecha contra o NVIDIA.
A defesa do Nemotron está nos pesos abertos. Se você quer hospedar um MoE de 550B na sua infraestrutura em GPU, US$ 2,40/M vira referência de preço — não da fatura da API, mas do valor de self-host. Quem não vai rodar localmente paga API e deveria olhar para o DeepSeek V4 Pro ou MiniMax M3 antes.
A família do dia
NVIDIA não soltou só o flagship. Vieram mais três no mesmo pacote:
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Nemotron 3 Ultra (free) | 0 | 0 | 1M |
| Nemotron 3 Ultra (batch) | 0.6 | 3.6 | 512k |
| Nemotron 3.5 Content Safety | 0 | 0 | 128k |
- Nemotron 3 Ultra (batch): mesmo modelo, contexto expandido para 512.288 tokens, saída a US$ 3,60/M — 50% mais caro pela janela extra.
- Nemotron 3 Ultra (free): grátis, contexto de 1.000.000 de tokens. É a oferta mais generosa em janela do dia para prototipar.
- Nemotron 3.5 Content Safety (free): versão de moderação, grátis, contexto de 128.000 tokens.
A versão gratuita com 1M de contexto é o chamariz. Para testar raciocínio em janelas grandes sem abrir a carteira, é o que tem de mais largo no catálogo.
Para quem vale, para quem não vale
Vale para você se: roda GPU própria, precisa de pesos abertos de um MoE pesado e o caso de uso é code-heavy. O índice de coding de 49,265 sustenta code completion e code review com folga.
Não vale para você se: está comprando API por inteligência pura. Pelo mesmo preço ou menos, MiniMax M3 (US$ 1,20/M) e DeepSeek V4 Pro (US$ 1,74/M) entregam mais IQ por token. Se o fluxo é agentic — tool use pesado, chamadas em loop — os 27,498 do Nemotron desclassificam.
A implicação prática
Antes de colocar o Nemotron 3 Ultra no pipeline, faça três perguntas sobre o seu caso de uso. Tarefa code-heavy? O índice de coding de 49,265 sustenta. Fluxo agentic com tool use pesado? Os 27,498 desclassificam. Raciocínio geral acima de IQ 45? Vai de MiniMax M3 a US$ 1,20/M ou DeepSeek V4 Pro a US$ 1,74/M. Pesos abertos é argumento para quem hospeda — para quem consome API, o Nemotron perde em IQ por dólar para quem cobra US$ 1,20 ou US$ 1,74/M.
Se você consome API por inteligência, pule o Nemotron 3 Ultra e vá de MiniMax M3 ou DeepSeek V4 Pro, que custam metade e rendem mais IQ; o NVIDIA só compensa para quem vai hospedar o MoE de 550B localmente em GPU e usa em código.
Perguntas frequentes
Quanto custa o Nemotron 3 Ultra da NVIDIA?
A versão padrão sai por US$ 0,60 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída, com cache a US$ 0,12/M. Existe tier gratuito com contexto de 1 milhão de tokens e versão batch a US$ 3,60/M de saída com janela de 512K.
O Nemotron 3 Ultra é melhor que o Gemini 3.1 Pro?
Não pelo índice de inteligência geral: o Gemini 3.1 Pro Preview marca 47,738 contra 38,319 do Nemotron, quase 10 pontos de diferença. O Nemotron empata em open weights e ganha em coding (49,265), mas perde em agentic (27,498).
Quando faz sentido usar o Nemotron 3 Ultra?
Quando você roda GPU própria, quer pesos abertos de um MoE de 550B e a tarefa é code-heavy. Para API consumida por inteligência geral ou agentic, MiniMax M3 e DeepSeek V4 Pro custam menos e rendem mais no índice geral.