Nemotron 49B chega por US$ 0,40/M e fica no meio de tabela
O modelo da NVIDIA tem pesos abertos e 128K de contexto, mas custa mais que o dobro do gpt-oss-120b por um índice de inteligência menor.
O número que precisa ser examinado
A NVIDIA colocou hoje no catálogo um modelo "Super" que custa US$ 0,40 por milhão de tokens de entrada e a mesma coisa na saída. Em um mercado onde o topo do índice de inteligência gira entre US$ 0,17 e US$ 8 por milhão de saída, o 0,40 parece modesto. Só que não é o mais barato da prateleira. E o índice de inteligência, 12,4, deixa claro que também não é o mais brilhante.
O Llama 3.3 Nemotron Super 49B V1.5 é uma destilação de um modelo de 70B do Meta com 49B ativos, janela de 128K tokens, recorte de conhecimento em março de 2024 e treinamento extra para fluxos agentic — RAG, tool calling, esse tipo de coisa. Texto indo e voltando, sem multimodal, e com peso aberto, então roda em GPU única se você quiser colocar na sua própria infra.
| Campo | Valor |
|---|---|
| Identificador | nvidia/llama-3.3-nemotron-super-49b-v1.5 |
| Criador | nvidia |
| Preço de entrada | US$ 0.400 / M tokens |
| Preço de saída | US$ 0.400 / M tokens |
| Janela de contexto | 131k |
| Modalidade | text->text |
| Índice de inteligência (AA) | 12.4 |
| Parâmetros | 49B (49B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 53 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
O que o release diz vs. o que o índice mostra
A NVIDIA fala em "post-trained for agentic workflows". O índice de inteligência, na medição de hoje, marca 12,4. O o3, da OpenAI, está em 31,1. O gpt-oss-120b, também da OpenAI, está em 24,1. O Qwen3 Next 80B A3B Thinking, em 16,9. O Nemotron entra abaixo dos três — e também abaixo do Llama 4 Maverick, da Meta, que marca 14,5.
Isso não é demérito automático. Pense no catálogo como uma prateleira de supermercado: o o3 é o cortes mais caro da casa, custando US$ 8 por milhão de saída, vinte vezes mais que o Nemotron. Se o seu prato não precisa do melhor corte, pagar vinte vezes menos por uma carne decente faz sentido. O problema é o pacote da marca ao lado: o gpt-oss-120b custa US$ 0,17 por milhão de saída — menos da metade — e entrega quase o dobro de inteligência no índice.
Onde a NVIDIA realmente briga
O ângulo que não está no preço é a portabilidade. 49 bilhões de parâmetros cabem em uma única GPU H100, ou em uma A100 com quantização. Os pesos são abertos, então o developer que quer hospedar o modelo dentro da empresa, sem mandar prompt para API de terceiro, tem aqui uma opção viável. O cache de prompt não tem preço publicado no catálogo — o que significa que você não vai conseguir comparar centavos com os concorrentes nesse quesito, e é um ponto de atenção para workloads com prefixo repetido.
A velocidade reportada no catálogo é 52,85 tokens por segundo, e o modelo é marcado como "reasoning", o que normalmente significa que o tempo de resposta varia conforme o tamanho do raciocínio. Para tool calling em RAG, onde cada chamada consome poucos milhares de tokens, esse tempo não pesa tanto.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Llama 3.3 Nemotron Super 49B (o novo) | 12.4 | 0.4 | 0.4 | 131k |
| o3 | 31.1 | 2 | 8 | 200k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
| Qwen3 Next 80B A3B Thinking | 16.9 | 0.15 | 1.2 | 262k |
Para quem esse modelo faz sentido
Se você está montando um agente que consome documento, faz busca, chama ferramenta e devolve resposta curta, o Nemotron 49B entra na conta. A janela de 128K é a mesma do Llama 3.3 original, então cabe um documento grande sem fatiar. O preço de US$ 0,40 nos dois lados é honesto — não é promoção, mas é competitivo para uma chamada de API gerenciada.
Se a sua prioridade é a melhor nota de inteligência pelo menor dólar, o gpt-oss-120b segue sendo a referência no catálogo. Se você quer o teto de raciocínio sem olhar preço, o3. Se você precisa de pesos abertos mas o orçamento fala mais alto, o gpt-oss-120b também é aberto e mais barato.
O tabuleiro depois de hoje
O catálogo está com 253 modelos de 40 criadores diferentes. Nos últimos 30 dias, 29 modelos novos entraram. A NVIDIA entra com um modelo que não lidera nem em inteligência nem em preço, mas ocupa um nicho específico: peso aberto, agentic, janela grande, preço de meio de tabela. É o tipo de lançamento que não muda o topo do ranking, mas dá mais uma opção na prateleira do developer que está decidindo entre hospedar e terceirizar.
A pergunta prática que fica: o seu workload de agente é pesado o suficiente para justificar rodar um 49B na sua infra, ou você prefere pagar US$ 0,17 por milhão no gpt-oss-120b e esquecer GPU? Para a maioria dos casos, a resposta vai ser a segunda. Para quem precisa de peso aberto acima de tudo, o Nemotron entra na lista — mas entra atrás.
Se você quer o melhor custo-benefício do catálogo, fique no gpt-oss-120b; o Nemotron 49B vale a pena quando o requisito de peso aberto é não negociável e a infraestrutura para rodar 49B já está pronta.
Perguntas frequentes
Quanto custa o NVIDIA Nemotron Super 49B por milhão de tokens?
Custa US$ 0,40 por milhão de tokens de entrada e a mesma coisa na saída. O preço de cache de prompt não foi publicado no catálogo, então não dá para comparar esse quesito com os concorrentes.
O Nemotron Super 49B é open source?
Os pesos são abertos (open weights), então você pode baixar e rodar o modelo na sua própria infraestrutura. Já o preço de API no catálogo é de US$ 0,40 por milhão de tokens nos dois sentidos.
O que diferencia o Nemotron 49B do gpt-oss-120b?
O gpt-oss-120b tem índice de inteligência de 24,1 contra 12,4 do Nemotron, e custa menos na API (US$ 0,17/M de saída contra US$ 0,40/M). A diferença a favor do Nemotron está no treinamento explícito para fluxos agentic e no tamanho de 49B, que é mais fácil de hospedar em uma única GPU.