FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Nemotron 49B chega por US$ 0,40/M e fica no meio de tabela

O modelo da NVIDIA tem pesos abertos e 128K de contexto, mas custa mais que o dobro do gpt-oss-120b por um índice de inteligência menor.

Redação FalaVIP IA 3 min de leitura
US$ 0,40por milhão de tokens de entrada e saída
12,4índice de inteligência (Artificial Analysis)
49Bparâmetros, destilados de um modelo de 70B

O número que precisa ser examinado

A NVIDIA colocou hoje no catálogo um modelo "Super" que custa US$ 0,40 por milhão de tokens de entrada e a mesma coisa na saída. Em um mercado onde o topo do índice de inteligência gira entre US$ 0,17 e US$ 8 por milhão de saída, o 0,40 parece modesto. Só que não é o mais barato da prateleira. E o índice de inteligência, 12,4, deixa claro que também não é o mais brilhante.

O Llama 3.3 Nemotron Super 49B V1.5 é uma destilação de um modelo de 70B do Meta com 49B ativos, janela de 128K tokens, recorte de conhecimento em março de 2024 e treinamento extra para fluxos agentic — RAG, tool calling, esse tipo de coisa. Texto indo e voltando, sem multimodal, e com peso aberto, então roda em GPU única se você quiser colocar na sua própria infra.

Ficha técnica — Llama 3.3 Nemotron Super 49B
CampoValor
Identificadornvidia/llama-3.3-nemotron-super-49b-v1.5
Criadornvidia
Preço de entradaUS$ 0.400 / M tokens
Preço de saídaUS$ 0.400 / M tokens
Janela de contexto131k
Modalidadetext->text
Índice de inteligência (AA)12.4
Parâmetros49B (49B ativos por token)
Pesosabertos
Velocidade de saída53 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

O que o release diz vs. o que o índice mostra

A NVIDIA fala em "post-trained for agentic workflows". O índice de inteligência, na medição de hoje, marca 12,4. O o3, da OpenAI, está em 31,1. O gpt-oss-120b, também da OpenAI, está em 24,1. O Qwen3 Next 80B A3B Thinking, em 16,9. O Nemotron entra abaixo dos três — e também abaixo do Llama 4 Maverick, da Meta, que marca 14,5.

Isso não é demérito automático. Pense no catálogo como uma prateleira de supermercado: o o3 é o cortes mais caro da casa, custando US$ 8 por milhão de saída, vinte vezes mais que o Nemotron. Se o seu prato não precisa do melhor corte, pagar vinte vezes menos por uma carne decente faz sentido. O problema é o pacote da marca ao lado: o gpt-oss-120b custa US$ 0,17 por milhão de saída — menos da metade — e entrega quase o dobro de inteligência no índice.

Inteligência × preço de saída
Llama 3.3 Nemotron Super 49Bo3gpt-oss-120bQwen3 Next 80B A3B ThinkingUS$ por milhão (saída, escala log)índice de inteligência

Onde a NVIDIA realmente briga

O ângulo que não está no preço é a portabilidade. 49 bilhões de parâmetros cabem em uma única GPU H100, ou em uma A100 com quantização. Os pesos são abertos, então o developer que quer hospedar o modelo dentro da empresa, sem mandar prompt para API de terceiro, tem aqui uma opção viável. O cache de prompt não tem preço publicado no catálogo — o que significa que você não vai conseguir comparar centavos com os concorrentes nesse quesito, e é um ponto de atenção para workloads com prefixo repetido.

A velocidade reportada no catálogo é 52,85 tokens por segundo, e o modelo é marcado como "reasoning", o que normalmente significa que o tempo de resposta varia conforme o tamanho do raciocínio. Para tool calling em RAG, onde cada chamada consome poucos milhares de tokens, esse tempo não pesa tanto.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Llama 3.3 Nemotron Super 49B (o novo)12.40.40.4131k
o331.128200k
gpt-oss-120b24.10.0370.17131k
Qwen3 Next 80B A3B Thinking16.90.151.2262k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Para quem esse modelo faz sentido

Se você está montando um agente que consome documento, faz busca, chama ferramenta e devolve resposta curta, o Nemotron 49B entra na conta. A janela de 128K é a mesma do Llama 3.3 original, então cabe um documento grande sem fatiar. O preço de US$ 0,40 nos dois lados é honesto — não é promoção, mas é competitivo para uma chamada de API gerenciada.

Se a sua prioridade é a melhor nota de inteligência pelo menor dólar, o gpt-oss-120b segue sendo a referência no catálogo. Se você quer o teto de raciocínio sem olhar preço, o3. Se você precisa de pesos abertos mas o orçamento fala mais alto, o gpt-oss-120b também é aberto e mais barato.

Preço de saída (US$ por milhão de tokens)
Llama 3.3 Nemotron Super 49B0,4o38gpt-oss-120b0,17Qwen3 Next 80B A3B Thinking1,2US$/M
Fonte: OpenRouter

O tabuleiro depois de hoje

O catálogo está com 253 modelos de 40 criadores diferentes. Nos últimos 30 dias, 29 modelos novos entraram. A NVIDIA entra com um modelo que não lidera nem em inteligência nem em preço, mas ocupa um nicho específico: peso aberto, agentic, janela grande, preço de meio de tabela. É o tipo de lançamento que não muda o topo do ranking, mas dá mais uma opção na prateleira do developer que está decidindo entre hospedar e terceirizar.

A pergunta prática que fica: o seu workload de agente é pesado o suficiente para justificar rodar um 49B na sua infra, ou você prefere pagar US$ 0,17 por milhão no gpt-oss-120b e esquecer GPU? Para a maioria dos casos, a resposta vai ser a segunda. Para quem precisa de peso aberto acima de tudo, o Nemotron entra na lista — mas entra atrás.

Em uma frase

Se você quer o melhor custo-benefício do catálogo, fique no gpt-oss-120b; o Nemotron 49B vale a pena quando o requisito de peso aberto é não negociável e a infraestrutura para rodar 49B já está pronta.

Perguntas frequentes

Quanto custa o NVIDIA Nemotron Super 49B por milhão de tokens?

Custa US$ 0,40 por milhão de tokens de entrada e a mesma coisa na saída. O preço de cache de prompt não foi publicado no catálogo, então não dá para comparar esse quesito com os concorrentes.

O Nemotron Super 49B é open source?

Os pesos são abertos (open weights), então você pode baixar e rodar o modelo na sua própria infraestrutura. Já o preço de API no catálogo é de US$ 0,40 por milhão de tokens nos dois sentidos.

O que diferencia o Nemotron 49B do gpt-oss-120b?

O gpt-oss-120b tem índice de inteligência de 24,1 contra 12,4 do Nemotron, e custa menos na API (US$ 0,17/M de saída contra US$ 0,40/M). A diferença a favor do Nemotron está no treinamento explícito para fluxos agentic e no tamanho de 49B, que é mais fácil de hospedar em uma única GPU.

Leia também