FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Nemotron Super 49B custa o triplo do gpt-oss-20b e perde em inteligência

NVIDIA lançou ontem um derivado do Llama 3.3 70B focado em tool calling — mas no comparativo direto de preço e IQ, o modelo da OpenAI ainda reina na faixa aberta.

Redação FalaVIP IA 3 min de leitura
US$ 0,40por milhão de tokens de saída no Nemotron Super 49B
US$ 0,13por milhão de tokens de saída no gpt-oss-20b (cerca de 3x mais barato)
12,4 vs 15,2índice de inteligência: Nemotron 49B fica abaixo do gpt-oss-20b

Ontem a NVIDIA colocou no catálogo um modelo de 49B parâmetros derivado do Llama 3.3 70B da Meta, pós-treinado para fluxos agenticos. À primeira vista parece boa notícia: open weights, contexto de 128K, raciocínio ligado, país de origem EUA. O problema aparece quando você coloca o preço ao lado do que já estava sentado na mesma prateleira.

Preço de saída (US$ por milhão de tokens)
Llama 3.3 Nemotron Super 49B0,4gpt-oss-20b0,13Nemotron Nano 9B V20,16Llama 4 Scout0,3Llama 3.3 70B Instruct0,32US$/M
Fonte: OpenRouter

O Nemotron Super 49B V1.5 cobra US$ 0,40 por milhão de tokens tanto na entrada quanto na saída. Parece razoável. Mas olhe o gpt-oss-20b da OpenAI, lançado em agosto: cobra US$ 0,13 por milhão na saída, e ainda oferece leitura em cache por US$ 0,03. Para fluxos com prompt grande e repetido, a diferença estoura a conta no fim do mês. Aliás, o Nemotron nem publica preço de cache no catálogo — quem for usar precisa negociar ou medir por conta.

E não é só preço. No índice de inteligência medido hoje, o gpt-oss-20b marca 15,2 contra 12,4 do Nemotron 49B. Você paga três vezes mais por saída e ainda recebe um modelo com nota menor.

Inteligência × preço de saída
Llama 3.3 Nemotron Super 49Bgpt-oss-20bNemotron Nano 9B V2Llama 4 ScoutLlama 3.3 70B InstructUS$ por milhão (saída, escala log)índice de inteligência

O que a NVIDIA está vendendo aqui

Não é um modelo genérico. A ficha técnica diz, sem rodeio, que o pós-treinamento foi feito via SFT em matemática, código, ciência e fluxos agenticos — RAG, tool calling. É um cavalo de batalha para quem monta pipeline de agentes, não um conversacional de bate-pronto.

A herança do Llama 3.3 70B Instruct aparece no corte de conhecimento: março de 2024, três meses antes do gpt-oss-20b. E a descrição marca o modelo como English-centric, termo que no jargão costuma significar que funciona em outros idiomas, mas não foi pensado para eles.

Onde o Nemotron 49B faz sentido

A NVIDIA tem um trunfo que não aparece no comparativo de API: open weights. Quem roda o modelo no próprio cluster, em GPU própria, paga a conta de infraestrutura uma vez e pode servir requisições sem tarifa por token. Aí o cálculo muda — e a NVIDIA, que vende as GPUs onde esse modelo roda, sabe bem disso.

Para o desenvolvedor que está decidindo entre chamar API ou self-host, a conta é outra: 49B parâmetros densos rodam em uma única GPU de datacenter com quantização decente, e o Nemotron vira alternativa ao Llama 4 Maverick (402B totais, 17B ativos) se você não quiser encarar mixture-of-experts.

Onde o Nemotron 49B não vale o esforço

Três cenários em que você passa direto:

  • Precisa de multimodalidade. O Nemotron é text-only. Llama 4 Scout e Maverick aceitam imagem.
  • O trabalho é multilíngue sério. English-centric é inglês primeiro; outros idiomas são bônus, não prioridade.
  • Você está atrás de topo de raciocínio. O o3 da OpenAI, hoje com IQ 31,1 e US$ 8 por milhão de saída, é outra liga — e o gpt-oss-120b (IQ 24,1 a US$ 0,17) senta num degrau intermediário que o Nemotron não alcança.
Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Llama 3.3 Nemotron Super 49B (o novo)12.40.40.4131k
gpt-oss-20b15.20.030.13131k
Nemotron Nano 9B V28.70.040.16131k
Llama 4 Scout10.30.10.31.31M
Llama 3.3 70B Instruct9.30.10.32131k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

O tabuleiro em 11 de outubro

O catálogo soma mais de 250 modelos nesta sexta-feira, com 26 lançamentos só nos últimos 30 dias. O topo do ranking de inteligência hoje é o3, seguido de gpt-oss-120b e Qwen3 Next 80B Thinking. O Nemotron Super 49B entra na faixa dos 12 — território do Llama 4 Maverick (14,5) e do gpt-oss-20b (15,2), só que mais caro que os dois.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 253 modelos disponíveis no catálogo nesta data.

A NVIDIA não está tentando ganhar a corrida de API. Está colocando mais uma peça no ecossistema aberto para quem já tem hardware NVIDIA e quer um modelo afinado para agente. Se esse é o seu caso, vale testar. Se não é, o gpt-oss-20b segue sendo a resposta de bolso — e o gpt-oss-120b, a de meio de campo.

Em uma frase

Via API, escolha gpt-oss-20b; via self-host em GPU NVIDIA com foco em agente, teste o Nemotron Super 49B antes de mirar o Llama 4 Maverick.

Perguntas frequentes

O que é o NVIDIA Llama 3.3 Nemotron Super 49B V1.5?

É um modelo denso de 49 bilhões de parâmetros com pesos abertos, derivado do Llama 3.3 70B Instruct da Meta e pós-treinado pela NVIDIA para fluxos agenticos como RAG e tool calling. Tem 128K de contexto, raciocínio ligado e foi listado no catálogo em 10 de outubro de 2025.

Nemotron 49B ou gpt-oss-20b: qual escolher via API?

Via API, gpt-oss-20b: custa US$ 0,13 por milhão de tokens de saída contra US$ 0,40 do Nemotron, e ainda marca IQ 15,2 contra 12,4. A diferença só se inverte quando você roda o modelo localmente em hardware próprio, cenário em que o open weights da NVIDIA começa a compensar.

Quando faz sentido rodar o Nemotron 49B self-hosted?

Quando você já tem GPU NVIDIA no cluster, precisa de um modelo denso de 49B (sem MoE) e quer evitar tarifas de API em volume alto. Para multimodalidade ou tarefas multilíngues, vale olhar Llama 4 Scout/Maverick ou modelos de outras famílias.

Leia também