Nemotron Super 49B custa o triplo do gpt-oss-20b e perde em inteligência
NVIDIA lançou ontem um derivado do Llama 3.3 70B focado em tool calling — mas no comparativo direto de preço e IQ, o modelo da OpenAI ainda reina na faixa aberta.
Ontem a NVIDIA colocou no catálogo um modelo de 49B parâmetros derivado do Llama 3.3 70B da Meta, pós-treinado para fluxos agenticos. À primeira vista parece boa notícia: open weights, contexto de 128K, raciocínio ligado, país de origem EUA. O problema aparece quando você coloca o preço ao lado do que já estava sentado na mesma prateleira.
O Nemotron Super 49B V1.5 cobra US$ 0,40 por milhão de tokens tanto na entrada quanto na saída. Parece razoável. Mas olhe o gpt-oss-20b da OpenAI, lançado em agosto: cobra US$ 0,13 por milhão na saída, e ainda oferece leitura em cache por US$ 0,03. Para fluxos com prompt grande e repetido, a diferença estoura a conta no fim do mês. Aliás, o Nemotron nem publica preço de cache no catálogo — quem for usar precisa negociar ou medir por conta.
E não é só preço. No índice de inteligência medido hoje, o gpt-oss-20b marca 15,2 contra 12,4 do Nemotron 49B. Você paga três vezes mais por saída e ainda recebe um modelo com nota menor.
O que a NVIDIA está vendendo aqui
Não é um modelo genérico. A ficha técnica diz, sem rodeio, que o pós-treinamento foi feito via SFT em matemática, código, ciência e fluxos agenticos — RAG, tool calling. É um cavalo de batalha para quem monta pipeline de agentes, não um conversacional de bate-pronto.
A herança do Llama 3.3 70B Instruct aparece no corte de conhecimento: março de 2024, três meses antes do gpt-oss-20b. E a descrição marca o modelo como English-centric, termo que no jargão costuma significar que funciona em outros idiomas, mas não foi pensado para eles.
Onde o Nemotron 49B faz sentido
A NVIDIA tem um trunfo que não aparece no comparativo de API: open weights. Quem roda o modelo no próprio cluster, em GPU própria, paga a conta de infraestrutura uma vez e pode servir requisições sem tarifa por token. Aí o cálculo muda — e a NVIDIA, que vende as GPUs onde esse modelo roda, sabe bem disso.
Para o desenvolvedor que está decidindo entre chamar API ou self-host, a conta é outra: 49B parâmetros densos rodam em uma única GPU de datacenter com quantização decente, e o Nemotron vira alternativa ao Llama 4 Maverick (402B totais, 17B ativos) se você não quiser encarar mixture-of-experts.
Onde o Nemotron 49B não vale o esforço
Três cenários em que você passa direto:
- Precisa de multimodalidade. O Nemotron é text-only. Llama 4 Scout e Maverick aceitam imagem.
- O trabalho é multilíngue sério. English-centric é inglês primeiro; outros idiomas são bônus, não prioridade.
- Você está atrás de topo de raciocínio. O o3 da OpenAI, hoje com IQ 31,1 e US$ 8 por milhão de saída, é outra liga — e o gpt-oss-120b (IQ 24,1 a US$ 0,17) senta num degrau intermediário que o Nemotron não alcança.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Llama 3.3 Nemotron Super 49B (o novo) | 12.4 | 0.4 | 0.4 | 131k |
| gpt-oss-20b | 15.2 | 0.03 | 0.13 | 131k |
| Nemotron Nano 9B V2 | 8.7 | 0.04 | 0.16 | 131k |
| Llama 4 Scout | 10.3 | 0.1 | 0.3 | 1.31M |
| Llama 3.3 70B Instruct | 9.3 | 0.1 | 0.32 | 131k |
O tabuleiro em 11 de outubro
O catálogo soma mais de 250 modelos nesta sexta-feira, com 26 lançamentos só nos últimos 30 dias. O topo do ranking de inteligência hoje é o3, seguido de gpt-oss-120b e Qwen3 Next 80B Thinking. O Nemotron Super 49B entra na faixa dos 12 — território do Llama 4 Maverick (14,5) e do gpt-oss-20b (15,2), só que mais caro que os dois.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
A NVIDIA não está tentando ganhar a corrida de API. Está colocando mais uma peça no ecossistema aberto para quem já tem hardware NVIDIA e quer um modelo afinado para agente. Se esse é o seu caso, vale testar. Se não é, o gpt-oss-20b segue sendo a resposta de bolso — e o gpt-oss-120b, a de meio de campo.
Via API, escolha gpt-oss-20b; via self-host em GPU NVIDIA com foco em agente, teste o Nemotron Super 49B antes de mirar o Llama 4 Maverick.
Perguntas frequentes
O que é o NVIDIA Llama 3.3 Nemotron Super 49B V1.5?
É um modelo denso de 49 bilhões de parâmetros com pesos abertos, derivado do Llama 3.3 70B Instruct da Meta e pós-treinado pela NVIDIA para fluxos agenticos como RAG e tool calling. Tem 128K de contexto, raciocínio ligado e foi listado no catálogo em 10 de outubro de 2025.
Nemotron 49B ou gpt-oss-20b: qual escolher via API?
Via API, gpt-oss-20b: custa US$ 0,13 por milhão de tokens de saída contra US$ 0,40 do Nemotron, e ainda marca IQ 15,2 contra 12,4. A diferença só se inverte quando você roda o modelo localmente em hardware próprio, cenário em que o open weights da NVIDIA começa a compensar.
Quando faz sentido rodar o Nemotron 49B self-hosted?
Quando você já tem GPU NVIDIA no cluster, precisa de um modelo denso de 49B (sem MoE) e quer evitar tarifas de API em volume alto. Para multimodalidade ou tarefas multilíngues, vale olhar Llama 4 Scout/Maverick ou modelos de outras famílias.