Nemotron 3 Nano 30B: rápido, mas pior em código que o gpt-oss-20b
O modelo MoE de pesos abertos da NVIDIA entrega 2,2x a velocidade do rival em inteligência intermediária, mas perde 30% em benchmarks de programação.
A NVIDIA soltou no domingo o Nemotron 3 Nano 30B A3B, modelo de pesos abertos com 31,6 bilhões de parâmetros totais. Parece grande, mas só 3,6 bilhões são ativados por token. É a tal arquitetura MoE: pense num time de especialistas onde só alguns respondem a cada pergunta — isso reduz custo de inferência e aumenta velocidade. Em dois dias de catálogo, ele já aparece com índice de inteligência 14,538. O número parece OK. A história toda está na velocidade: 247,99 tokens por segundo, mais que o dobro do gpt-oss-20b.
Onde ele entra na tabela
O top 5 do catálogo de dezembro de 2025 (que tem mais de 307 modelos listados) vai de 19,242 (Mistral Devstral 2 2512) até 34,024 (Xiaomi MiMo-V2-Flash). OpenAI o3 marca 31,096, Claude Haiku 4.5 fecha o pódio com 29,892. O Nemotron 3 Nano entra na faixa intermediária, com 14,538 — abaixo do gpt-oss-20b, que marca 15,225.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Nemotron 3 Nano 30B A3B (o novo) | 14.5 | 0.05 | 0.2 | 262k |
| gpt-oss-20b | 15.2 | 0.03 | 0.13 | 131k |
| Ministral 3 8B 2512 | 9.0 | 0.15 | 0.15 | 262k |
| Nemotron Nano 9B V2 | 8.7 | 0.04 | 0.16 | 131k |
| Ministral 3 14B 2512 | 11.2 | 0.2 | 0.2 | 262k |
A leitura fica mais clara quando você olha as métricas separadas:
- Inteligência geral: 14,538 (gpt-oss-20b: 15,225 — pequena desvantagem)
- Código: 14,371 (gpt-oss-20b: 20,697 — diferença de 30%)
- Agente: 1,993 (gpt-oss-20b: 3,103 — quase metade)
Se você roda modelo para gerar função, refatorar classe ou operar agente que planeja passos, o gpt-oss-20b entrega mais. O Nemotron não veio para ganhar esse jogo.
Onde ele realmente vence
A velocidade declarada é 247,99 tokens por segundo. O gpt-oss-20b fica em 112,6. É mais que o dobro — e isso muda a conta no fim do mês quando você está processando lote.
O contexto também é o dobro: 262.144 tokens contra 131.072 do rival. Para quem enfia PDFs inteiros, logs longos ou bases de código grandes, isso é a diferença entre cortar entrada e não cortar.
No preço, a NVIDIA cobra US$ 0,05 por milhão de tokens de entrada e US$ 0,20 de saída. Mais caro na saída que o gpt-oss-20b (US$ 0,13), mas o cache sai por US$ 0,025 — metade do rival. No blended, que é o custo médio real de uso, Nemotron fica em US$ 0,0875, contra US$ 0,0925 do gpt-oss-20b. Margem apertada, mas existe.
Para quem vale trocar
Se o seu gargalo é latência — chatbot respondendo em tempo real, pipeline processando milhões de tokens em fila, agente iterando rápido sem travar o usuário — o Nemotron 3 Nano ganha do gpt-oss-20b. A combinação de 2,2x mais velocidade com cache pela metade do preço compensa em qualquer workload de alto volume.
Como é de pesos abertos, dá para hospedar local e pagar só o custo de hardware. O gpt-oss-20b também é aberto, então a briga aqui é de inferência, não de licenciamento.
Para quem não muda nada
Se você já usa o gpt-oss-20b em tarefas de código, programação agêntica ou raciocínio com alta exigência, a troca é regressão. O índice de código cai 30% (de 20,7 para 14,4), o agente quase pela metade.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Os modelos da Mistral lançados no começo do mês (Ministral 3 8B e 14B) também não competem na mesma faixa — o 14B marca 11,243 de inteligência, o 8B fica em 8,974. Ambos têm contexto de 262k e visão, mas não são alternativas para workload de raciocínio.
A implicação prática
Em dezembro de 2025, com 31 modelos lançados nos últimos 30 dias, o catálogo está cheio de opções para o mesmo problema. O Nemotron 3 Nano 30B A3B não é um modelo "melhor" — é um modelo "mais rápido e mais barato no uso de alto volume". Use quando throughput e latência pesarem mais que qualidade bruta. Para o resto, o gpt-oss-20b continua sendo a referência de pesos abertos pequenos que vale considerar.
Use Nemotron 3 Nano quando latência e volume pesarem mais que qualidade bruta em código e agente; para o resto, o gpt-oss-20b ainda é a referência de pesos abertos pequenos.
Perguntas frequentes
O NVIDIA Nemotron 3 Nano 30B A3B é gratuito?
Não na API — é cobrado US$ 0,05 por milhão de tokens de entrada e US$ 0,20 de saída. Mas como tem pesos abertos, pode ser hospedado localmente sem custo de licenciamento.
Nemotron 3 Nano 30B ou gpt-oss-20b: qual escolher?
Depende da carga. Para velocidade e contexto longo (262k tokens), o Nemotron entrega 2,2x a velocidade do rival. Para tarefas de código e raciocínio agêntico, o gpt-oss-20b ganha com folga — 20,7 contra 14,4 em código.
O que é arquitetura MoE neste contexto?
Mixture of Experts: o modelo tem 31,6 bilhões de parâmetros totais, mas só 3,6 bilhões são ativados por token. Pense num time de especialistas onde só alguns respondem a cada pergunta — isso reduz custo de inferência e aumenta a velocidade de saída.