FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Nemotron 3 Nano 30B: rápido, mas pior em código que o gpt-oss-20b

O modelo MoE de pesos abertos da NVIDIA entrega 2,2x a velocidade do rival em inteligência intermediária, mas perde 30% em benchmarks de programação.

Redação FalaVIP IA 3 min de leitura
247,99tokens por segundo de velocidade
US$ 0,0875custo blended por milhão de tokens
14,371índice de código (gpt-oss-20b: 20,697)

A NVIDIA soltou no domingo o Nemotron 3 Nano 30B A3B, modelo de pesos abertos com 31,6 bilhões de parâmetros totais. Parece grande, mas só 3,6 bilhões são ativados por token. É a tal arquitetura MoE: pense num time de especialistas onde só alguns respondem a cada pergunta — isso reduz custo de inferência e aumenta velocidade. Em dois dias de catálogo, ele já aparece com índice de inteligência 14,538. O número parece OK. A história toda está na velocidade: 247,99 tokens por segundo, mais que o dobro do gpt-oss-20b.

Índice de inteligência (Artificial Analysis)
Nemotron 3 Nano 30B A3B14,5gpt-oss-20b15,2Ministral 3 8B 25129Nemotron Nano 9B V28,7Ministral 3 14B 251211,2índice
Fonte: Artificial Analysis

Onde ele entra na tabela

O top 5 do catálogo de dezembro de 2025 (que tem mais de 307 modelos listados) vai de 19,242 (Mistral Devstral 2 2512) até 34,024 (Xiaomi MiMo-V2-Flash). OpenAI o3 marca 31,096, Claude Haiku 4.5 fecha o pódio com 29,892. O Nemotron 3 Nano entra na faixa intermediária, com 14,538 — abaixo do gpt-oss-20b, que marca 15,225.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Nemotron 3 Nano 30B A3B (o novo)14.50.050.2262k
gpt-oss-20b15.20.030.13131k
Ministral 3 8B 25129.00.150.15262k
Nemotron Nano 9B V28.70.040.16131k
Ministral 3 14B 251211.20.20.2262k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

A leitura fica mais clara quando você olha as métricas separadas:

  • Inteligência geral: 14,538 (gpt-oss-20b: 15,225 — pequena desvantagem)
  • Código: 14,371 (gpt-oss-20b: 20,697 — diferença de 30%)
  • Agente: 1,993 (gpt-oss-20b: 3,103 — quase metade)

Se você roda modelo para gerar função, refatorar classe ou operar agente que planeja passos, o gpt-oss-20b entrega mais. O Nemotron não veio para ganhar esse jogo.

Onde ele realmente vence

A velocidade declarada é 247,99 tokens por segundo. O gpt-oss-20b fica em 112,6. É mais que o dobro — e isso muda a conta no fim do mês quando você está processando lote.

Preço de saída (US$ por milhão de tokens)
Nemotron 3 Nano 30B A3B0,2gpt-oss-20b0,13Ministral 3 8B 25120,15Nemotron Nano 9B V20,16Ministral 3 14B 25120,2US$/M
Fonte: OpenRouter

O contexto também é o dobro: 262.144 tokens contra 131.072 do rival. Para quem enfia PDFs inteiros, logs longos ou bases de código grandes, isso é a diferença entre cortar entrada e não cortar.

No preço, a NVIDIA cobra US$ 0,05 por milhão de tokens de entrada e US$ 0,20 de saída. Mais caro na saída que o gpt-oss-20b (US$ 0,13), mas o cache sai por US$ 0,025 — metade do rival. No blended, que é o custo médio real de uso, Nemotron fica em US$ 0,0875, contra US$ 0,0925 do gpt-oss-20b. Margem apertada, mas existe.

Para quem vale trocar

Se o seu gargalo é latência — chatbot respondendo em tempo real, pipeline processando milhões de tokens em fila, agente iterando rápido sem travar o usuário — o Nemotron 3 Nano ganha do gpt-oss-20b. A combinação de 2,2x mais velocidade com cache pela metade do preço compensa em qualquer workload de alto volume.

Como é de pesos abertos, dá para hospedar local e pagar só o custo de hardware. O gpt-oss-20b também é aberto, então a briga aqui é de inferência, não de licenciamento.

Para quem não muda nada

Se você já usa o gpt-oss-20b em tarefas de código, programação agêntica ou raciocínio com alta exigência, a troca é regressão. O índice de código cai 30% (de 20,7 para 14,4), o agente quase pela metade.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 307 modelos disponíveis no catálogo nesta data.

Os modelos da Mistral lançados no começo do mês (Ministral 3 8B e 14B) também não competem na mesma faixa — o 14B marca 11,243 de inteligência, o 8B fica em 8,974. Ambos têm contexto de 262k e visão, mas não são alternativas para workload de raciocínio.

A implicação prática

Em dezembro de 2025, com 31 modelos lançados nos últimos 30 dias, o catálogo está cheio de opções para o mesmo problema. O Nemotron 3 Nano 30B A3B não é um modelo "melhor" — é um modelo "mais rápido e mais barato no uso de alto volume". Use quando throughput e latência pesarem mais que qualidade bruta. Para o resto, o gpt-oss-20b continua sendo a referência de pesos abertos pequenos que vale considerar.

Em uma frase

Use Nemotron 3 Nano quando latência e volume pesarem mais que qualidade bruta em código e agente; para o resto, o gpt-oss-20b ainda é a referência de pesos abertos pequenos.

Perguntas frequentes

O NVIDIA Nemotron 3 Nano 30B A3B é gratuito?

Não na API — é cobrado US$ 0,05 por milhão de tokens de entrada e US$ 0,20 de saída. Mas como tem pesos abertos, pode ser hospedado localmente sem custo de licenciamento.

Nemotron 3 Nano 30B ou gpt-oss-20b: qual escolher?

Depende da carga. Para velocidade e contexto longo (262k tokens), o Nemotron entrega 2,2x a velocidade do rival. Para tarefas de código e raciocínio agêntico, o gpt-oss-20b ganha com folga — 20,7 contra 14,4 em código.

O que é arquitetura MoE neste contexto?

Mixture of Experts: o modelo tem 31,6 bilhões de parâmetros totais, mas só 3,6 bilhões são ativados por token. Pense num time de especialistas onde só alguns respondem a cada pergunta — isso reduz custo de inferência e aumenta a velocidade de saída.

Leia também