FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Coder Next cobra 4× mais caro que Nemotron Nano e entrega 2,5× mais código

Comparativo entre dois modelos MoE open-weight para coding agents: a conta da API e o que cada um realmente faz pelo seu agente.

Redação FalaVIP IA 3 min de leitura
US$ 0,80preço de saída do Qwen3 Coder Next por milhão de tokens
US$ 0,20preço de saída do Nemotron 3 Nano por milhão de tokens
36,23índice de coding do Qwen3 Coder Next

Dois MoE, dois discursos

Você está olhando para dois modelos que ocupam o mesmo nicho — agentes de código leves, pesos abertos, MoE — e que vendem a mesma promessa: rodar localmente ou via API sem estourar a fatura. Só que a conta de API do Qwen3 Coder Next custa 4× o que a do NVIDIA Nemotron 3 Nano 30B A3B cobra pela saída. E a diferença não é só no preço.

Preço de saída (US$ por milhão de tokens)
Qwen3 Coder Next0,8Nemotron 3 Nano 30B A3B0,2US$/M
Fonte: OpenRouter

O que cada um traz no papel

O Qwen3 Coder Next foi lançado em 4 de fevereiro de 2026 e é um MoE de 80B totais com 3B ativos por token — desenhado explicitamente para coding agents e workflows locais. O Nemotron 3 Nano saiu em dezembro de 2025, é menor (31,6B totais, 3,6B ativos) e se vende como o MoE de maior eficiência computacional da NVIDIA para agentes especializados. Ambos suportam contexto de 262k tokens e são text-to-text.

Onde eles divergem de verdade: o Qwen não é um modelo de raciocínio, o Nemotron é. Em tarefas agentic isso costuma importar.

Inteligência e código: a régua que decide

Os números do Artificial Analysis contam uma história clara.

Índice de inteligência (Artificial Analysis)
Qwen3 Coder Next21,3Nemotron 3 Nano 30B A3B14,5índice
Fonte: Artificial Analysis

O Qwen3 Coder Next marca 21,29 no índice geral de inteligência e 36,23 em coding. O Nemotron 3 Nano marca 14,54 e 14,37 no mesmo recorte. Em coding, o Qwen entrega 2,5× a pontuação do Nemotron. Em agentic, a vantagem é ainda mais absurda: 8,86 contra 1,99 — quase 4,5×.

Isso não é marketing, é benchmark. Se o seu agente vai escrever código de verdade — não só classificar intenção — o Qwen paga o preço extra.

A conta, finalmente

Vamos falar de dinheiro, que é o que aparece no fim do mês.

Qwen3 Coder Next × Nemotron 3 Nano 30B A3B
CritérioQwen3 Coder NextNemotron 3 Nano 30B A3B
Índice de inteligência21.314.5
Entrada US$/M0.120.05
Saída US$/M0.80.2
Contexto262k262k
Pesos abertossimsim
Velocidade (tok/s)130248
Índice de código36.214.4
Índice agêntico8.92.0
  • Qwen3 Coder Next: US$ 0,12/M entrada, US$ 0,80/M saída, cache US$ 0,07/M
  • Nemotron 3 Nano: US$ 0,05/M entrada, US$ 0,20/M saída, cache US$ 0,025/M

Em um workload típico de coding agent — muita leitura de repositório, pouca geração — a entrada domina. Se você fizer 9 chamadas de leitura para cada 1 de escrita, o Nemotron custa cerca de US$ 0,50 por milhão de tokens consumidos e o Qwen, US$ 1,16. Diferença real, mas não catastrófica. No cenário oposto, geração pesada de código, a saída pesa: o Qwen cobra US$ 4,00 por milhão de tokens gerados contra US$ 1,00 do Nemotron. Aí a conta fica 4× maior, como o título promete.

E tem o detalhe do cache: ambos cobram cache de leitura, e o Nemotron cobra exatamente a metade (US$ 0,025 contra US$ 0,07). Em workflows que repetem o mesmo contexto — e todo coding agent repete — isso é dinheiro que volta.

Velocidade e o resto do tabuleiro

O Nemotron roda a 247,99 tokens por segundo; o Qwen, a 129,5. Ou seja, o modelo mais barato também é quase 2× mais rápido. Em agente, latência importa: cada ciclo de tool call é uma espera. Para quem está montando um loop agêntico que faz dezenas de chamadas por tarefa, isso se traduz em wall-clock real.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Coder Next21.30.8
Entre os 334 modelos disponíveis no catálogo nesta data.

Colocados no catálogo de hoje, os dois ficam longe do topo de inteligência — Xiaomi MiMo-V2-Flash lidera com 34,02, seguido de OpenAI o3 (31,10) e Claude Haiku 4.5 (29,89). O Qwen3 Coder Next aparece em quinto com 21,29; o Nemotron, fora dos cinco primeiros. Mas nenhum dos dois está brigando por medalha geral — eles brigam por um slot específico: o de coding agent barato e open-weight.

Para quem cada um ganha

O Qwen3 Coder Next ganha quando o seu agente precisa escrever código de produção, lidar com refactor grande ou tomar decisões em cadeia longa — qualquer coisa em que os índices de coding (36,23) e agentic (8,86) façam diferença no resultado final. Paga-se caro pela saída, mas entrega-se código que funciona.

O NVIDIA Nemotron 3 Nano 30B A3B ganha quando o gargalo é volume: tarefas agentic simples, classificação de intenção, extração, leitura massiva de código com pouca geração, e qualquer cenário onde latência e custo por token dominam a decisão. É o canivete suíço do "preciso gastar pouco e rodar rápido".

A escolha não é ideológica — é aritmética. Olhe para a proporção entre tokens lidos e tokens escritos no seu workload e decida.

Em uma frase

Meça a razão leitura/geração do seu agente antes de escolher: se a saída domina, pague o Qwen; se a entrada domina, leve o Nemotron.

Perguntas frequentes

Qwen3 Coder Next ou Nemotron 3 Nano: qual é melhor para coding agent?

Em coding, o Qwen3 Coder Next pontua 36,23 contra 14,37 do Nemotron — diferença de 2,5×. Em agentic, a vantagem é ainda maior (8,86 contra 1,99). Se a qualidade do código gerado é o critério, o Qwen ganha; se o critério é custo e latência, o Nemotron ganha.

Quanto custa rodar cada um via API?

Qwen3 Coder Next cobra US$ 0,12/M de entrada e US$ 0,80/M de saída. Nemotron 3 Nano cobra US$ 0,05/M de entrada e US$ 0,20/M de saída — 4× mais barato na saída. O cache do Nemotron também custa metade: US$ 0,025 contra US$ 0,07.

Os dois são open-weight?

Sim. Ambos são modelos MoE com pesos abertos, o que permite rodar localmente e ajustar para workloads específicos sem depender exclusivamente da API.

Leia também