Qwen3 Coder Next cobra 4× mais caro que Nemotron Nano e entrega 2,5× mais código
Comparativo entre dois modelos MoE open-weight para coding agents: a conta da API e o que cada um realmente faz pelo seu agente.
Dois MoE, dois discursos
Você está olhando para dois modelos que ocupam o mesmo nicho — agentes de código leves, pesos abertos, MoE — e que vendem a mesma promessa: rodar localmente ou via API sem estourar a fatura. Só que a conta de API do Qwen3 Coder Next custa 4× o que a do NVIDIA Nemotron 3 Nano 30B A3B cobra pela saída. E a diferença não é só no preço.
O que cada um traz no papel
O Qwen3 Coder Next foi lançado em 4 de fevereiro de 2026 e é um MoE de 80B totais com 3B ativos por token — desenhado explicitamente para coding agents e workflows locais. O Nemotron 3 Nano saiu em dezembro de 2025, é menor (31,6B totais, 3,6B ativos) e se vende como o MoE de maior eficiência computacional da NVIDIA para agentes especializados. Ambos suportam contexto de 262k tokens e são text-to-text.
Onde eles divergem de verdade: o Qwen não é um modelo de raciocínio, o Nemotron é. Em tarefas agentic isso costuma importar.
Inteligência e código: a régua que decide
Os números do Artificial Analysis contam uma história clara.
O Qwen3 Coder Next marca 21,29 no índice geral de inteligência e 36,23 em coding. O Nemotron 3 Nano marca 14,54 e 14,37 no mesmo recorte. Em coding, o Qwen entrega 2,5× a pontuação do Nemotron. Em agentic, a vantagem é ainda mais absurda: 8,86 contra 1,99 — quase 4,5×.
Isso não é marketing, é benchmark. Se o seu agente vai escrever código de verdade — não só classificar intenção — o Qwen paga o preço extra.
A conta, finalmente
Vamos falar de dinheiro, que é o que aparece no fim do mês.
| Critério | Qwen3 Coder Next | Nemotron 3 Nano 30B A3B |
|---|---|---|
| Índice de inteligência | 21.3 | 14.5 |
| Entrada US$/M | 0.12 | 0.05 |
| Saída US$/M | 0.8 | 0.2 |
| Contexto | 262k | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 130 | 248 |
| Índice de código | 36.2 | 14.4 |
| Índice agêntico | 8.9 | 2.0 |
- Qwen3 Coder Next: US$ 0,12/M entrada, US$ 0,80/M saída, cache US$ 0,07/M
- Nemotron 3 Nano: US$ 0,05/M entrada, US$ 0,20/M saída, cache US$ 0,025/M
Em um workload típico de coding agent — muita leitura de repositório, pouca geração — a entrada domina. Se você fizer 9 chamadas de leitura para cada 1 de escrita, o Nemotron custa cerca de US$ 0,50 por milhão de tokens consumidos e o Qwen, US$ 1,16. Diferença real, mas não catastrófica. No cenário oposto, geração pesada de código, a saída pesa: o Qwen cobra US$ 4,00 por milhão de tokens gerados contra US$ 1,00 do Nemotron. Aí a conta fica 4× maior, como o título promete.
E tem o detalhe do cache: ambos cobram cache de leitura, e o Nemotron cobra exatamente a metade (US$ 0,025 contra US$ 0,07). Em workflows que repetem o mesmo contexto — e todo coding agent repete — isso é dinheiro que volta.
Velocidade e o resto do tabuleiro
O Nemotron roda a 247,99 tokens por segundo; o Qwen, a 129,5. Ou seja, o modelo mais barato também é quase 2× mais rápido. Em agente, latência importa: cada ciclo de tool call é uma espera. Para quem está montando um loop agêntico que faz dezenas de chamadas por tarefa, isso se traduz em wall-clock real.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Coder Next | 21.3 | 0.8 |
Colocados no catálogo de hoje, os dois ficam longe do topo de inteligência — Xiaomi MiMo-V2-Flash lidera com 34,02, seguido de OpenAI o3 (31,10) e Claude Haiku 4.5 (29,89). O Qwen3 Coder Next aparece em quinto com 21,29; o Nemotron, fora dos cinco primeiros. Mas nenhum dos dois está brigando por medalha geral — eles brigam por um slot específico: o de coding agent barato e open-weight.
Para quem cada um ganha
O Qwen3 Coder Next ganha quando o seu agente precisa escrever código de produção, lidar com refactor grande ou tomar decisões em cadeia longa — qualquer coisa em que os índices de coding (36,23) e agentic (8,86) façam diferença no resultado final. Paga-se caro pela saída, mas entrega-se código que funciona.
O NVIDIA Nemotron 3 Nano 30B A3B ganha quando o gargalo é volume: tarefas agentic simples, classificação de intenção, extração, leitura massiva de código com pouca geração, e qualquer cenário onde latência e custo por token dominam a decisão. É o canivete suíço do "preciso gastar pouco e rodar rápido".
A escolha não é ideológica — é aritmética. Olhe para a proporção entre tokens lidos e tokens escritos no seu workload e decida.
Meça a razão leitura/geração do seu agente antes de escolher: se a saída domina, pague o Qwen; se a entrada domina, leve o Nemotron.
Perguntas frequentes
Qwen3 Coder Next ou Nemotron 3 Nano: qual é melhor para coding agent?
Em coding, o Qwen3 Coder Next pontua 36,23 contra 14,37 do Nemotron — diferença de 2,5×. Em agentic, a vantagem é ainda maior (8,86 contra 1,99). Se a qualidade do código gerado é o critério, o Qwen ganha; se o critério é custo e latência, o Nemotron ganha.
Quanto custa rodar cada um via API?
Qwen3 Coder Next cobra US$ 0,12/M de entrada e US$ 0,80/M de saída. Nemotron 3 Nano cobra US$ 0,05/M de entrada e US$ 0,20/M de saída — 4× mais barato na saída. O cache do Nemotron também custa metade: US$ 0,025 contra US$ 0,07.
Os dois são open-weight?
Sim. Ambos são modelos MoE com pesos abertos, o que permite rodar localmente e ajustar para workloads específicos sem depender exclusivamente da API.