Qwen3 Next 80B Thinking custa 6× mais caro que Nemotron 3 Nano e só ganha em raciocínio
Comparativo entre dois modelos MoE chineses e americanos que disputam o mesmo nicho: tarefas longas com reasoning, mas em faixas de preço e desempenho bem diferentes.
A conta que ninguém quer fazer
Você está olhando para dois modelos com o mesmo pedigree técnico — MoE, open weights, reasoning-first — e a fatura no fim do mês pode sair seis vezes mais cara dependendo da sua escolha. O Qwen3 Next 80B A3B Thinking cobra US$ 1,20 por milhão de tokens de saída. O Nemotron 3 Nano 30B A3B, da NVIDIA, cobra US$ 0,20. Mesmo pacote, mesmo tipo de tarefa, diferença de 6× na linha de saída.
Onde o Qwen realmente entrega mais é no índice de inteligência: 16,867 contra 14,538 do Nemotron. Em coding, a vantagem se mantém: 17,419 contra 14,371. Em agentic, a diferença é pequena — 2,062 contra 1,993 — quase irrelevante na prática.
Quem é quem nessa disputa
O Qwen3 Next 80B é chinês, lançado em 11 de setembro de 2025, com 80 bilhões de parâmetros totais e apenas 3 bilhões ativos por token — a arquitetura MoE clássica, onde só uma fração dos pesos é acionada a cada passo. O contexto é de 262 mil tokens, knowledge cutoff em 30 de setembro de 2025. Foi pensado para problemas longos: provas matemáticas, síntese e debug de código, lógica, fluxos agentic.
O Nemotron 3 Nano 30B A3B é americano, da NVIDIA, lançado em 14 de dezembro de 2025. Também é MoE: 31,6 bilhões totais, 3,6 bilhões ativos. Mesmo contexto de 262 mil tokens. A NVIDIA posiciona o modelo explicitamente para "eficiência de compute e precisão" em sistemas agentic. E tem um detalhe que o Qwen não tem: cache de prompt a US$ 0,025 por milhão de tokens — útil se você repete o mesmo contexto em muitas chamadas.
| Critério | Qwen3 Next 80B A3B Thinking | Nemotron 3 Nano 30B A3B |
|---|---|---|
| Índice de inteligência | 16.9 | 14.5 |
| Entrada US$/M | 0.15 | 0.05 |
| Saída US$/M | 1.2 | 0.2 |
| Contexto | 262k | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 197 | 248 |
| Índice de código | 17.4 | 14.4 |
| Índice agêntico | 2.1 | 2.0 |
O que os números dizem de verdade
A velocidade favorece o Nemotron: 247,99 tokens por segundo contra 196,94 do Qwen. Em tarefas longas, isso significa menos tempo de espera e, dependendo do seu setup, menor custo de infraestrutura para rodar self-hosted.
Já o "blended" — preço médio ponderado que mistura entrada e saída — mostra a distância real: US$ 0,4125 por milhão para o Qwen, US$ 0,0875 para o Nemotron. Quem roda pipeline com muito input e pouco output paga ainda mais barato no Nemotron; quem precisa de muita saída sente menos a diferença.
Olhando o tabuleiro desta data, nenhum dos dois está no topo do índice de inteligência. O líder é o Xiaomi MiMo-V2-Flash, com IQ 34,024 e preço de US$ 0,30 por milhão de saída. O OpenAI o3 vem em segundo, com IQ 31,096 mas a US$ 8 por milhão. O Claude Haiku 4.5 fecha o pódio com IQ 29,892 a US$ 5. Os dois modelos deste comparativo brigam numa faixa intermediária — e é justamente aí que a diferença de preço pesa mais.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Para quem cada um vale
Qwen3 Next 80B A3B Thinking ganha quando você precisa do melhor raciocínio dentro da faixa intermediária: tarefas de matemática, provas, debugging pesado de código, lógica complexa. A vantagem de IQ e coding existe e é mensurável. Não vale quando o orçamento é apertado e a tarefa é agentic comum — aí o Nemotron entrega quase a mesma coisa por uma fração do custo.
Nemotron 3 Nano 30B A3B ganha quando você roda agente em volume, repete contexto (cache de prompt), ou precisa de throughput alto em self-hosting. É mais rápido, mais barato, e a diferença em agentic é desprezível. Não vale quando a tarefa exige o melhor raciocínio absoluto — o Qwen é superior em IQ e coding por uma margem relevante.
Implicação prática
Se você está rodando agente com muito input repetido e pouca saída, troque para o Nemotron agora — a economia é imediata e a perda de qualidade em agentic é marginal. Se o seu gargalo é raciocínio puro e a conta da API não é o problema, o Qwen entrega o melhor IQ da faixa. Não é questão de gosto: é questão de qual métrica está apertando o seu pipeline.
Use Nemotron 3 Nano para agente em volume com cache de prompt; use Qwen3 Next 80B quando raciocínio e coding pesam mais que o custo por token.
Perguntas frequentes
Qual a diferença de preço entre Qwen3 Next 80B Thinking e Nemotron 3 Nano?
O Qwen cobra US$ 1,20 por milhão de tokens de saída; o Nemotron cobra US$ 0,20. No preço blended, a diferença é de US$ 0,4125 contra US$ 0,0875 por milhão — quase 5× mais barato no Nemotron.
Qual dos dois tem melhor raciocínio?
O Qwen3 Next 80B Thinking lidera em índice de inteligência (16,867 contra 14,538) e em coding (17,419 contra 14,371). Em agentic, a diferença é mínima: 2,062 contra 1,993.
O Nemotron 3 Nano tem cache de prompt?
Sim, a US$ 0,025 por milhão de tokens. O Qwen3 Next 80B Thinking não publicou preço de cache no catálogo — informação não disponível.