FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Next 80B Thinking custa 6× mais caro que Nemotron 3 Nano e só ganha em raciocínio

Comparativo entre dois modelos MoE chineses e americanos que disputam o mesmo nicho: tarefas longas com reasoning, mas em faixas de preço e desempenho bem diferentes.

Redação FalaVIP IA 3 min de leitura
US$ 1,20preço de saída do Qwen3 Next 80B por milhão de tokens
US$ 0,20preço de saída do Nemotron 3 Nano por milhão de tokens
247,99 tokens/svelocidade do Nemotron 3 Nano contra 196,94 do Qwen

A conta que ninguém quer fazer

Você está olhando para dois modelos com o mesmo pedigree técnico — MoE, open weights, reasoning-first — e a fatura no fim do mês pode sair seis vezes mais cara dependendo da sua escolha. O Qwen3 Next 80B A3B Thinking cobra US$ 1,20 por milhão de tokens de saída. O Nemotron 3 Nano 30B A3B, da NVIDIA, cobra US$ 0,20. Mesmo pacote, mesmo tipo de tarefa, diferença de 6× na linha de saída.

Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Thinking1,2Nemotron 3 Nano 30B A3B0,2US$/M
Fonte: OpenRouter

Onde o Qwen realmente entrega mais é no índice de inteligência: 16,867 contra 14,538 do Nemotron. Em coding, a vantagem se mantém: 17,419 contra 14,371. Em agentic, a diferença é pequena — 2,062 contra 1,993 — quase irrelevante na prática.

Quem é quem nessa disputa

O Qwen3 Next 80B é chinês, lançado em 11 de setembro de 2025, com 80 bilhões de parâmetros totais e apenas 3 bilhões ativos por token — a arquitetura MoE clássica, onde só uma fração dos pesos é acionada a cada passo. O contexto é de 262 mil tokens, knowledge cutoff em 30 de setembro de 2025. Foi pensado para problemas longos: provas matemáticas, síntese e debug de código, lógica, fluxos agentic.

O Nemotron 3 Nano 30B A3B é americano, da NVIDIA, lançado em 14 de dezembro de 2025. Também é MoE: 31,6 bilhões totais, 3,6 bilhões ativos. Mesmo contexto de 262 mil tokens. A NVIDIA posiciona o modelo explicitamente para "eficiência de compute e precisão" em sistemas agentic. E tem um detalhe que o Qwen não tem: cache de prompt a US$ 0,025 por milhão de tokens — útil se você repete o mesmo contexto em muitas chamadas.

Qwen3 Next 80B A3B Thinking × Nemotron 3 Nano 30B A3B
CritérioQwen3 Next 80B A3B ThinkingNemotron 3 Nano 30B A3B
Índice de inteligência16.914.5
Entrada US$/M0.150.05
Saída US$/M1.20.2
Contexto262k262k
Pesos abertossimsim
Velocidade (tok/s)197248
Índice de código17.414.4
Índice agêntico2.12.0

O que os números dizem de verdade

A velocidade favorece o Nemotron: 247,99 tokens por segundo contra 196,94 do Qwen. Em tarefas longas, isso significa menos tempo de espera e, dependendo do seu setup, menor custo de infraestrutura para rodar self-hosted.

Já o "blended" — preço médio ponderado que mistura entrada e saída — mostra a distância real: US$ 0,4125 por milhão para o Qwen, US$ 0,0875 para o Nemotron. Quem roda pipeline com muito input e pouco output paga ainda mais barato no Nemotron; quem precisa de muita saída sente menos a diferença.

Índice de inteligência (Artificial Analysis)
Qwen3 Next 80B A3B Thinking16,9Nemotron 3 Nano 30B A3B14,5índice
Fonte: Artificial Analysis

Olhando o tabuleiro desta data, nenhum dos dois está no topo do índice de inteligência. O líder é o Xiaomi MiMo-V2-Flash, com IQ 34,024 e preço de US$ 0,30 por milhão de saída. O OpenAI o3 vem em segundo, com IQ 31,096 mas a US$ 8 por milhão. O Claude Haiku 4.5 fecha o pódio com IQ 29,892 a US$ 5. Os dois modelos deste comparativo brigam numa faixa intermediária — e é justamente aí que a diferença de preço pesa mais.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 314 modelos disponíveis no catálogo nesta data.

Para quem cada um vale

Qwen3 Next 80B A3B Thinking ganha quando você precisa do melhor raciocínio dentro da faixa intermediária: tarefas de matemática, provas, debugging pesado de código, lógica complexa. A vantagem de IQ e coding existe e é mensurável. Não vale quando o orçamento é apertado e a tarefa é agentic comum — aí o Nemotron entrega quase a mesma coisa por uma fração do custo.

Nemotron 3 Nano 30B A3B ganha quando você roda agente em volume, repete contexto (cache de prompt), ou precisa de throughput alto em self-hosting. É mais rápido, mais barato, e a diferença em agentic é desprezível. Não vale quando a tarefa exige o melhor raciocínio absoluto — o Qwen é superior em IQ e coding por uma margem relevante.

Implicação prática

Se você está rodando agente com muito input repetido e pouca saída, troque para o Nemotron agora — a economia é imediata e a perda de qualidade em agentic é marginal. Se o seu gargalo é raciocínio puro e a conta da API não é o problema, o Qwen entrega o melhor IQ da faixa. Não é questão de gosto: é questão de qual métrica está apertando o seu pipeline.

Em uma frase

Use Nemotron 3 Nano para agente em volume com cache de prompt; use Qwen3 Next 80B quando raciocínio e coding pesam mais que o custo por token.

Perguntas frequentes

Qual a diferença de preço entre Qwen3 Next 80B Thinking e Nemotron 3 Nano?

O Qwen cobra US$ 1,20 por milhão de tokens de saída; o Nemotron cobra US$ 0,20. No preço blended, a diferença é de US$ 0,4125 contra US$ 0,0875 por milhão — quase 5× mais barato no Nemotron.

Qual dos dois tem melhor raciocínio?

O Qwen3 Next 80B Thinking lidera em índice de inteligência (16,867 contra 14,538) e em coding (17,419 contra 14,371). Em agentic, a diferença é mínima: 2,062 contra 1,993.

O Nemotron 3 Nano tem cache de prompt?

Sim, a US$ 0,025 por milhão de tokens. O Qwen3 Next 80B Thinking não publicou preço de cache no catálogo — informação não disponível.

Leia também