FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Next 80B Thinking vence em raciocínio, Nemotron ganha em velocidade de resposta

Comparativo entre dois modelos abertos lançados em setembro e outubro de 2025 mostra quem entrega mais por dólar e quem entrega em menos tempo.

Redação FalaVIP IA 3 min de leitura
16,87índice de inteligência do Qwen3 Next 80B Thinking
12,40índice de inteligência do Nemotron Super 49B
US$ 1,20preço de saída por milhão de tokens do Qwen3 Next
US$ 0,40preço de saída por milhão de tokens do Nemotron

O que está em jogo

O catálogo fechou outubro de 2025 com 253 modelos ainda listados e dois lançamentos que merecem ser olhados de perto: o Qwen3 Next 80B A3B Thinking, da chinesa Qwen, lançado em 11 de setembro, e o Llama 3.3 Nemotron Super 49B V1.5, da NVIDIA, lançado exatamente um dia antes desta publicação. Ambos são abertos, ambos são modelos de raciocínio, e ambos cobram pela saída. Mas a conta final é bem diferente — e o desempenho também.

Inteligência medida hoje

O índice de inteligência do Artificial Analysis coloca o Qwen3 Next 80B Thinking em 16,87 e o Nemotron Super 49B em 12,40. Em codificação, a diferença é ainda mais dura para o modelo da NVIDIA: 17,42 contra um valor não publicado no catálogo. Em tarefas agentic, o Qwen marca 2,06 e o Nemotron também não tem nota divulgada. Em outras palavras, o Qwen é o único dos dois com benchmark público nas categorias que importam para quem está montando agente ou depurando código.

Índice de inteligência (Artificial Analysis)
Qwen3 Next 80B A3B Thinking16,9Llama 3.3 Nemotron Super 49B12,4índice
Fonte: Artificial Analysis

Preço: o marketing do "barato" merece lupa

O Qwen cobra US$ 0,15 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída. O Nemotron cobra US$ 0,40 nos dois lados — ou seja, entrada mais cara, saída três vezes mais barata. Para um chatbot que cospe resposta curta, o Nemotron ganha. Para um pipeline que gera muito texto de raciocínio antes da resposta final, o Qwen cobra caro no lugar certo.

Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Thinking1,2Llama 3.3 Nemotron Super 49B0,4US$/M
Fonte: OpenRouter

Nenhum dos dois divulga preço de cache no catálogo, então não dá para cravar economia em prompt reaproveitado sem testar.

Velocidade e contexto

Aqui o jogo vira. O Qwen roda a 196,94 tokens por segundo; o Nemotron, a 52,85. É quase quatro vezes mais lento no modelo da NVIDIA. Se você está montando um agente que precisa responder em tempo hábil para um usuário humano, essa diferença pesa. O contexto também: 262 mil tokens no Qwen contra 131 mil no Nemotron — dobro de janela para documentos longos.

Qwen3 Next 80B A3B Thinking × Llama 3.3 Nemotron Super 49B
CritérioQwen3 Next 80B A3B ThinkingLlama 3.3 Nemotron Super 49B
Índice de inteligência16.912.4
Entrada US$/M0.150.4
Saída US$/M1.20.4
Contexto262k131k
Pesos abertossimsim
Velocidade (tok/s)19753
Índice de código17.4
Índice agêntico2.1

Quem ganha em quê

Qwen3 Next 80B A3B Thinking ganha quando: o problema exige raciocínio pesado, código difícil, matemática, lógica multi-etapa. O modelo tem 80 bilhões de parâmetros totais mas só 3 bilhões ativos por token (arquitetura MoE), o que explica a velocidade alta mesmo pensando bastante. O corte de conhecimento é 30 de setembro de 2025, então ele sabe de coisas muito recentes.

Nemotron Super 49B V1.5 ganha quando: você quer resposta rápida, contexto de até 128K basta, e o orçamento para tokens de saída é o gargalo — não o de entrada. Os 49 bilhões são todos ativos (não é MoE), então o custo de inferência é mais previsível. É um modelo centrado em inglês, pós-treinado em RAG e tool calling pela NVIDIA.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 253 modelos disponíveis no catálogo nesta data.

Para quem nada muda

Se você já usa o o3 da OpenAI (índice 31,10, líder do catálogo) ou o gpt-oss-120b (24,13), nenhum dos dois entra no seu radar — estão em outra faixa. Para workloads que exigem o topo absoluto de raciocínio, continue pagando o3. Para workloads que cabem no gpt-oss-120b a US$ 0,17 de saída, o Qwen3 Next perde em preço e em IQ.

A escolha real entre estes dois é: Qwen se você prioriza qualidade do raciocínio e janela de contexto grande; Nemotron se você prioriza previsibilidade de custo de saída e respostas mais ágeis em inglês.

Em uma frase

Coloque o Qwen3 Next em pipelines de raciocínio pesado e código difícil; coloque o Nemotron Super em chatbots e agentes rápidos onde o inglês domina e o custo de saída é o que aperta o orçamento.

Perguntas frequentes

Qwen3 Next 80B Thinking ou Nemotron Super 49B: qual é mais barato?

Depende do lado. O Nemotron cobra US$ 0,40 por milhão de tokens de saída contra US$ 1,20 do Qwen — três vezes mais barato na saída. Na entrada, o Qwen é mais barato (US$ 0,15 contra US$ 0,40). Quem gera muito texto de saída economiza com o Nemotron; quem consome muito prompt economiza com o Qwen.

Qual dos dois tem melhor desempenho em código?

O Qwen3 Next 80B Thinking tem índice de codificação 17,42 publicado no catálogo; o Nemotron Super 49B V1.5 não divulga nota de codificação. Pelos dados disponíveis hoje, o Qwen é a aposta mais segura para tarefas de programação.

Os dois modelos são open weights?

Sim. Ambos têm pesos abertos: o Qwen3 Next é uma arquitetura MoE de 80B com 3B ativos por token, e o Nemotron é um modelo denso de 49B derivado do Llama 3.3 70B da Meta, pós-treinado pela NVIDIA.

Leia também