Qwen3 Next 80B Thinking vence em raciocínio, Nemotron ganha em velocidade de resposta
Comparativo entre dois modelos abertos lançados em setembro e outubro de 2025 mostra quem entrega mais por dólar e quem entrega em menos tempo.
O que está em jogo
O catálogo fechou outubro de 2025 com 253 modelos ainda listados e dois lançamentos que merecem ser olhados de perto: o Qwen3 Next 80B A3B Thinking, da chinesa Qwen, lançado em 11 de setembro, e o Llama 3.3 Nemotron Super 49B V1.5, da NVIDIA, lançado exatamente um dia antes desta publicação. Ambos são abertos, ambos são modelos de raciocínio, e ambos cobram pela saída. Mas a conta final é bem diferente — e o desempenho também.
Inteligência medida hoje
O índice de inteligência do Artificial Analysis coloca o Qwen3 Next 80B Thinking em 16,87 e o Nemotron Super 49B em 12,40. Em codificação, a diferença é ainda mais dura para o modelo da NVIDIA: 17,42 contra um valor não publicado no catálogo. Em tarefas agentic, o Qwen marca 2,06 e o Nemotron também não tem nota divulgada. Em outras palavras, o Qwen é o único dos dois com benchmark público nas categorias que importam para quem está montando agente ou depurando código.
Preço: o marketing do "barato" merece lupa
O Qwen cobra US$ 0,15 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída. O Nemotron cobra US$ 0,40 nos dois lados — ou seja, entrada mais cara, saída três vezes mais barata. Para um chatbot que cospe resposta curta, o Nemotron ganha. Para um pipeline que gera muito texto de raciocínio antes da resposta final, o Qwen cobra caro no lugar certo.
Nenhum dos dois divulga preço de cache no catálogo, então não dá para cravar economia em prompt reaproveitado sem testar.
Velocidade e contexto
Aqui o jogo vira. O Qwen roda a 196,94 tokens por segundo; o Nemotron, a 52,85. É quase quatro vezes mais lento no modelo da NVIDIA. Se você está montando um agente que precisa responder em tempo hábil para um usuário humano, essa diferença pesa. O contexto também: 262 mil tokens no Qwen contra 131 mil no Nemotron — dobro de janela para documentos longos.
| Critério | Qwen3 Next 80B A3B Thinking | Llama 3.3 Nemotron Super 49B |
|---|---|---|
| Índice de inteligência | 16.9 | 12.4 |
| Entrada US$/M | 0.15 | 0.4 |
| Saída US$/M | 1.2 | 0.4 |
| Contexto | 262k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 197 | 53 |
| Índice de código | 17.4 | — |
| Índice agêntico | 2.1 | — |
Quem ganha em quê
Qwen3 Next 80B A3B Thinking ganha quando: o problema exige raciocínio pesado, código difícil, matemática, lógica multi-etapa. O modelo tem 80 bilhões de parâmetros totais mas só 3 bilhões ativos por token (arquitetura MoE), o que explica a velocidade alta mesmo pensando bastante. O corte de conhecimento é 30 de setembro de 2025, então ele sabe de coisas muito recentes.
Nemotron Super 49B V1.5 ganha quando: você quer resposta rápida, contexto de até 128K basta, e o orçamento para tokens de saída é o gargalo — não o de entrada. Os 49 bilhões são todos ativos (não é MoE), então o custo de inferência é mais previsível. É um modelo centrado em inglês, pós-treinado em RAG e tool calling pela NVIDIA.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Para quem nada muda
Se você já usa o o3 da OpenAI (índice 31,10, líder do catálogo) ou o gpt-oss-120b (24,13), nenhum dos dois entra no seu radar — estão em outra faixa. Para workloads que exigem o topo absoluto de raciocínio, continue pagando o3. Para workloads que cabem no gpt-oss-120b a US$ 0,17 de saída, o Qwen3 Next perde em preço e em IQ.
A escolha real entre estes dois é: Qwen se você prioriza qualidade do raciocínio e janela de contexto grande; Nemotron se você prioriza previsibilidade de custo de saída e respostas mais ágeis em inglês.
Coloque o Qwen3 Next em pipelines de raciocínio pesado e código difícil; coloque o Nemotron Super em chatbots e agentes rápidos onde o inglês domina e o custo de saída é o que aperta o orçamento.
Perguntas frequentes
Qwen3 Next 80B Thinking ou Nemotron Super 49B: qual é mais barato?
Depende do lado. O Nemotron cobra US$ 0,40 por milhão de tokens de saída contra US$ 1,20 do Qwen — três vezes mais barato na saída. Na entrada, o Qwen é mais barato (US$ 0,15 contra US$ 0,40). Quem gera muito texto de saída economiza com o Nemotron; quem consome muito prompt economiza com o Qwen.
Qual dos dois tem melhor desempenho em código?
O Qwen3 Next 80B Thinking tem índice de codificação 17,42 publicado no catálogo; o Nemotron Super 49B V1.5 não divulga nota de codificação. Pelos dados disponíveis hoje, o Qwen é a aposta mais segura para tarefas de programação.
Os dois modelos são open weights?
Sim. Ambos têm pesos abertos: o Qwen3 Next é uma arquitetura MoE de 80B com 3B ativos por token, e o Nemotron é um modelo denso de 49B derivado do Llama 3.3 70B da Meta, pós-treinado pela NVIDIA.