Qwen3 Next 80B A3B cobra 7x mais que Nemotron Nano 9B V2
Dois modelos abertos lançados com seis dias de diferença em setembro. Qwen tem quase 60% mais inteligência e cobra US$ 1,10 por milhão na saída; Nemotron cobra US$ 0,16 e tem modo raciocínio nativo.
O nome diz 80B. Na conta, só 3B ativos por token. Esse é o primeiro truque que o Qwen3 Next 80B A3B Instruct esconde no rótulo: ele é um Mixture-of-Experts com 80 bilhões de parâmetros totais, mas apenas 3 bilhões são acionados a cada resposta. O adversário do comparativo de hoje, o NVIDIA Nemotron Nano 9B V2, não esconde nada — são 9 bilhões densos, todos os 9 bilhões trabalhando em cada inferência.
Os dois modelos abertos saíram com seis dias de diferença em setembro de 2025: Nemotron no dia 5, Qwen no dia 11. Os dois seguem listados hoje, com preço público por milhão de tokens. É o tipo de comparativo que normalmente termina em "depende" — mas não hoje.
Inteligência: 59% de vantagem para o Qwen
Pelo índice de inteligência da Artificial Analysis medido hoje, o Qwen3 Next 80B A3B Instruct marca 13,754. O Nemotron Nano 9B V2 marca 8,677. Isso dá ao Qwen uma vantagem de quase 59% — distância que aparece em raciocínio encadeado, escrita longa e respostas que pedem nuance.
Não estamos falando de dois modelos parecidos em patamares diferentes. É um modelo intermediário contra um modelo de entrada com raciocínio nativo. Em chat simples, a diferença pesa menos; em código, QA longo e instruções compostas, o Qwen puxa à frente.
Preço: a conta que dói
O Qwen cobra US$ 0,10 por milhão de tokens de entrada e US$ 1,10 por milhão de tokens de saída. O Nemotron cobra US$ 0,04 na entrada e US$ 0,16 na saída. Na saída, são quase sete vezes mais caro. Na entrada, 2,5 vezes.
Detalhe que pesa no fim do mês: o Qwen oferece preço de cache a US$ 0,07 por milhão para reaproveitar contexto repetido. O Nemotron não publicou preço de cache no catálogo — quem precisa dessa economia roda local ou negocia à parte.
Se o seu produto gasta poucos tokens por conversa, o Nemotron entrega o serviço por uma fração do custo. Em geração de texto longo, sumarização de documento ou código gerado, a diferença se acumula rápido.
Contexto e conhecimento: dois meses a mais
A janela de contexto do Qwen é de 262.144 tokens — exatamente o dobro dos 131.072 do Nemotron. Para quem enfia PDF inteiro, codebase grande ou transcrição de call no prompt, é a diferença entre caber e ter que picotar.
No corte de conhecimento, o Qwen vai até 30 de setembro de 2025. O Nemotron parou em 31 de março de 2025. São seis meses de mundo a mais — relevante para perguntas sobre eventos recentes, mudanças regulatórias e lançamentos.
| Critério | Qwen3 Next 80B A3B Instruct | Nemotron Nano 9B V2 |
|---|---|---|
| Índice de inteligência | 13.8 | 8.7 |
| Entrada US$/M | 0.1 | 0.04 |
| Saída US$/M | 1.1 | 0.16 |
| Contexto | 262k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 173 | 147 |
| Índice de código | — | — |
| Índice agêntico | — | — |
Quem pensa e quem só responde
O Qwen Instruct é, como o nome entrega, um modelo ajustado para resposta direta, sem traços de "thinking" visíveis. O Nemotron Nano 9B V2 foi treinado como modelo unificado para raciocínio e não-raciocínio — dá para ligar o modo pensar quando o problema exige cadeia longa de passos.
Na velocidade bruta, o Qwen entrega 173 tokens por segundo contra 147 do Nemotron. Os dois são open weights — dá para baixar e rodar local sem amarras de API. O Qwen vem da China (Alibaba); o Nemotron vem dos EUA (NVIDIA). Para workloads com exigência de residência de dados ou compliance setorial, essa linha pesa.
Para problemas que pedem que o modelo "pense antes de responder", só o Nemotron tem o modo nativo nesta versão. Para velocidade e resposta limpa, os dois servem.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
Quando cada um ganha, sem "depende"
Escolha o Qwen3 Next 80B A3B Instruct quando a qualidade da resposta pesa mais que o centavo por token: código não-trivial, escrita longa, análise de documento grande, prompts com até 262k de contexto, trabalho que precisa de conhecimento atualizado até setembro de 2025 e velocidade de 173 tokens por segundo.
Escolha o Nemotron Nano 9B V2 quando o orçamento manda e o workload é simples ou de alto volume: classificação, extração, chat curto, geração enxuta, qualquer cenário que se beneficie do modo raciocínio a US$ 0,16 por milhão de tokens de saída — e quando você precisa de origem americana, de um modelo denso pequeno para rodar local, ou simplesmente não quer pagar quase sete vezes mais caro por um ganho de qualidade que o seu caso não vai usar.
A diferença de preço na saída é brutal. A diferença de inteligência também é brutal. Os dois fatos são verdade ao mesmo tempo — quem decide precisa saber qual pesa mais na sua conta.
Para cargas onde a qualidade da resposta importa mais que o custo por token, vá de Qwen3 Next 80B A3B Instruct; para alto volume em tarefas simples com orçamento apertado, o Nemotron Nano 9B V2 entrega raciocínio nativo por uma fração do preço.
Perguntas frequentes
Qual é mais barato, Qwen3 Next 80B A3B Instruct ou Nemotron Nano 9B V2?
O Nemotron Nano 9B V2 é muito mais barato. Cobra US$ 0,04 por milhão de tokens de entrada e US$ 0,16 na saída, contra US$ 0,10 e US$ 1,10 do Qwen — quase sete vezes menos na saída e 2,5 vezes menos na entrada.
Qual dos dois tem maior janela de contexto?
O Qwen3 Next 80B A3B Instruct, com 262.144 tokens — exatamente o dobro dos 131.072 do Nemotron Nano 9B V2. Para prompts com PDF inteiro, codebase grande ou transcrições longas, isso evita ter que picotar o documento.
Os dois modelos são open weights?
Sim. Tanto o Qwen3 Next 80B A3B Instruct quanto o Nemotron Nano 9B V2 são distribuídos com pesos abertos, então dá para baixar, rodar localmente e ajustar sem depender exclusivamente da API do criador.