FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Next 80B A3B cobra 7x mais que Nemotron Nano 9B V2

Dois modelos abertos lançados com seis dias de diferença em setembro. Qwen tem quase 60% mais inteligência e cobra US$ 1,10 por milhão na saída; Nemotron cobra US$ 0,16 e tem modo raciocínio nativo.

Redação FalaVIP IA 3 min de leitura
6,9xdiferença de preço por milhão de tokens na saída (US$ 1,10 vs US$ 0,16)
58,5%vantagem do Qwen no índice de inteligência (13,754 vs 8,677)
262.144tokens de contexto do Qwen, o dobro dos 131.072 do Nemotron

O nome diz 80B. Na conta, só 3B ativos por token. Esse é o primeiro truque que o Qwen3 Next 80B A3B Instruct esconde no rótulo: ele é um Mixture-of-Experts com 80 bilhões de parâmetros totais, mas apenas 3 bilhões são acionados a cada resposta. O adversário do comparativo de hoje, o NVIDIA Nemotron Nano 9B V2, não esconde nada — são 9 bilhões densos, todos os 9 bilhões trabalhando em cada inferência.

Os dois modelos abertos saíram com seis dias de diferença em setembro de 2025: Nemotron no dia 5, Qwen no dia 11. Os dois seguem listados hoje, com preço público por milhão de tokens. É o tipo de comparativo que normalmente termina em "depende" — mas não hoje.

Inteligência: 59% de vantagem para o Qwen

Pelo índice de inteligência da Artificial Analysis medido hoje, o Qwen3 Next 80B A3B Instruct marca 13,754. O Nemotron Nano 9B V2 marca 8,677. Isso dá ao Qwen uma vantagem de quase 59% — distância que aparece em raciocínio encadeado, escrita longa e respostas que pedem nuance.

Índice de inteligência (Artificial Analysis)
Qwen3 Next 80B A3B Instruct13,8Nemotron Nano 9B V28,7índice
Fonte: Artificial Analysis

Não estamos falando de dois modelos parecidos em patamares diferentes. É um modelo intermediário contra um modelo de entrada com raciocínio nativo. Em chat simples, a diferença pesa menos; em código, QA longo e instruções compostas, o Qwen puxa à frente.

Preço: a conta que dói

O Qwen cobra US$ 0,10 por milhão de tokens de entrada e US$ 1,10 por milhão de tokens de saída. O Nemotron cobra US$ 0,04 na entrada e US$ 0,16 na saída. Na saída, são quase sete vezes mais caro. Na entrada, 2,5 vezes.

Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Instruct1,1Nemotron Nano 9B V20,16US$/M
Fonte: OpenRouter

Detalhe que pesa no fim do mês: o Qwen oferece preço de cache a US$ 0,07 por milhão para reaproveitar contexto repetido. O Nemotron não publicou preço de cache no catálogo — quem precisa dessa economia roda local ou negocia à parte.

Se o seu produto gasta poucos tokens por conversa, o Nemotron entrega o serviço por uma fração do custo. Em geração de texto longo, sumarização de documento ou código gerado, a diferença se acumula rápido.

Contexto e conhecimento: dois meses a mais

A janela de contexto do Qwen é de 262.144 tokens — exatamente o dobro dos 131.072 do Nemotron. Para quem enfia PDF inteiro, codebase grande ou transcrição de call no prompt, é a diferença entre caber e ter que picotar.

No corte de conhecimento, o Qwen vai até 30 de setembro de 2025. O Nemotron parou em 31 de março de 2025. São seis meses de mundo a mais — relevante para perguntas sobre eventos recentes, mudanças regulatórias e lançamentos.

Qwen3 Next 80B A3B Instruct × Nemotron Nano 9B V2
CritérioQwen3 Next 80B A3B InstructNemotron Nano 9B V2
Índice de inteligência13.88.7
Entrada US$/M0.10.04
Saída US$/M1.10.16
Contexto262k131k
Pesos abertossimsim
Velocidade (tok/s)173147
Índice de código
Índice agêntico

Quem pensa e quem só responde

O Qwen Instruct é, como o nome entrega, um modelo ajustado para resposta direta, sem traços de "thinking" visíveis. O Nemotron Nano 9B V2 foi treinado como modelo unificado para raciocínio e não-raciocínio — dá para ligar o modo pensar quando o problema exige cadeia longa de passos.

Na velocidade bruta, o Qwen entrega 173 tokens por segundo contra 147 do Nemotron. Os dois são open weights — dá para baixar e rodar local sem amarras de API. O Qwen vem da China (Alibaba); o Nemotron vem dos EUA (NVIDIA). Para workloads com exigência de residência de dados ou compliance setorial, essa linha pesa.

Para problemas que pedem que o modelo "pense antes de responder", só o Nemotron tem o modo nativo nesta versão. Para velocidade e resposta limpa, os dois servem.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 276 modelos disponíveis no catálogo nesta data.

Quando cada um ganha, sem "depende"

Escolha o Qwen3 Next 80B A3B Instruct quando a qualidade da resposta pesa mais que o centavo por token: código não-trivial, escrita longa, análise de documento grande, prompts com até 262k de contexto, trabalho que precisa de conhecimento atualizado até setembro de 2025 e velocidade de 173 tokens por segundo.

Escolha o Nemotron Nano 9B V2 quando o orçamento manda e o workload é simples ou de alto volume: classificação, extração, chat curto, geração enxuta, qualquer cenário que se beneficie do modo raciocínio a US$ 0,16 por milhão de tokens de saída — e quando você precisa de origem americana, de um modelo denso pequeno para rodar local, ou simplesmente não quer pagar quase sete vezes mais caro por um ganho de qualidade que o seu caso não vai usar.

A diferença de preço na saída é brutal. A diferença de inteligência também é brutal. Os dois fatos são verdade ao mesmo tempo — quem decide precisa saber qual pesa mais na sua conta.

Em uma frase

Para cargas onde a qualidade da resposta importa mais que o custo por token, vá de Qwen3 Next 80B A3B Instruct; para alto volume em tarefas simples com orçamento apertado, o Nemotron Nano 9B V2 entrega raciocínio nativo por uma fração do preço.

Perguntas frequentes

Qual é mais barato, Qwen3 Next 80B A3B Instruct ou Nemotron Nano 9B V2?

O Nemotron Nano 9B V2 é muito mais barato. Cobra US$ 0,04 por milhão de tokens de entrada e US$ 0,16 na saída, contra US$ 0,10 e US$ 1,10 do Qwen — quase sete vezes menos na saída e 2,5 vezes menos na entrada.

Qual dos dois tem maior janela de contexto?

O Qwen3 Next 80B A3B Instruct, com 262.144 tokens — exatamente o dobro dos 131.072 do Nemotron Nano 9B V2. Para prompts com PDF inteiro, codebase grande ou transcrições longas, isso evita ter que picotar o documento.

Os dois modelos são open weights?

Sim. Tanto o Qwen3 Next 80B A3B Instruct quanto o Nemotron Nano 9B V2 são distribuídos com pesos abertos, então dá para baixar, rodar localmente e ajustar sem depender exclusivamente da API do criador.

Leia também