FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Next 80B custa 9% do Nemotron 70B e responde quase 4x mais rápido

Dois modelos abertos, preços em ordens de grandeza diferentes e uma escolha que cabe no bolso de quem paga a API.

Redação FalaVIP IA 3 min de leitura
US$ 0,10por milhão de tokens de entrada no Qwen3 Next
US$ 1,20por milhão de tokens de entrada no Nemotron 70B
173,42 t/svelocidade do Qwen3 Next contra 44,63 t/s do Nemotron

Pagar US$ 1,20 por milhão de tokens de entrada já parece caro quando você vê o extrato. Aí aparece um modelo aberto, do mesmo porte, cobrando US$ 0,10 pela mesma janela — e a pergunta deixa de ser técnica e vira financeira.

O tamanho da diferença de preço

O Qwen3 Next 80B A3B Instruct cobra US$ 0,10 por milhão de tokens de entrada e US$ 1,10 por milhão de saída. O Llama 3.1 Nemotron 70B Instruct cobra US$ 1,20 nos dois lados. Traduzindo para a fatura: cada milhão de tokens que sai do Qwen custa US$ 1,10; cada milhão que sai do Nemotron custa US$ 1,20. Na entrada, a diferença é de 12 vezes. No uso real, com mais entrada do que saída, o custo efetivo do Qwen fica em US$ 0,4125 por milhão; o do Nemotron, em US$ 1,20.

Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Instruct1,1Llama 3.1 Nemotron 70B Instr1,2US$/M
Fonte: OpenRouter

Inteligência e o que o índice mede

No índice de inteligência atual, o Qwen3 Next marca 13,754 e o Nemotron 70B, 7,425. Quase o dobro no agregado. Os dois são modelos não-raciocínio, ou seja, respondem direto, sem cadeia de pensamento explícita — o que ajuda a explicar por que o Qwen custa tão pouco e responde tão rápido.

Índice de inteligência (Artificial Analysis)
Qwen3 Next 80B A3B Instruct13,8Llama 3.1 Nemotron 70B Instr7,4índice
Fonte: Artificial Analysis

Velocidade e contexto

Aqui a distância fica quase cômica. O Qwen entrega 173,42 tokens por segundo; o Nemotron, 44,63. Em um trabalho de geração longa, isso muda o tempo de espera na tela. A janela de contexto também joga a favor do Qwen: 262.144 tokens contra 131.072 do Nemotron, o dobro de espaço para colar documento, código ou histórico de conversa.

Qwen3 Next 80B A3B Instruct × Llama 3.1 Nemotron 70B Instr
CritérioQwen3 Next 80B A3B InstructLlama 3.1 Nemotron 70B Instr
Índice de inteligência13.87.4
Entrada US$/M0.11.2
Saída US$/M1.11.2
Contexto262k131k
Pesos abertossimsim
Velocidade (tok/s)17345
Índice de código
Índice agêntico

O tabuleiro em 17 de novembro

O catálogo hoje reúne 276 modelos de 42 criadores. No topo do índice de inteligência estão o OpenAI o3 (31,096), o Claude Haiku 4.5 (29,892) e o gpt-oss-120b (24,126) — todos acima dos dois da pauta. O Qwen3 Next Instruct entra na faixa intermediária, à frente do gpt-oss-20b (15,225) e do Qwen3 Next Thinking (16,867). O Nemotron 70B, lançado em outubro de 2024, já está longe da ponta: foi ultrapassado por modelos abertos mais novos e mais baratos. O knowledge cutoff ajuda a explicar parte disso — o Qwen corta em setembro de 2025, o Nemotron em dezembro de 2023.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 276 modelos disponíveis no catálogo nesta data.

Quando cada um ganha

O Qwen3 Next 80B A3B Instruct ganha quando o gargalo é custo e latência: chatbots em produção, pipelines que processam muito texto por dia, protótipos que precisam caber no orçamento. Os 80 bilhões de parâmetros totais com apenas 3 bilhões ativos (arquitetura MoE) é o que permite cobrar tão pouco e responder tão rápido sem abrir mão de uma janela de contexto grande.

O Nemotron 70B Instruct ganha quando o que importa é rodar em infraestrutura NVIDIA já ajustada para a família Llama 3.1, com toolchain conhecida e integrações testadas. É um modelo denso de 70B, todo ativo a cada passada — mais previsível em ambientes on-prem com kernel e CUDA já validados. Para quem já tem pipeline Llama rodando e não quer mexer, trocar agora é trocar por trocar.

Para todo o resto — a maioria esmagadora dos casos em que alguém está escolhendo modelo para uma API nova — o Qwen3 Next 80B A3B Instruct entrega mais por menos, e a conta no fim do mês é o argumento que fecha a discussão.

Em uma frase

Se você está começando um projeto novo ou quer cortar custo de API sem perder janela de contexto, migre para o Qwen3 Next 80B; só fique no Nemotron 70B se sua stack Llama 3.1 já está travada em produção.

Perguntas frequentes

Quanto custa o Qwen3 Next 80B A3B Instruct por milhão de tokens?

Cobra US$ 0,10 por milhão de tokens de entrada e US$ 1,10 por milhão de saída, com cache a US$ 0,07. O custo efetivo fica em US$ 0,4125 por milhão no uso típico.

O Llama 3.1 Nemotron 70B ainda vale a pena em 2025?

Vale se sua infraestrutura já está calibrada para a família Llama 3.1 e trocar traz risco operacional. Em preço, velocidade e janela de contexto, ele perde para o Qwen3 Next por margens grandes.

Qual a diferença entre o Qwen3 Next Instruct e a versão Thinking?

A versão Instruct responde direto, sem cadeia de pensamento, e é mais barata e rápida. A Thinking (16,867 no índice) é otimizada para raciocínio explícito e custa mais caro por token de saída.

Leia também