Qwen3 Next 80B custa 9% do Nemotron 70B e responde quase 4x mais rápido
Dois modelos abertos, preços em ordens de grandeza diferentes e uma escolha que cabe no bolso de quem paga a API.
Pagar US$ 1,20 por milhão de tokens de entrada já parece caro quando você vê o extrato. Aí aparece um modelo aberto, do mesmo porte, cobrando US$ 0,10 pela mesma janela — e a pergunta deixa de ser técnica e vira financeira.
O tamanho da diferença de preço
O Qwen3 Next 80B A3B Instruct cobra US$ 0,10 por milhão de tokens de entrada e US$ 1,10 por milhão de saída. O Llama 3.1 Nemotron 70B Instruct cobra US$ 1,20 nos dois lados. Traduzindo para a fatura: cada milhão de tokens que sai do Qwen custa US$ 1,10; cada milhão que sai do Nemotron custa US$ 1,20. Na entrada, a diferença é de 12 vezes. No uso real, com mais entrada do que saída, o custo efetivo do Qwen fica em US$ 0,4125 por milhão; o do Nemotron, em US$ 1,20.
Inteligência e o que o índice mede
No índice de inteligência atual, o Qwen3 Next marca 13,754 e o Nemotron 70B, 7,425. Quase o dobro no agregado. Os dois são modelos não-raciocínio, ou seja, respondem direto, sem cadeia de pensamento explícita — o que ajuda a explicar por que o Qwen custa tão pouco e responde tão rápido.
Velocidade e contexto
Aqui a distância fica quase cômica. O Qwen entrega 173,42 tokens por segundo; o Nemotron, 44,63. Em um trabalho de geração longa, isso muda o tempo de espera na tela. A janela de contexto também joga a favor do Qwen: 262.144 tokens contra 131.072 do Nemotron, o dobro de espaço para colar documento, código ou histórico de conversa.
| Critério | Qwen3 Next 80B A3B Instruct | Llama 3.1 Nemotron 70B Instr |
|---|---|---|
| Índice de inteligência | 13.8 | 7.4 |
| Entrada US$/M | 0.1 | 1.2 |
| Saída US$/M | 1.1 | 1.2 |
| Contexto | 262k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 173 | 45 |
| Índice de código | — | — |
| Índice agêntico | — | — |
O tabuleiro em 17 de novembro
O catálogo hoje reúne 276 modelos de 42 criadores. No topo do índice de inteligência estão o OpenAI o3 (31,096), o Claude Haiku 4.5 (29,892) e o gpt-oss-120b (24,126) — todos acima dos dois da pauta. O Qwen3 Next Instruct entra na faixa intermediária, à frente do gpt-oss-20b (15,225) e do Qwen3 Next Thinking (16,867). O Nemotron 70B, lançado em outubro de 2024, já está longe da ponta: foi ultrapassado por modelos abertos mais novos e mais baratos. O knowledge cutoff ajuda a explicar parte disso — o Qwen corta em setembro de 2025, o Nemotron em dezembro de 2023.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
Quando cada um ganha
O Qwen3 Next 80B A3B Instruct ganha quando o gargalo é custo e latência: chatbots em produção, pipelines que processam muito texto por dia, protótipos que precisam caber no orçamento. Os 80 bilhões de parâmetros totais com apenas 3 bilhões ativos (arquitetura MoE) é o que permite cobrar tão pouco e responder tão rápido sem abrir mão de uma janela de contexto grande.
O Nemotron 70B Instruct ganha quando o que importa é rodar em infraestrutura NVIDIA já ajustada para a família Llama 3.1, com toolchain conhecida e integrações testadas. É um modelo denso de 70B, todo ativo a cada passada — mais previsível em ambientes on-prem com kernel e CUDA já validados. Para quem já tem pipeline Llama rodando e não quer mexer, trocar agora é trocar por trocar.
Para todo o resto — a maioria esmagadora dos casos em que alguém está escolhendo modelo para uma API nova — o Qwen3 Next 80B A3B Instruct entrega mais por menos, e a conta no fim do mês é o argumento que fecha a discussão.
Se você está começando um projeto novo ou quer cortar custo de API sem perder janela de contexto, migre para o Qwen3 Next 80B; só fique no Nemotron 70B se sua stack Llama 3.1 já está travada em produção.
Perguntas frequentes
Quanto custa o Qwen3 Next 80B A3B Instruct por milhão de tokens?
Cobra US$ 0,10 por milhão de tokens de entrada e US$ 1,10 por milhão de saída, com cache a US$ 0,07. O custo efetivo fica em US$ 0,4125 por milhão no uso típico.
O Llama 3.1 Nemotron 70B ainda vale a pena em 2025?
Vale se sua infraestrutura já está calibrada para a família Llama 3.1 e trocar traz risco operacional. Em preço, velocidade e janela de contexto, ele perde para o Qwen3 Next por margens grandes.
Qual a diferença entre o Qwen3 Next Instruct e a versão Thinking?
A versão Instruct responde direto, sem cadeia de pensamento, e é mais barata e rápida. A Thinking (16,867 no índice) é otimizada para raciocínio explícito e custa mais caro por token de saída.