FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Next 80B A3B Instruct cobra 4× menos na saída que o Nemotron Super 49B

Dois modelos abertos com quase a mesma nota de inteligência, mas contas de API bem diferentes — e a velocidade também não empata.

Redação FalaVIP IA 3 min de leitura
US$ 1,10por milhão de tokens de saída no Qwen3 Next Instruct
US$ 0,40por milhão de tokens de saída no Nemotron Super 49B
173,42 t/svelocidade do Qwen3 Next Instruct contra 52,85 t/s do Nemotron

O que está em jogo

Você olha o índice de inteligência e vê 13,754 contra 12,401. Diferença pequena. Aí abre a tabela de preços e a distância explode: US$ 1,10 por milhão de tokens de saída no Qwen3 Next 80B A3B Instruct, contra US$ 0,40 no Llama 3.3 Nemotron Super 49B V1.5. Ou seja, o modelo da NVIDIA cobra mais que o dobro por token gerado, mesmo com nota inferior no índice.

A conta, porém, é menos óbvia do que parece. Vale olhar os outros campos antes de cravar um vencedor.

Índice de inteligência (Artificial Analysis)
Qwen3 Next 80B A3B Instruct13,8Llama 3.3 Nemotron Super 49B12,4índice
Fonte: Artificial Analysis

O que cada um é, de verdade

O Qwen3 Next 80B A3B Instruct é um modelo MoE chinês, lançado em 11 de setembro de 2025, com 80 bilhões de parâmetros totais mas só 3 bilhões ativos por token. É da família "Instruct" da Qwen3 Next — ou seja, a versão sem cadeia de pensamento visível, otimizada para resposta direta e estável. Knowledge cutoff em 30 de setembro de 2025, contexto de 262 mil tokens, pesos abertos.

O Llama 3.3 Nemotron Super 49B V1.5 é o oposto em quase tudo. 49 bilhões de parâmetros, todos ativos, lançado em 10 de outubro de 2025, derivado do Llama 3.3 70B Instruct da Meta e pós-treinado pela NVIDIA para fluxos agentic, RAG e tool calling. Reasoning ligado, contexto de 131 mil tokens, knowledge cutoff mais velho: março de 2024.

Qwen3 Next 80B A3B Instruct × Llama 3.3 Nemotron Super 49B
CritérioQwen3 Next 80B A3B InstructLlama 3.3 Nemotron Super 49B
Índice de inteligência13.812.4
Entrada US$/M0.10.4
Saída US$/M1.10.4
Contexto262k131k
Pesos abertossimsim
Velocidade (tok/s)17353
Índice de código
Índice agêntico

Preço: a armadilha do "barato"

O Qwen tem entrada a US$ 0,10 por milhão de tokens e cache a US$ 0,07. O Nemotron cobra US$ 0,40 de entrada e não publica preço de cache no catálogo. Em workloads de leitura massiva — RAG, indexação de documentos, prompts enormes com cache hit — o chinês ganha de longe: entrada 4× mais barata e cache oficial.

Na ponta da geração, a história muda. O Nemotron custa US$ 0,40 por milhão de saída; o Qwen, US$ 1,10. Quem gera muito texto por chamada — sumarização longa, geração de código, respostas extensas — paga mais no Qwen. Quem lê muito e escreve pouco paga mais no Nemotron.

Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Instruct1,1Llama 3.3 Nemotron Super 49B0,4US$/M
Fonte: OpenRouter

Velocidade e arquitetura

Aqui a diferença é brutal: 173,42 tokens por segundo no Qwen contra 52,85 no Nemotron. Mais de 3× mais rápido. Isso não é só estética — em produção, throughput define se você aguenta a fila com uma réplica ou se precisa de três.

A razão está na arquitetura. O Qwen é MoE com só 3B ativos por inferência; o Nemotron é denso, 49B ativos. Para uma GPU única ou um orçamento de hardware apertado, o chinês é outro jogo.

Onde cada um ganha

O Qwen3 Next 80B A3B Instruct ganha quando: você tem prompt enorme com cache, workload multilíngue com viés para chinês, precisa de throughput alto em GPU limitada, ou quer o modelo mais novo em knowledge cutoff (setembro/2025).

O Llama 3.3 Nemotron Super 49B V1.5 ganha quando: o caso de uso é agentic com tool calling pesado, a tarefa é majoritariamente em inglês, o volume de tokens gerados é alto (custo de saída pesa mais), e você prefere um modelo denso de procedência americana com pós-treinamento documentado para RAG.

O tabuleiro hoje

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 263 modelos disponíveis no catálogo nesta data.

Para situar: o topo do índice hoje é o OpenAI o3 com 31,096 e US$ 8 de saída por milhão; o segundo é o Claude Haiku 4.5 com 29,892 a US$ 5. Os dois modelos deste comparativo estão lá embaixo, na faixa dos 12 a 14. Não são os mais espertos do catálogo — são os mais interessantes pelo custo-benefício dentro da faixa intermediária.

Implicação prática

Se sua fatura de API tem linha de cache hit separável, faça um teste A/B com o Qwen3 Next Instruct: a economia em entrada e cache costuma compensar o preço maior de saída. Se o produto é agentic em inglês e a maior parte do custo está em tool calling e respostas longas, o Nemotron Super 49B V1.5 entrega nota parecida por menos na geração — e com reasoning ligado, sem precisar de prompt extra para "pensar".

Em uma frase

Teste o Qwen3 Next Instruct se cache e entrada dominam sua fatura; vá de Nemotron Super 49B V1.5 se a maior parte do custo está em tokens de saída em inglês.

Perguntas frequentes

Qual é mais barato, Qwen3 Next Instruct ou Nemotron Super 49B V1.5?

Depende do lado da fatura. O Qwen cobra US$ 0,10 de entrada e US$ 0,07 de cache por milhão de tokens; o Nemotron cobra US$ 0,40 de entrada e não publica cache. Na saída, o Nemotron é mais barato: US$ 0,40 contra US$ 1,10 do Qwen.

Qual dos dois tem melhor nota de inteligência?

O Qwen3 Next 80B A3B Instruct marca 13,754 no índice atual; o Nemotron Super 49B V1.5 marca 12,401. Diferença pequena, dentro da mesma faixa intermediária do catálogo.

Os dois modelos são open weights?

Sim. Ambos têm pesos abertos: o Qwen é da Qwen (China) com arquitetura MoE 80B/3B ativos; o Nemotron é da NVIDIA (EUA), derivado do Llama 3.3 70B da Meta, denso com 49B ativos.

Leia também