FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

O Qwen3 Next Instruct cobra US$ 1,10 por milhão e perde do próprio irmão

Lançado ontem pela Alibaba, o modelo aberto de 80B/3B ativos aposta em velocidade e contexto de 256k — mas o preço de saída e o IQ abaixo da variante Thinking dificultam a conta.

Redação FalaVIP IA 2 min de leitura
US$ 1,10por milhão de tokens de saída
3 bilhõesde parâmetros ativos (de 80B totais)
173 t/svelocidade declarada, a maior entre os pares

Ontem a Qwen colocou no ar a versão Instruct do Qwen3 Next 80B A3B. Um dia depois, a conta já mostra o problema: US$ 1,10 por milhão de tokens de saída. É quase o mesmo preço da variante Thinking (US$ 1,20), mas com um IQ 18% menor — 13,754 contra 16,867.

Índice de inteligência (Artificial Analysis)
Qwen3 Next 80B A3B Instruct13,8gpt-oss-20b15,2Nemotron Nano 9B V28,7Llama 4 Scout10,3Llama 3.3 70B Instruct9,3índice
Fonte: Artificial Analysis

O que é esse modelo, em uma frase

Oitenta bilhões de parâmetros totais, mas só 3 bilhões ativos por passagem — uma arquitetura MoE bem mais esparsa que a média. Contexto de 256 mil tokens, pesos abertos, vindo da China, sem traços de "thinking" na resposta. Velocidade declarada: 173 tokens por segundo, a maior entre os pares diretos.

Ficha técnica — Qwen3 Next 80B A3B Instruct
CampoValor
Identificadorqwen/qwen3-next-80b-a3b-instruct
Criadorqwen
Preço de entradaUS$ 0.100 / M tokens
Preço de saídaUS$ 1.10 / M tokens
Janela de contexto262k
Modalidadetext->text
Leitura de cacheUS$ 0.070 / M (30% de desconto)
Índice de inteligência (AA)13.8
Parâmetros80B (3B ativos por token)
Pesosabertos
Velocidade de saída173 tokens/s

O preço de saída é o problema

A Qwen colocou o modelo numa faixa estranha. Os US$ 1,10 por milhão de tokens de saída são:

  • 8,5x mais caros que o gpt-oss-20b da OpenAI (US$ 0,13), que tem IQ maior (15,225) e ainda pensa antes de responder
  • 58% mais caros que o Llama 4 Maverick (US$ 0,696), multimodal e com 17B ativos
  • 3,7x mais caros que o Llama 4 Scout (US$ 0,30)
Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Instruct1,1gpt-oss-20b0,13Nemotron Nano 9B V20,16Llama 4 Scout0,3Llama 3.3 70B Instruct0,32US$/M
Fonte: OpenRouter

A entrada é razoável (US$ 0,10), empatada com o Scout. Mas em workloads reais — RAG, agentes, chatbots — quem manda é o token de saída. É ali que a fatura explode.

Quando ele faz sentido

Três cenários onde o Qwen3 Next Instruct ainda entra:

  1. Você precisa de resposta rápida sem o overhead do "thinking". Os 173 t/s são reais e fazem diferença em UX conversacional.
  2. Você quer hospedar localmente um modelo aberto com 256k de contexto e só 3B ativos por passagem — o que reduz o custo de GPU por requisição.
  3. Você está num pipeline onde o modelo é chamado em paralelo massivo e o preço de entrada domina — aí o US$ 0,10 de input compensa.
Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Qwen3 Next 80B A3B Instruct (o novo)13.80.11.1262k
gpt-oss-20b15.20.030.13131k
Nemotron Nano 9B V28.70.040.16131k
Llama 4 Scout10.30.10.31.31M
Llama 3.3 70B Instruct9.30.10.32131k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Quando NÃO vale a pena

Se o que você quer é inteligência por dólar, a resposta é o gpt-oss-20b. IQ 15,225, US$ 0,13 de saída, 21B totais com 3,6B ativos. É melhor em quase tudo e custa uma fração.

Se você quer multimodalidade (texto + imagem), o Llama 4 Scout e o Maverick continuam sendo as referências abertas nessa faixa.

Se você quer a melhor versão da própria Qwen, pegue a variante Thinking — por US$ 0,10 a mais você sobe de 13,754 para 16,867 de IQ.

Inteligência × preço de saída
Qwen3 Next 80B A3B Instructgpt-oss-20bNemotron Nano 9B V2Llama 4 ScoutLlama 3.3 70B InstructUS$ por milhão (saída, escala log)índice de inteligência

Onde fica no tabuleiro

O catálogo hoje tem mais de 227 modelos listados, de 38 criadores. O topo de inteligência segue com o o3 da OpenAI (IQ 31), seguido do gpt-oss-120b (24,1) e do próprio Qwen3 Next Thinking (16,9). O Instruct entra na faixa intermediária — útil, mas sem protagonismo.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 227 modelos disponíveis no catálogo nesta data.

A origem chinesa e os pesos abertos são diferenciais reais para quem precisa de soberania de dados ou quer fazer fine-tuning. Só que "aberto e chinês" não é argumento contra a conta no fim do mês — e, por enquanto, a conta não fecha.

Em uma frase

Só escolha o Qwen3 Next Instruct se velocidade bruta, hospedagem local ou 256k de contexto forem prioridades inegociáveis — em inteligência por dólar, o gpt-oss-20b entrega mais por uma fração do preço.

Perguntas frequentes

Qwen3 Next 80B A3B Instruct é gratuito?

Não. Cobra US$ 0,10 por milhão de tokens de entrada e US$ 1,10 por milhão de saída, com cache de US$ 0,07. Os pesos são abertos, então você pode hospedar localmente se tiver a infraestrutura.

Qual a diferença entre a versão Instruct e a Thinking?

A variante Thinking produz raciocínio interno antes de responder e tem IQ maior (16,867 contra 13,754). A Instruct responde direto, sem traços de pensamento, e custa US$ 0,10 a menos por milhão de saída.

Quando o Qwen3 Next Instruct vale a pena frente ao gpt-oss-20b?

Quando você precisa de mais velocidade (173 t/s contra 112), contexto maior (256k contra 128k) ou prefere a licença Apache 2.0 sem restrições de uso. Em custo-benefício puro, o gpt-oss-20b ganha: IQ maior por um oitavo do preço de saída.

Leia também