O Qwen3 Next Instruct cobra US$ 1,10 por milhão e perde do próprio irmão
Lançado ontem pela Alibaba, o modelo aberto de 80B/3B ativos aposta em velocidade e contexto de 256k — mas o preço de saída e o IQ abaixo da variante Thinking dificultam a conta.
Ontem a Qwen colocou no ar a versão Instruct do Qwen3 Next 80B A3B. Um dia depois, a conta já mostra o problema: US$ 1,10 por milhão de tokens de saída. É quase o mesmo preço da variante Thinking (US$ 1,20), mas com um IQ 18% menor — 13,754 contra 16,867.
O que é esse modelo, em uma frase
Oitenta bilhões de parâmetros totais, mas só 3 bilhões ativos por passagem — uma arquitetura MoE bem mais esparsa que a média. Contexto de 256 mil tokens, pesos abertos, vindo da China, sem traços de "thinking" na resposta. Velocidade declarada: 173 tokens por segundo, a maior entre os pares diretos.
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3-next-80b-a3b-instruct |
| Criador | qwen |
| Preço de entrada | US$ 0.100 / M tokens |
| Preço de saída | US$ 1.10 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.070 / M (30% de desconto) |
| Índice de inteligência (AA) | 13.8 |
| Parâmetros | 80B (3B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 173 tokens/s |
O preço de saída é o problema
A Qwen colocou o modelo numa faixa estranha. Os US$ 1,10 por milhão de tokens de saída são:
- 8,5x mais caros que o gpt-oss-20b da OpenAI (US$ 0,13), que tem IQ maior (15,225) e ainda pensa antes de responder
- 58% mais caros que o Llama 4 Maverick (US$ 0,696), multimodal e com 17B ativos
- 3,7x mais caros que o Llama 4 Scout (US$ 0,30)
A entrada é razoável (US$ 0,10), empatada com o Scout. Mas em workloads reais — RAG, agentes, chatbots — quem manda é o token de saída. É ali que a fatura explode.
Quando ele faz sentido
Três cenários onde o Qwen3 Next Instruct ainda entra:
- Você precisa de resposta rápida sem o overhead do "thinking". Os 173 t/s são reais e fazem diferença em UX conversacional.
- Você quer hospedar localmente um modelo aberto com 256k de contexto e só 3B ativos por passagem — o que reduz o custo de GPU por requisição.
- Você está num pipeline onde o modelo é chamado em paralelo massivo e o preço de entrada domina — aí o US$ 0,10 de input compensa.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Qwen3 Next 80B A3B Instruct (o novo) | 13.8 | 0.1 | 1.1 | 262k |
| gpt-oss-20b | 15.2 | 0.03 | 0.13 | 131k |
| Nemotron Nano 9B V2 | 8.7 | 0.04 | 0.16 | 131k |
| Llama 4 Scout | 10.3 | 0.1 | 0.3 | 1.31M |
| Llama 3.3 70B Instruct | 9.3 | 0.1 | 0.32 | 131k |
Quando NÃO vale a pena
Se o que você quer é inteligência por dólar, a resposta é o gpt-oss-20b. IQ 15,225, US$ 0,13 de saída, 21B totais com 3,6B ativos. É melhor em quase tudo e custa uma fração.
Se você quer multimodalidade (texto + imagem), o Llama 4 Scout e o Maverick continuam sendo as referências abertas nessa faixa.
Se você quer a melhor versão da própria Qwen, pegue a variante Thinking — por US$ 0,10 a mais você sobe de 13,754 para 16,867 de IQ.
Onde fica no tabuleiro
O catálogo hoje tem mais de 227 modelos listados, de 38 criadores. O topo de inteligência segue com o o3 da OpenAI (IQ 31), seguido do gpt-oss-120b (24,1) e do próprio Qwen3 Next Thinking (16,9). O Instruct entra na faixa intermediária — útil, mas sem protagonismo.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
A origem chinesa e os pesos abertos são diferenciais reais para quem precisa de soberania de dados ou quer fazer fine-tuning. Só que "aberto e chinês" não é argumento contra a conta no fim do mês — e, por enquanto, a conta não fecha.
Só escolha o Qwen3 Next Instruct se velocidade bruta, hospedagem local ou 256k de contexto forem prioridades inegociáveis — em inteligência por dólar, o gpt-oss-20b entrega mais por uma fração do preço.
Perguntas frequentes
Qwen3 Next 80B A3B Instruct é gratuito?
Não. Cobra US$ 0,10 por milhão de tokens de entrada e US$ 1,10 por milhão de saída, com cache de US$ 0,07. Os pesos são abertos, então você pode hospedar localmente se tiver a infraestrutura.
Qual a diferença entre a versão Instruct e a Thinking?
A variante Thinking produz raciocínio interno antes de responder e tem IQ maior (16,867 contra 13,754). A Instruct responde direto, sem traços de pensamento, e custa US$ 0,10 a menos por milhão de saída.
Quando o Qwen3 Next Instruct vale a pena frente ao gpt-oss-20b?
Quando você precisa de mais velocidade (173 t/s contra 112), contexto maior (256k contra 128k) ou prefere a licença Apache 2.0 sem restrições de uso. Em custo-benefício puro, o gpt-oss-20b ganha: IQ maior por um oitavo do preço de saída.