FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Qwen3-Next 80B A3B Thinking custa 85% menos que o3 na saída

Modelo de raciocínio da Alibaba entra com 3 bilhões de parâmetros ativos e preço de US$ 1,20 por milhão de tokens de saída — mas fica bem abaixo do topo do índice de inteligência.

Redação FalaVIP IA 3 min de leitura
US$ 1,20por milhão de tokens de saída
3 bilhõesde parâmetros ativos em 80B totais
262.144tokens de contexto

A conta da API vai dizer mais do que o release da Alibaba. O Qwen3-Next 80B A3B Thinking chegou nesta quinta-feira (11) cobrando US$ 1,20 por milhão de tokens de saída — quase sete vezes mais barato que o o3 da OpenAI, que sai por US$ 8. Em troca, o índice de inteligência atual marca 16,87, menos da metade dos 31,10 do o3. É o trade-off clássico entre gastar menos e pensar melhor, e desta vez a Qwen empurrou a barra bem para o lado do bolso.

O que está dentro do modelo

O nome entrega a arquitetura: 80 bilhões de parâmetros totais, mas só 3 bilhões ativos por token. Pense num escritório de 80 pessoas onde, para cada tarefa, só três sentam na mesa — as outras 77 ficam de plantão, prontas para entrar quando o problema muda de perfil. É a família Mixture-of-Experts (MoE) que a Alibaba vinha testando, agora com o sufixo "Thinking" ligado de fábrica. Isso quer dizer que o modelo emite traces de raciocínio estruturados por padrão, sem você precisar pedir. Serve para prova matemática, síntese e debug de código, lógica multi-passo e tarefas agentic — exatamente o tipo de uso que consome muitos tokens de saída e, portanto, pesa na fatura.

A janela de contexto é de 262.144 tokens, o que coloca o modelo no mesmo andar de contexto dos principais concorrentes abertos. É open weights, então dá para rodar em infraestrutura própria se você tiver as GPUs.

Ficha técnica — Qwen3 Next 80B A3B Thinking
CampoValor
Identificadorqwen/qwen3-next-80b-a3b-thinking
Criadorqwen
Preço de entradaUS$ 0.150 / M tokens
Preço de saídaUS$ 1.20 / M tokens
Janela de contexto262k
Modalidadetext->text
Índice de inteligência (AA)16.9
Índice de código17.4
Índice agêntico2.1
Parâmetros80B (3B ativos por token)
Pesosabertos
Velocidade de saída197 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

Onde ele se encaixa no tabuleiro

Olhando só o índice de inteligência medido hoje, o Qwen3-Next Thinking entra em terceiro lugar geral — atrás do o3 e do gpt-oss-120b da OpenAI, e à frente do gpt-oss-20b e do Llama 4 Maverick da Meta. Nada mal para um modelo chinês de raciocínio custando US$ 1,20 de saída. Mas a comparação justa não é com o o3: é com os outros modelos abertos que custam uma fração disso.

Índice de inteligência (Artificial Analysis)
Qwen3 Next 80B A3B Thinking16,9o331,1gpt-oss-120b24,1gpt-oss-20b15,2índice
Fonte: Artificial Analysis

O gpt-oss-120b, da própria OpenAI, marca 24,13 de IQ e cobra US$ 0,17 por milhão de tokens de saída — sete vezes mais barato que o Qwen3-Next Thinking e ainda mais inteligente pelo índice atual. O gpt-oss-20b fica em 15,22 de IQ por US$ 0,13. Em outras palavras: se o seu critério é inteligência por dólar, os modelos abertos da OpenAI ainda vencem. O Qwen3-Next Thinking só passa a fazer sentido quando você precisa de algo específico da família — janela grande, comportamento de raciocínio explícito, ou simplesmente uma alternativa chinesa no portfólio.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Qwen3 Next 80B A3B Thinking (o novo)16.90.151.2262k
o331.128200k
gpt-oss-120b24.10.0370.17131k
gpt-oss-20b15.20.030.13131k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

A família completa lançada hoje

A Alibaba não soltou só o Thinking. Vieram três variantes no mesmo dia:

Os outros modelos anunciados no mesmo dia
ModeloEntrada US$/MSaída US$/MContexto
Qwen3 Next 80B A3B Instruct0.11.1262k
Qwen3 Next 80B A3B Instruct 00262k

A versão Instruct (não-raciocínio) sai por US$ 1,10 por milhão de tokens de saída — basicamente o mesmo preço, mas sem os traces de pensamento. E tem uma versão Instruct gratuita, com rate limit de provedor, para quem quer testar antes de colocar na produção.

Para quem vale — e para quem não muda nada

Vale se você está construindo um agente ou um pipeline de código que consome muito token de saída e precisa de uma alternativa mais barata que o o3, sem abrir mão de janela de contexto longa e de comportamento de raciocínio nativo. Vale também se você quer diversificar fornecedor — a família é chinesa, open weights, e roda na sua infra se você tiver as placas.

Não muda nada se o seu gargalo é qualidade bruta de raciocínio: o o3 continua bem à frente no índice de inteligência e o gpt-oss-120b oferece mais inteligência por menos dinheiro. Também não muda nada se você já está satisfeito com o gpt-oss-20b para tarefas mais simples — pagar US$ 1,20 em vez de US$ 0,13 só se justifica se o salto de 15 para 17 de IQ fizer diferença real no seu produto.

Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Thinking1,2o38gpt-oss-120b0,17gpt-oss-20b0,13US$/M
Fonte: OpenRouter
Inteligência × preço de saída
Qwen3 Next 80B A3B Thinkingo3gpt-oss-120bgpt-oss-20bUS$ por milhão (saída, escala log)índice de inteligência

O que fazer com isso

Se você está rodando agente ou código hoje no o3, vale um teste A/B com o Qwen3-Next Thinking: a economia por token é grande o suficiente para compensar um eventual retrabalho de prompt. Se você está no gpt-oss-120b, a troca só compensa se você precisar de algo que o modelo da OpenAI não entrega — e isso é uma decisão de produto, não de custo. E se você ainda não tem um modelo de raciocínio no stack, a versão Instruct gratuita é o ponto de entrada mais barato para experimentar.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 227 modelos disponíveis no catálogo nesta data.
Em uma frase

Rode o Qwen3-Next Thinking como segundo modelo de raciocínio ao lado do o3 ou do gpt-oss-120b — vale pelo preço em workloads de agente e código, mas não substitui o topo do índice de inteligência.

Perguntas frequentes

Quanto custa o Qwen3-Next 80B A3B Thinking na API?

Cobra US$ 0,15 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída. Não há preço de cache publicado pelo catálogo. A versão Instruct sem raciocínio sai por US$ 0,10 de entrada e US$ 1,10 de saída, e existe uma variante Instruct gratuita com rate limit de provedor.

O Qwen3-Next Thinking é melhor que o o3?

Não. Pelo índice de inteligência medido hoje, o o3 marca 31,10 contra 16,87 do Qwen3-Next Thinking. O ponto do lançamento é preço: o o3 custa US$ 8 por milhão de tokens de saída, quase sete vezes mais caro. É uma troca entre qualidade bruta de raciocínio e custo por token.

O que significa "3B ativos em 80B totais"?

É uma arquitetura Mixture-of-Experts: o modelo tem 80 bilhões de parâmetros no total, mas só 3 bilhões são ativados para processar cada token. O resultado é um modelo grande em capacidade, mas com custo de inferência parecido com o de um modelo de 3 bilhões — por isso o preço de API mais baixo.

Leia também