Qwen3-Next 80B A3B Thinking custa 85% menos que o3 na saída
Modelo de raciocínio da Alibaba entra com 3 bilhões de parâmetros ativos e preço de US$ 1,20 por milhão de tokens de saída — mas fica bem abaixo do topo do índice de inteligência.
A conta da API vai dizer mais do que o release da Alibaba. O Qwen3-Next 80B A3B Thinking chegou nesta quinta-feira (11) cobrando US$ 1,20 por milhão de tokens de saída — quase sete vezes mais barato que o o3 da OpenAI, que sai por US$ 8. Em troca, o índice de inteligência atual marca 16,87, menos da metade dos 31,10 do o3. É o trade-off clássico entre gastar menos e pensar melhor, e desta vez a Qwen empurrou a barra bem para o lado do bolso.
O que está dentro do modelo
O nome entrega a arquitetura: 80 bilhões de parâmetros totais, mas só 3 bilhões ativos por token. Pense num escritório de 80 pessoas onde, para cada tarefa, só três sentam na mesa — as outras 77 ficam de plantão, prontas para entrar quando o problema muda de perfil. É a família Mixture-of-Experts (MoE) que a Alibaba vinha testando, agora com o sufixo "Thinking" ligado de fábrica. Isso quer dizer que o modelo emite traces de raciocínio estruturados por padrão, sem você precisar pedir. Serve para prova matemática, síntese e debug de código, lógica multi-passo e tarefas agentic — exatamente o tipo de uso que consome muitos tokens de saída e, portanto, pesa na fatura.
A janela de contexto é de 262.144 tokens, o que coloca o modelo no mesmo andar de contexto dos principais concorrentes abertos. É open weights, então dá para rodar em infraestrutura própria se você tiver as GPUs.
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3-next-80b-a3b-thinking |
| Criador | qwen |
| Preço de entrada | US$ 0.150 / M tokens |
| Preço de saída | US$ 1.20 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text->text |
| Índice de inteligência (AA) | 16.9 |
| Índice de código | 17.4 |
| Índice agêntico | 2.1 |
| Parâmetros | 80B (3B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 197 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
Onde ele se encaixa no tabuleiro
Olhando só o índice de inteligência medido hoje, o Qwen3-Next Thinking entra em terceiro lugar geral — atrás do o3 e do gpt-oss-120b da OpenAI, e à frente do gpt-oss-20b e do Llama 4 Maverick da Meta. Nada mal para um modelo chinês de raciocínio custando US$ 1,20 de saída. Mas a comparação justa não é com o o3: é com os outros modelos abertos que custam uma fração disso.
O gpt-oss-120b, da própria OpenAI, marca 24,13 de IQ e cobra US$ 0,17 por milhão de tokens de saída — sete vezes mais barato que o Qwen3-Next Thinking e ainda mais inteligente pelo índice atual. O gpt-oss-20b fica em 15,22 de IQ por US$ 0,13. Em outras palavras: se o seu critério é inteligência por dólar, os modelos abertos da OpenAI ainda vencem. O Qwen3-Next Thinking só passa a fazer sentido quando você precisa de algo específico da família — janela grande, comportamento de raciocínio explícito, ou simplesmente uma alternativa chinesa no portfólio.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Qwen3 Next 80B A3B Thinking (o novo) | 16.9 | 0.15 | 1.2 | 262k |
| o3 | 31.1 | 2 | 8 | 200k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
| gpt-oss-20b | 15.2 | 0.03 | 0.13 | 131k |
A família completa lançada hoje
A Alibaba não soltou só o Thinking. Vieram três variantes no mesmo dia:
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Qwen3 Next 80B A3B Instruct | 0.1 | 1.1 | 262k |
| Qwen3 Next 80B A3B Instruct | 0 | 0 | 262k |
A versão Instruct (não-raciocínio) sai por US$ 1,10 por milhão de tokens de saída — basicamente o mesmo preço, mas sem os traces de pensamento. E tem uma versão Instruct gratuita, com rate limit de provedor, para quem quer testar antes de colocar na produção.
Para quem vale — e para quem não muda nada
Vale se você está construindo um agente ou um pipeline de código que consome muito token de saída e precisa de uma alternativa mais barata que o o3, sem abrir mão de janela de contexto longa e de comportamento de raciocínio nativo. Vale também se você quer diversificar fornecedor — a família é chinesa, open weights, e roda na sua infra se você tiver as placas.
Não muda nada se o seu gargalo é qualidade bruta de raciocínio: o o3 continua bem à frente no índice de inteligência e o gpt-oss-120b oferece mais inteligência por menos dinheiro. Também não muda nada se você já está satisfeito com o gpt-oss-20b para tarefas mais simples — pagar US$ 1,20 em vez de US$ 0,13 só se justifica se o salto de 15 para 17 de IQ fizer diferença real no seu produto.
O que fazer com isso
Se você está rodando agente ou código hoje no o3, vale um teste A/B com o Qwen3-Next Thinking: a economia por token é grande o suficiente para compensar um eventual retrabalho de prompt. Se você está no gpt-oss-120b, a troca só compensa se você precisar de algo que o modelo da OpenAI não entrega — e isso é uma decisão de produto, não de custo. E se você ainda não tem um modelo de raciocínio no stack, a versão Instruct gratuita é o ponto de entrada mais barato para experimentar.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Rode o Qwen3-Next Thinking como segundo modelo de raciocínio ao lado do o3 ou do gpt-oss-120b — vale pelo preço em workloads de agente e código, mas não substitui o topo do índice de inteligência.
Perguntas frequentes
Quanto custa o Qwen3-Next 80B A3B Thinking na API?
Cobra US$ 0,15 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída. Não há preço de cache publicado pelo catálogo. A versão Instruct sem raciocínio sai por US$ 0,10 de entrada e US$ 1,10 de saída, e existe uma variante Instruct gratuita com rate limit de provedor.
O Qwen3-Next Thinking é melhor que o o3?
Não. Pelo índice de inteligência medido hoje, o o3 marca 31,10 contra 16,87 do Qwen3-Next Thinking. O ponto do lançamento é preço: o o3 custa US$ 8 por milhão de tokens de saída, quase sete vezes mais caro. É uma troca entre qualidade bruta de raciocínio e custo por token.
O que significa "3B ativos em 80B totais"?
É uma arquitetura Mixture-of-Experts: o modelo tem 80 bilhões de parâmetros no total, mas só 3 bilhões são ativados para processar cada token. O resultado é um modelo grande em capacidade, mas com custo de inferência parecido com o de um modelo de 3 bilhões — por isso o preço de API mais baixo.