Qwen3 Thinking estreia cobrando 9× mais que gpt-oss-20b no token de saída
Modelo de raciocínio chinês tem 80B de parâmetros totais e só 3B ativos. A conta sai cara, mas há um nicho onde a conta fecha.
Pagar US$ 1,20 por milhão de tokens de saída é uma escolha, não um padrão. E a Qwen3 Next 80B A3B Thinking, que estreia hoje no catálogo, faz você pagar exatamente isso. A alternativa open-weight americana, a gpt-oss-20b, sai por US$ 0,13 pelo mesmo milhão — quase nove vezes menos. O ganho de inteligência no índice da Artificial Analysis? 1,642 ponto de QI. Senta, abre a fatura e decide.
O prêmio do "thinking"
A Qwen3 Thinking é a variante raciocinante da nova linha Qwen3-Next. A Instruct, lançada no mesmo dia, sai por US$ 1,10 por milhão de tokens de saída e marca QI 13,754. A Thinking, que emite traços de raciocínio estruturados por padrão, sobe para 16,867 — a US$ 0,10 a mais por milhão de saída. É a versão desenhada para problemas multi-passo: prova matemática, síntese e debug.
Colocando em perspectiva: o o3 da OpenAI, topo absoluto do catálogo hoje, cobra US$ 8,00 por milhão de tokens de saída e entrega QI 31,096. A Qwen3 Thinking entrega 54% dessa inteligência por 15% do preço. Não é mau negócio — mas também não é óbvio quando há opções mais baratas logo abaixo.
80 bilhões no papel, 3 bilhões na prática
A arquitetura é o que explica a velocidade. São 80 bilhões de parâmetros totais, mas só 3 bilhões ativos por passada (Mixture-of-Experts). É a mesma receita que a OpenAI usou no gpt-oss-20b (21B totais, 3,6B ativos) e a que a própria Qwen repete na Instruct do mesmo dia. Resultado prático: 196,94 tokens por segundo — a melhor velocidade entre os raciocinantes desse patamar.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Qwen3 Next 80B A3B Thinking (o novo) | 16.9 | 0.15 | 1.2 | 262k |
| gpt-oss-20b | 15.2 | 0.03 | 0.13 | 131k |
| Llama 4 Maverick | 14.5 | 0.2 | 0.696 | 1.05M |
| Qwen3 Next 80B A3B Instruct | 13.8 | 0.1 | 1.1 | 262k |
O problema é que velocidade sem preço baixo não move a agulha do custo total quando o volume escala. A Llama 4 Maverick (MoE 17B ativos, multimodal, contexto de 1 milhão de tokens) cobra US$ 0,696 por milhão de saída e entrega QI 14,477. A gpt-oss-20b cobra US$ 0,13 e entrega QI 15,225 — com metade do contexto (131K tokens) e velocidade menor (112,6 t/s). Em coding, a americana também ganha: 20,697 contra 17,419 da chinesa.
Onde ela se encaixa no tabuleiro
A Qwen3 Thinking é o terceiro modelo mais inteligente do catálogo de 227 modelos hoje, atrás apenas de o3 (QI 31,096) e gpt-oss-120b (QI 24,126). E aqui está o detalhe que incomoda: a gpt-oss-120b cobra US$ 0,17 por milhão de tokens de saída — quase sete vezes menos que a Qwen3 Thinking — e entrega 7,3 pontos de QI a mais. A chinesa não é o melhor negócio nem mesmo entre os raciocinantes de topo.
Em agentic (uso de ferramentas e autonomia), a Qwen3 Thinking marca 2,062 — abaixo dos 3,103 da gpt-oss-20b e acima dos 1,237 da Maverick. A especialidade declarada é raciocínio puro em cadeia longa. Detalhe operacional relevante: o catálogo não publicou preço de cache para a Qwen3 Thinking — informação que pesa em pipelines com re-leitura intensiva, onde a gpt-oss-20b (US$ 0,03/M de cache) leva vantagem clara.
Para quem vale (e para quem não muda nada)
Vale a pena se: você está montando pipeline de raciocínio em produção, precisa de 262 mil tokens de contexto (o dobro da gpt-oss-20b), quer pesos abertos para rodar localmente ou fazer fine-tune, e o volume de saída cabe no orçamento. A relação velocidade/inteligência nesse recorte é a melhor entre os raciocinantes chineses.
Não muda nada se: você já roda gpt-oss-20b e a conta da API dói. 1,6 ponto de QI não paga nove vezes mais no token de saída. E se a sua carga é agentic, a americana segue à frente (3,103 vs 2,062).
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3-next-80b-a3b-thinking |
| Criador | qwen |
| Preço de entrada | US$ 0.150 / M tokens |
| Preço de saída | US$ 1.20 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text->text |
| Índice de inteligência (AA) | 16.9 |
| Índice de código | 17.4 |
| Índice agêntico | 2.1 |
| Parâmetros | 80B (3B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 197 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
O catálogo publicou 16 modelos nos últimos 30 dias, vindos de 38 criadores diferentes. A Qwen dobrou a aposta em raciocínio aberto. Para a maioria das filas em produção, a gpt-oss-20b continua sendo a escolha racional em custo. Para quem precisa de mais contexto, mais velocidade e está disposto a pagar o prêmio, a Qwen3 Thinking finalmente apareceu.
Se a fatura de API pesa e 131K de contexto dá conta do recado, a gpt-oss-20b segue sendo a escolha racional; a Qwen3 Thinking entra quando o pipeline realmente precisa dos 262K de contexto e aceita pagar US$ 1,20 por milhão de tokens de saída pelo privilégio.
Perguntas frequentes
Qwen3 Next Thinking é melhor que a gpt-oss-20b em raciocínio?
Em QI geral, sim (16,867 vs 15,225) e tem o dobro de contexto. Em coding, não (17,419 vs 20,697). Em agentic, não (2,062 vs 3,103). E custa quase 10× mais por milhão de tokens de saída. A escolha depende do peso de cada métrica no seu pipeline.
Por que a Qwen3 Thinking cobra US$ 1,20 por milhão de tokens de saída?
O catálogo não explica a precificação, mas o valor reflete o posicionamento como raciocinante de topo com 80B de parâmetros totais e pesos abertos. A variante Instruct da mesma linha sai por US$ 1,10 — o prêmio de US$ 0,10 é o custo do modo Thinking ativo por padrão.
A Qwen3 Thinking roda localmente?
Sim, os pesos são abertos sob licença Apache. São 80B totais com 3B ativos por passada, então a inferência exige hardware compatível com a arquitetura MoE em escala. Para a maioria dos casos de produção, a API ainda sai mais barata do que subir a própria infraestrutura.