FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Thinking estreia cobrando 9× mais que gpt-oss-20b no token de saída

Modelo de raciocínio chinês tem 80B de parâmetros totais e só 3B ativos. A conta sai cara, mas há um nicho onde a conta fecha.

Redação FalaVIP IA 3 min de leitura
US$ 1,20por milhão de tokens de saída
3 bilhõesde parâmetros ativos em 80B totais
1,642 ponto de QIde diferença para a gpt-oss-20b

Pagar US$ 1,20 por milhão de tokens de saída é uma escolha, não um padrão. E a Qwen3 Next 80B A3B Thinking, que estreia hoje no catálogo, faz você pagar exatamente isso. A alternativa open-weight americana, a gpt-oss-20b, sai por US$ 0,13 pelo mesmo milhão — quase nove vezes menos. O ganho de inteligência no índice da Artificial Analysis? 1,642 ponto de QI. Senta, abre a fatura e decide.

Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Thinking1,2gpt-oss-20b0,13Llama 4 Maverick0,696Qwen3 Next 80B A3B Instruct1,1US$/M
Fonte: OpenRouter

O prêmio do "thinking"

A Qwen3 Thinking é a variante raciocinante da nova linha Qwen3-Next. A Instruct, lançada no mesmo dia, sai por US$ 1,10 por milhão de tokens de saída e marca QI 13,754. A Thinking, que emite traços de raciocínio estruturados por padrão, sobe para 16,867 — a US$ 0,10 a mais por milhão de saída. É a versão desenhada para problemas multi-passo: prova matemática, síntese e debug.

Colocando em perspectiva: o o3 da OpenAI, topo absoluto do catálogo hoje, cobra US$ 8,00 por milhão de tokens de saída e entrega QI 31,096. A Qwen3 Thinking entrega 54% dessa inteligência por 15% do preço. Não é mau negócio — mas também não é óbvio quando há opções mais baratas logo abaixo.

80 bilhões no papel, 3 bilhões na prática

A arquitetura é o que explica a velocidade. São 80 bilhões de parâmetros totais, mas só 3 bilhões ativos por passada (Mixture-of-Experts). É a mesma receita que a OpenAI usou no gpt-oss-20b (21B totais, 3,6B ativos) e a que a própria Qwen repete na Instruct do mesmo dia. Resultado prático: 196,94 tokens por segundo — a melhor velocidade entre os raciocinantes desse patamar.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Qwen3 Next 80B A3B Thinking (o novo)16.90.151.2262k
gpt-oss-20b15.20.030.13131k
Llama 4 Maverick14.50.20.6961.05M
Qwen3 Next 80B A3B Instruct13.80.11.1262k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

O problema é que velocidade sem preço baixo não move a agulha do custo total quando o volume escala. A Llama 4 Maverick (MoE 17B ativos, multimodal, contexto de 1 milhão de tokens) cobra US$ 0,696 por milhão de saída e entrega QI 14,477. A gpt-oss-20b cobra US$ 0,13 e entrega QI 15,225 — com metade do contexto (131K tokens) e velocidade menor (112,6 t/s). Em coding, a americana também ganha: 20,697 contra 17,419 da chinesa.

Onde ela se encaixa no tabuleiro

A Qwen3 Thinking é o terceiro modelo mais inteligente do catálogo de 227 modelos hoje, atrás apenas de o3 (QI 31,096) e gpt-oss-120b (QI 24,126). E aqui está o detalhe que incomoda: a gpt-oss-120b cobra US$ 0,17 por milhão de tokens de saída — quase sete vezes menos que a Qwen3 Thinking — e entrega 7,3 pontos de QI a mais. A chinesa não é o melhor negócio nem mesmo entre os raciocinantes de topo.

Inteligência × preço de saída
Qwen3 Next 80B A3B Thinkinggpt-oss-20bLlama 4 MaverickQwen3 Next 80B A3B InstructUS$ por milhão (saída, escala log)índice de inteligência

Em agentic (uso de ferramentas e autonomia), a Qwen3 Thinking marca 2,062 — abaixo dos 3,103 da gpt-oss-20b e acima dos 1,237 da Maverick. A especialidade declarada é raciocínio puro em cadeia longa. Detalhe operacional relevante: o catálogo não publicou preço de cache para a Qwen3 Thinking — informação que pesa em pipelines com re-leitura intensiva, onde a gpt-oss-20b (US$ 0,03/M de cache) leva vantagem clara.

Para quem vale (e para quem não muda nada)

Vale a pena se: você está montando pipeline de raciocínio em produção, precisa de 262 mil tokens de contexto (o dobro da gpt-oss-20b), quer pesos abertos para rodar localmente ou fazer fine-tune, e o volume de saída cabe no orçamento. A relação velocidade/inteligência nesse recorte é a melhor entre os raciocinantes chineses.

Não muda nada se: você já roda gpt-oss-20b e a conta da API dói. 1,6 ponto de QI não paga nove vezes mais no token de saída. E se a sua carga é agentic, a americana segue à frente (3,103 vs 2,062).

Ficha técnica — Qwen3 Next 80B A3B Thinking
CampoValor
Identificadorqwen/qwen3-next-80b-a3b-thinking
Criadorqwen
Preço de entradaUS$ 0.150 / M tokens
Preço de saídaUS$ 1.20 / M tokens
Janela de contexto262k
Modalidadetext->text
Índice de inteligência (AA)16.9
Índice de código17.4
Índice agêntico2.1
Parâmetros80B (3B ativos por token)
Pesosabertos
Velocidade de saída197 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

O catálogo publicou 16 modelos nos últimos 30 dias, vindos de 38 criadores diferentes. A Qwen dobrou a aposta em raciocínio aberto. Para a maioria das filas em produção, a gpt-oss-20b continua sendo a escolha racional em custo. Para quem precisa de mais contexto, mais velocidade e está disposto a pagar o prêmio, a Qwen3 Thinking finalmente apareceu.

Em uma frase

Se a fatura de API pesa e 131K de contexto dá conta do recado, a gpt-oss-20b segue sendo a escolha racional; a Qwen3 Thinking entra quando o pipeline realmente precisa dos 262K de contexto e aceita pagar US$ 1,20 por milhão de tokens de saída pelo privilégio.

Perguntas frequentes

Qwen3 Next Thinking é melhor que a gpt-oss-20b em raciocínio?

Em QI geral, sim (16,867 vs 15,225) e tem o dobro de contexto. Em coding, não (17,419 vs 20,697). Em agentic, não (2,062 vs 3,103). E custa quase 10× mais por milhão de tokens de saída. A escolha depende do peso de cada métrica no seu pipeline.

Por que a Qwen3 Thinking cobra US$ 1,20 por milhão de tokens de saída?

O catálogo não explica a precificação, mas o valor reflete o posicionamento como raciocinante de topo com 80B de parâmetros totais e pesos abertos. A variante Instruct da mesma linha sai por US$ 1,10 — o prêmio de US$ 0,10 é o custo do modo Thinking ativo por padrão.

A Qwen3 Thinking roda localmente?

Sim, os pesos são abertos sob licença Apache. São 80B totais com 3B ativos por passada, então a inferência exige hardware compatível com a arquitetura MoE em escala. Para a maioria dos casos de produção, a API ainda sai mais barata do que subir a própria infraestrutura.

Leia também