FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 30B Thinking custa 70% menos que o o3 — mas só se você usar tudo

Modelo MoE de raciocínio da Alibaba entra no catálogo com preço agressivo de saída e contexto de 82 mil tokens; entenda onde ele ganha e onde perde.

Redação FalaVIP IA 3 min de leitura
US$ 0,20por milhão de tokens de entrada
US$ 2,40por milhão de tokens de saída
82 miltokens de contexto

Onze dias depois de entrar no catálogo, o Qwen3 30B A3B Thinking 2507 ainda não apareceu na régua de inteligência do índice — e isso diz alguma coisa sobre como ele se vende. O preço é o chamariz: US$ 0,20 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída. Compare com o OpenAI o3, que lidera o ranking hoje com IQ 31,096 e custa US$ 8 por milhão de saída. A conta é simples: o Qwen3 Thinking cobra 70% menos para gerar texto do que o topo absoluto da categoria. Só que essa conta só fecha se você usar o modelo do jeito que ele foi desenhado — e aqui entra a primeira tensão que o release não explica.

O que é o Thinking mode, em uma frase

Pense em um chef que precisa mostrar o rascunho da receita antes de servir o prato. O Qwen3 Thinking é treinado para isso: ele separa o raciocínio interno da resposta final. Em tarefas de várias etapas — planejamento, debug de código, problemas de lógica com várias restrições — esse modo “thinking” é o que entrega qualidade. Em tarefas curtas e diretas, ele é desperdício de tokens e de latência. A descrição oficial é clara: “otimizado para tarefas complexas que exigem pensamento estendido em múltiplas etapas”. Traduzindo: se o seu prompt cabe num tweet, você está pagando caro por um canhão.

O preço que parece bom tem um truque

A proporção entre entrada e saída é de 1 para 12. Em modelos de raciocínio isso é comum, porque o Thinking mode consome muitos tokens de saída com os rastros internos. Na prática, cada requisição sua vai gerar uma fatura puxada pelo output, não pelo input. Quem manda 500 tokens de pergunta e recebe 50 tokens de resposta está pagando, no fundo, mais caro do que a tabela sugere. Quem manda pouco e recebe muito raciocínio + resposta longa está aproveitando o desconto real.

Ficha técnica — Qwen3 30B A3B Thinking 2507
CampoValor
Identificadorqwen/qwen3-30b-a3b-thinking-2507
Criadorqwen
Preço de entradaUS$ 0.200 / M tokens
Preço de saídaUS$ 2.40 / M tokens
Janela de contexto82k
Modalidadetext->text

Onde ele se encaixa no tabuleiro de hoje

O catálogo tem 224 modelos listados hoje, vindos de 38 criadores. No topo da régua de inteligência estão OpenAI o3 (IQ 31,096), OpenAI gpt-oss-120b (24,126) e OpenAI gpt-oss-20b (15,225). Logo abaixo aparece o primeiro Meta: Llama 4 Maverick, com IQ 14,477 e preço de US$ 0,696 por milhão de saída — quase 3,5 vezes mais barato que o Qwen3 Thinking. Se você não precisa de Thinking mode, o Maverick é a comparação honesta. Se precisa, o Qwen entra num nicho onde quase ninguém cobra tão pouco.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Llama 4 Scout10.30.3
Entre os 224 modelos disponíveis no catálogo nesta data.

Lançado em 28 de agosto, o modelo já acumula 11 dias de catálogo. O knowledge cutoff é 30 de junho de 2025 — recente, dentro do que há de mais novo no índice.

Para quem vale — e para quem não muda nada

Vale se você está montando um pipeline de agente que precisa planejar antes de agir, ou se está depurando código com várias hipóteses, ou se está resolvendo problemas de matemática e lógica onde o passo a passo importa. O contexto de 82 mil tokens ajuda em tarefas longas: dá para colar uma base de código inteira ou um documento extenso e ainda sobrar espaço para o modelo pensar.

Não vale se você quer resposta rápida e curta — um classificador de intenção, um extrator de JSON, um chatbot de FAQ. Para isso, modelos menores e mais baratos entregam o mesmo com latência menor. Também não vale se a sua régua é “o modelo mais inteligente disponível”: o o3 lidera essa corrida e o Qwen3 Thinking não aparece no índice atual, o que sugere que o foco dele é outro — custo por raciocínio, não topo de régua.

O que fazer com isso amanhã de manhã

Se você já tem um agente em produção que gasta a maior parte da fatura em tokens de saída de um modelo de raciocínio, faça um teste A/B com o Qwen3 30B Thinking. Meça qualidade da resposta final, não do rastro de pensamento — é isso que chega para o usuário. Se a qualidade se mantiver, a economia potencial é grande. Se cair, você tem a régua para decidir quanto pagar a mais pelo o3. E se você está começando um projeto novo que não precisa de raciocínio estendido, ignore este modelo: ele não foi feito para você.

Em uma frase

Teste o Qwen3 30B Thinking em pipelines de agente que gastam muito em output de raciocínio; se a qualidade se mantiver, a economia sobre o o3 é de 70% por milhão de tokens de saída.

Perguntas frequentes

Quanto custa o Qwen3 30B A3B Thinking 2507?

US$ 0,20 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída. O catálogo não publicou preço de cache para este modelo.

O Qwen3 30B Thinking é melhor que o OpenAI o3?

O índice atual não traz nota de inteligência para o Qwen3 Thinking, então não há comparação direta. O o3 lidera a régua com IQ 31,096 e custa US$ 8 por milhão de saída — 3,3 vezes mais caro.

Quando o Thinking mode não vale a pena?

Em tarefas curtas e diretas como classificação, extração de JSON ou FAQ. O modo Thinking consome tokens de saída com raciocínio interno, então prompts pequenos pagam caro por um benefício que não usam.

Leia também