FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Max Thinking estreia a US$ 3,90 por milhão de saída: vale o que cobra?

Flagship de raciocínio da Qwen chega com contexto de 256k e preço agressivo, mas sem índice de inteligência publicado — o que pesa contra o3 e Claude Haiku 4.5.

Redação FalaVIP IA 3 min de leitura
US$ 0,78por milhão de tokens de entrada
US$ 3,90por milhão de tokens de saída
262.144tokens de contexto

O que está em jogo nesta segunda-feira

Você está olhando para um modelo que a Qwen apresenta como o flagship de raciocínio da família Qwen3, lançado hoje, 9 de fevereiro de 2026. A pergunta que importa não é se ele é "poderoso" — todo lançamento diz isso. A pergunta é: pelo preço que ele cobra, em qual fila do mercado ele entra, e contra quem ele perde de goleada.

O preço que aparece no catálogo

O Qwen3 Max Thinking cobra US$ 0,78 por milhão de tokens de entrada e US$ 3,90 por milhão de tokens de saída. Não é o mais barato da prateleira — o catálogo tem modelos como o gpt-oss-120b da OpenAI saindo a US$ 0,17 por milhão de saída, e o MiMo-V2-Flash da Xiaomi a US$ 0,30. Mas também não está no topo da conta: o o3 da OpenAI cobra US$ 8 por milhão de saída, mais que o dobro.

O detalhe que faz diferença para quem paga a API: o campo de cache está vazio no catálogo. Isso não é falha de cadastro — significa que a Qwen não publicou preço diferenciado para leitura em cache, então quem reaproveita prompt pesado todo mês não vai economizar aqui.

Ficha técnica — Qwen3 Max Thinking
CampoValor
Identificadorqwen/qwen3-max-thinking
Criadorqwen
Preço de entradaUS$ 0.780 / M tokens
Preço de saídaUS$ 3.90 / M tokens
Janela de contexto262k
Modalidadetext->text

O que o catálogo NÃO te conta sobre ele

Aqui está o problema. O Qwen3 Max Thinking entra no ar sem índice de inteligência publicado, sem nota de coding, sem nota agentic, sem blended. Você não tem como comparar objetivamente com o3, Claude Haiku 4.5 ou qualquer outro da prateleira usando os números do próprio catálogo.

Para situar o leitor, vale olhar quem está no topo medido hoje: o MiMo-V2-Flash da Xiaomi lidera com IQ 34,024 a US$ 0,30 por milhão de saída; o o3 da OpenAI vem em segundo com IQ 31,096 a US$ 8; o Claude Haiku 4.5 da Anthropic está em terceiro com IQ 29,892 a US$ 5. São os três modelos contra os quais o Qwen3 Max Thinking vai ser cobrado em reunião de planejamento.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Coder Next21.30.8
Entre os 331 modelos disponíveis no catálogo nesta data.

A descrição oficial diz que o modelo foi projetado para "tarefas cognitivas de alto risco que exigem raciocínio profundo e multi-step", com capacidade e RL compute significativamente escalados. É a linguagem típica de quem está vendendo um reasoning model — mas não traz benchmark, não traz comparação com a concorrência, não traz número que você possa checar.

Para quem ele faz sentido

Se você está montando um pipeline que precisa de cadeia de raciocínio longa — análise jurídica, planejamento multi-etapa, debug de código com várias hipóteses — e o o3 está estourando o orçamento, o Qwen3 Max Thinking aparece como alternativa de preço intermediário. Os 262.144 tokens de contexto são generosos: dá para enfiar um repositório inteiro ou um contrato de 200 páginas sem fatiar.

Se você roda a mesma chamada mil vezes por dia num agente, o cálculo é direto: a US$ 3,90 por milhão de saída, mil chamadas de 2.000 tokens de resposta custam cerca de US$ 7,80. No o3, o mesmo volume sai por US$ 16. No Claude Haiku 4.5, US$ 10. A diferença existe — mas só se o modelo entregar raciocínio equivalente, e isso o catálogo não te diz.

Para quem ele NÃO muda nada

Se você já está feliz com o Claude Haiku 4.5 ou com o o3 e tem benchmark próprio validando, não há motivo para trocar sem teste. Se o seu caso de uso é classificação simples, extração de entidade ou resumo curto, qualquer modelo pequeno de US$ 0,17 a US$ 0,80 por milhão de saída entrega o mesmo com conta menor.

E se você é do time que precisa de pesos abertos para rodar on-premise ou fine-tunar, o campo open_weights está vazio no catálogo — ou seja, não há informação publicada de que o Qwen3 Max Thinking seja aberto. Trate como modelo fechado até segunda ordem.

O que fazer agora

Espere uma semana. O catálogo costuma absorver benchmarks independentes em poucos dias, e a ausência de IQ publicado hoje é um sinal de que os números ainda não estabilizaram. Enquanto isso, rode um lote pequeno do seu caso de uso mais caro — aquele que dói na fatura — comparando contra o Haiku 4.5. Se o Qwen3 Max Thinking entregar paridade de qualidade a metade do preço do o3, a conta muda. Se não entregar, ele vira só mais um nome na prateleira de 331 modelos.

Em uma frase

Rode um teste cego do seu caso de uso mais caro contra o Claude Haiku 4.5 antes de migrar; sem benchmark publicado, o preço sozinho não justifica trocar o o3.

Perguntas frequentes

Quanto custa o Qwen3 Max Thinking?

US$ 0,78 por milhão de tokens de entrada e US$ 3,90 por milhão de tokens de saída. O catálogo não publicou preço de cache de leitura, então não há desconto para reaproveitamento de prompt nesse modelo.

Qwen3 Max Thinking é modelo de raciocínio?

Sim. A Qwen o apresenta como flagship de raciocínio da família Qwen3, voltado para tarefas com cadeia multi-step. Porém, o catálogo não publicou índice de inteligência, nota de coding nem agentic nesta data, então não dá para ranquear contra o3 ou Claude Haiku 4.5 pelos números do próprio catálogo.

Vale trocar o o3 pelo Qwen3 Max Thinking?

Depende do seu caso. Em preço de saída o Qwen3 Max Thinking custa menos da metade do o3 (US$ 3,90 contra US$ 8 por milhão). Mas sem benchmark publicado, a troca só compensa se você validar qualidade equivalente em teste cego no seu workload antes de migrar.

Leia também