FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Qwen3 Max Thinking cobra metade do o3 — mas sem nota de IQ

Sem nota de inteligência publicada, a economia do novo modelo de raciocínio da Qwen é uma promessa, não uma conclusão.

Redação FalaVIP IA 3 min de leitura
US$ 3,90por milhão de tokens de saída
262.144tokens de contexto
17modelos lançados nos últimos 30 dias no catálogo

A Qwen colocou no catálogo, hoje (9 de fevereiro), o Qwen3 Max Thinking, modelo topo de linha da série Qwen3 voltado para raciocínio profundo. A primeira coisa que o desenvolvedor olha — o preço de saída — já entrega a jogada: US$ 3,90 por milhão de tokens. É menos da metade do o3, da OpenAI, que cobra US$ 8 pelo mesmo volume.

Preço de saída (US$ por milhão de tokens)
Qwen3 Max Thinking3,9MiMo-V2-Flash0,3o38Claude Haiku 4.55US$/M
Fonte: OpenRouter

O que está dentro da caixa

O Qwen3 Max Thinking é descrito pela própria Qwen como um modelo para high-stakes cognitive tasks — tarefas que exigem raciocínio multi-etapa, do tipo que aparece em agentes de planejamento, análise de código complexo ou simulação de cenários. A janela de contexto é de 262.144 tokens, um dos maiores contextos do mercado hoje.

A conta por uso: US$ 0,78 por milhão de tokens de entrada, US$ 3,90 por milhão de saída. O catálogo não publicou preço de cache. Modalidade é texto para texto. Não é gratuito e o status de open weights não foi declarado.

Ficha técnica — Qwen3 Max Thinking
CampoValor
Identificadorqwen/qwen3-max-thinking
Criadorqwen
Preço de entradaUS$ 0.780 / M tokens
Preço de saídaUS$ 3.90 / M tokens
Janela de contexto262k
Modalidadetext->text

O cenário em que ele entra

Para situar o leitor: o catálogo tem hoje 331 modelos, vindos de 52 criadores diferentes. Nos últimos 30 dias, 17 modelos novos entraram — não é exagero dizer que todo dia tem lançamento. Dentro desse barulho, o Qwen3 Max Thinking aparece como o carro-chefe de uma das principais linhas de modelos da casa.

A régua atual de inteligência, medida pelo índice Artificial Analysis, tem a Xiaomi no topo com o MiMo-V2-Flash (IQ 34,024, a US$ 0,30 por milhão de saída). Logo atrás vem o o3, da OpenAI, com IQ 31,096 a US$ 8. Terceiro é o Claude Haiku 4.5, da Anthropic, com IQ 29,892 a US$ 5.

Índice de inteligência (Artificial Analysis)
MiMo-V2-Flash34o331,1Claude Haiku 4.529,9índice
Fonte: Artificial Analysis

Em preço de saída, o Qwen3 Max Thinking entra num ponto intermediário — mais caro que o MiMo, mais barato que o Haiku 4.5, bem abaixo do o3. Em custo-benefício bruto, o posicionamento é agressivo. Mas a comparação completa só fecha quando se olha capacidade, e é aí que mora o porém.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Qwen3 Max Thinking (o novo)0.783.9262k
MiMo-V2-Flash34.00.10.3262k
o331.128200k
Claude Haiku 4.529.915200k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

O que não foi divulgado

A Qwen não publicou, pelo menos não no catálogo, a nota de IQ do modelo, nem os benchmarks de coding e agentic, nem o blended. Também ficaram de fora país de origem, número de parâmetros, velocidade, janela de conhecimento e status de open weights. Esses campos estão nulos.

Para quem decide por capacidade medida, isso trava a análise. A nota de IQ é o termômetro que permite comparar diretamente o Qwen3 Max Thinking com o o3, com o Claude Haiku 4.5 e com o MiMo-V2-Flash. Sem ela, a economia de US$ 4,10 por milhão de tokens na saída é uma promessa — não uma conclusão.

Para quem isso muda a conta

Se você roda workloads de raciocínio pesado e o o3 era o default, o Qwen3 Max Thinking entra como candidato imediato a cortar a fatura. Em 100 milhões de tokens de saída por mês, a diferença entre US$ 3,90 e US$ 8,00 são US$ 410 a menos — sem mexer em uma linha de código. A própria estrutura de preço — entrada mais barata que saída, como é padrão, mas com a saída bem abaixo do o3 — é um sinal claro de que a Qwen está mirando no segmento que paga caro por raciocínio, não no segmento de alto volume de baixo custo.

Se o seu gargalo é teto de inteligência medida, o MiMo-V2-Flash da Xiaomi segue sendo a referência atual, e por um décimo do preço de saída do novo Qwen. Se você já está satisfeito com Claude Haiku 4.5, a economia existe, mas é menor — US$ 1,10 por milhão.

O que fazer agora

Espere a nota de IQ e os benchmarks de coding e agentic. Até lá, o Qwen3 Max Thinking é uma aposta em custo, não em capacidade comprovada. Na prática, isso significa: se a sua dor é a fatura do o3, vale rodar uma amostra de produção no novo modelo e medir qualidade das respostas antes de migrar. Comece com workloads não-críticos — resumos de documentos longos, classificação, planejamento de agentes — e veja se a saída faz sentido. Se a dor é o teto de inteligência atual, o MiMo-V2-Flash continua sendo o melhor IQ por dólar do catálogo hoje.

Em uma frase

Antes de migrar do o3 para o Qwen3 Max Thinking, meça qualidade em produção — a economia de US$ 4,10 por milhão de tokens de saída só vale se o raciocínio entregue for equivalente.

Perguntas frequentes

O Qwen3 Max Thinking é melhor que o o3?

Ainda não dá para saber. A Qwen não publicou a nota de IQ nem os benchmarks de coding e agentic. Por enquanto, é uma aposta em custo (US$ 3,90 contra US$ 8 do o3 por milhão de tokens de saída), não em capacidade comprovada.

Vale trocar o o3 pelo Qwen3 Max Thinking?

Depende do workload. Se o gargalo é a fatura de tokens de saída em tarefas de raciocínio pesado, a economia é grande — US$ 4,10 por milhão. Mas sem nota de IQ publicada, é prudente rodar uma amostra de produção antes de migrar.

O que o Qwen3 Max Thinking tem de diferente?

É o modelo flagship de raciocínio da Qwen3, com 262.144 tokens de contexto, descrito como voltado para tarefas cognitivas multi-etapa com aumento de capacidade de modelo e de compute de aprendizado por reforço.

Leia também