FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Max cobra R$ 4 por milhão de saída — e o catálogo não publicou benchmark

Lançado há quatro dias, o flagship da Alibaba entra caro no texto de saída e caro no de entrada, sem nota de inteligência nem de coding no índice usado pelo blog.

Redação FalaVIP IA 3 min de leitura
US$ 3,90por milhão de tokens de saída
US$ 0,78por milhão de tokens de entrada
262.144tokens de contexto

O que você paga antes de saber se ele é bom

Quatro dias após o lançamento, o Qwen3 Max aparece no catálogo com preço de flagship e sem nota de inteligência publicada. É a combinação que mais incomoda quem está olhando a fatura: US$ 0,78 por milhão de tokens de entrada e US$ 3,90 por milhão de saída — e, no índice que você acompanha aqui, os campos de IQ, coding e agentic estão vazios. Isso não quer dizer que o modelo é ruim; quer dizer que, hoje, você está comprando no escuro.

Ficha técnica — Qwen3 Max
CampoValor
Identificadorqwen/qwen3-max
Criadorqwen
Preço de entradaUS$ 0.780 / M tokens
Preço de saídaUS$ 3.90 / M tokens
Janela de contexto262k
Modalidadetext->text
Leitura de cacheUS$ 0.156 / M (80% de desconto)

A conta que o release não mostra

O headline da Alibaba fala em melhorias de raciocínio, instruction following e cobertura multilíngue em relação à versão de janeiro. Bonito, mas a pergunta de quem paga API é outra: a quanto isso fica por chamada?

Pense num workload típico de agente: 50 mil tokens de entrada (system prompt + contexto + tool definitions) e 5 mil de saída. Em dólares: 0,039 de entrada + 0,0195 de saída = cerca de US$ 0,058 por turno. Multiplique por mil execuções e você chega a US$ 58. Em workload pesado, com 200 mil tokens de entrada e 20 mil de saída, o turno sobe para US$ 0,234. Em cem mil execuções, são US$ 23.400. O cache de US$ 0,156 por milhão ajuda em prompts repetitivos, mas não muda a conta de quem está gerando muito token de saída.

Traduzindo o marketing: o que ficou mais barato em relação ao que? Sem comparativo oficial da própria Qwen, a frase “major improvements” é só promessa.

Onde o Qwen3 Max se encaixa no tabuleiro

Olhando o topo do catálogo nesta data, o cenário é claro: o o3 da OpenAI lidera em IQ (31,096) cobrando US$ 8 por milhão de saída; o gpt-oss-120b vem logo abaixo (IQ 24,126) por US$ 0,17 de saída — quase 23 vezes mais barato que o Qwen3 Max no output. O Qwen3 Next 80B A3B Thinking, da própria Alibaba, marca IQ 16,867 a US$ 1,20 de saída. O Llama 4 Maverick, da Meta, fica em IQ 14,477 a US$ 0,696.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 240 modelos disponíveis no catálogo nesta data.

Ou seja: no mesmo catálogo, há modelo da própria Qwen custando um terço do preço de saída do Max, e modelo open weights da OpenAI custando 4% do preço. O Max entra como peça premium da casa, não como opção default.

Para quem vale — e para quem não muda nada

Vale se você precisa de janela de 256 mil tokens e está extraindo texto longo em chinês ou em cenários multilíngues onde a cobertura de “long-tail knowledge” prometida faça diferença real no seu caso de uso. Vale também se você já roda workloads na Qwen e quer testar in-place a versão topo de linha antes de decidir.

Não muda nada se você está otimizando custo por chamada: o gpt-oss-120b destrói o Max no preço de saída com folga. Não muda nada se você precisa de uma nota de benchmark para justificar a escolha internamente — sem IQ publicado, a conversa com o time financeiro fica mais difícil. E não muda nada se você já usa o3 e está satisfeito com raciocínio: o Max chega mais barato na entrada (US$ 0,78 contra US$ 8 de saída do o3 é outra conta), mas sem número comparável de capacidade, a troca é um salto no escuro.

O que falta para essa ficha fechar

Três coisas que mudariam o cálculo: nota de IQ no índice do catálogo, número de coding e agentic, e pelo menos um comparativo de preço/desempenho contra o3 e contra o próprio Qwen3 Next Thinking. Enquanto isso não aparece, o Qwen3 Max é um flagship de preço flagship sem o número que sustentasse a escolha. Você paga caro pela promessa de ser o melhor da casa — e, por enquanto, está pagando para descobrir.

O que fazer na segunda-feira

Se você já roda Qwen: faça um A/B curto entre Max e o Qwen3 Next 80B A3B Thinking no seu workload real, medindo qualidade por caso de uso, não por benchmark genérico. Se você está vindo de outro fornecedor: espere a nota de IQ sair antes de migrar carga de produção. E se o seu gargalo é custo de saída, o gpt-oss-120b continua sendo o ponto de referência do catálogo — o Max entra para brigar em outro jogo.

Em uma frase

Só vale trocar para o Qwen3 Max se você precisa dos 256k de contexto e testa ganho real no seu workload; sem benchmark publicado, é compra no escuro a preço de flagship.

Perguntas frequentes

Quanto custa o Qwen3 Max na API?

US$ 0,78 por milhão de tokens de entrada e US$ 3,90 por milhão de tokens de saída, com cache a US$ 0,156 por milhão. É preço de modelo topo de linha, sem desconto agressivo de lançamento.

O Qwen3 Max tem benchmark de inteligência publicado?

Não no índice usado pelo blog até esta data. Os campos de IQ, coding e agentic estão vazios, então a comparação com o3, gpt-oss-120b e Qwen3 Next Thinking não é possível por número público.

Qwen3 Max é melhor que o gpt-oss-120b?

Sem nota comparável, não dá para afirmar. O que dá para dizer é de preço: o gpt-oss-120b custa US$ 0,17 por milhão de saída, quase 23 vezes menos que o Max. A escolha depende de você medir qualidade no seu caso de uso.

Leia também