Qwen3 Max cobra R$ 4 por milhão de saída — e o catálogo não publicou benchmark
Lançado há quatro dias, o flagship da Alibaba entra caro no texto de saída e caro no de entrada, sem nota de inteligência nem de coding no índice usado pelo blog.
O que você paga antes de saber se ele é bom
Quatro dias após o lançamento, o Qwen3 Max aparece no catálogo com preço de flagship e sem nota de inteligência publicada. É a combinação que mais incomoda quem está olhando a fatura: US$ 0,78 por milhão de tokens de entrada e US$ 3,90 por milhão de saída — e, no índice que você acompanha aqui, os campos de IQ, coding e agentic estão vazios. Isso não quer dizer que o modelo é ruim; quer dizer que, hoje, você está comprando no escuro.
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3-max |
| Criador | qwen |
| Preço de entrada | US$ 0.780 / M tokens |
| Preço de saída | US$ 3.90 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.156 / M (80% de desconto) |
A conta que o release não mostra
O headline da Alibaba fala em melhorias de raciocínio, instruction following e cobertura multilíngue em relação à versão de janeiro. Bonito, mas a pergunta de quem paga API é outra: a quanto isso fica por chamada?
Pense num workload típico de agente: 50 mil tokens de entrada (system prompt + contexto + tool definitions) e 5 mil de saída. Em dólares: 0,039 de entrada + 0,0195 de saída = cerca de US$ 0,058 por turno. Multiplique por mil execuções e você chega a US$ 58. Em workload pesado, com 200 mil tokens de entrada e 20 mil de saída, o turno sobe para US$ 0,234. Em cem mil execuções, são US$ 23.400. O cache de US$ 0,156 por milhão ajuda em prompts repetitivos, mas não muda a conta de quem está gerando muito token de saída.
Traduzindo o marketing: o que ficou mais barato em relação ao que? Sem comparativo oficial da própria Qwen, a frase “major improvements” é só promessa.
Onde o Qwen3 Max se encaixa no tabuleiro
Olhando o topo do catálogo nesta data, o cenário é claro: o o3 da OpenAI lidera em IQ (31,096) cobrando US$ 8 por milhão de saída; o gpt-oss-120b vem logo abaixo (IQ 24,126) por US$ 0,17 de saída — quase 23 vezes mais barato que o Qwen3 Max no output. O Qwen3 Next 80B A3B Thinking, da própria Alibaba, marca IQ 16,867 a US$ 1,20 de saída. O Llama 4 Maverick, da Meta, fica em IQ 14,477 a US$ 0,696.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Ou seja: no mesmo catálogo, há modelo da própria Qwen custando um terço do preço de saída do Max, e modelo open weights da OpenAI custando 4% do preço. O Max entra como peça premium da casa, não como opção default.
Para quem vale — e para quem não muda nada
Vale se você precisa de janela de 256 mil tokens e está extraindo texto longo em chinês ou em cenários multilíngues onde a cobertura de “long-tail knowledge” prometida faça diferença real no seu caso de uso. Vale também se você já roda workloads na Qwen e quer testar in-place a versão topo de linha antes de decidir.
Não muda nada se você está otimizando custo por chamada: o gpt-oss-120b destrói o Max no preço de saída com folga. Não muda nada se você precisa de uma nota de benchmark para justificar a escolha internamente — sem IQ publicado, a conversa com o time financeiro fica mais difícil. E não muda nada se você já usa o3 e está satisfeito com raciocínio: o Max chega mais barato na entrada (US$ 0,78 contra US$ 8 de saída do o3 é outra conta), mas sem número comparável de capacidade, a troca é um salto no escuro.
O que falta para essa ficha fechar
Três coisas que mudariam o cálculo: nota de IQ no índice do catálogo, número de coding e agentic, e pelo menos um comparativo de preço/desempenho contra o3 e contra o próprio Qwen3 Next Thinking. Enquanto isso não aparece, o Qwen3 Max é um flagship de preço flagship sem o número que sustentasse a escolha. Você paga caro pela promessa de ser o melhor da casa — e, por enquanto, está pagando para descobrir.
O que fazer na segunda-feira
Se você já roda Qwen: faça um A/B curto entre Max e o Qwen3 Next 80B A3B Thinking no seu workload real, medindo qualidade por caso de uso, não por benchmark genérico. Se você está vindo de outro fornecedor: espere a nota de IQ sair antes de migrar carga de produção. E se o seu gargalo é custo de saída, o gpt-oss-120b continua sendo o ponto de referência do catálogo — o Max entra para brigar em outro jogo.
Só vale trocar para o Qwen3 Max se você precisa dos 256k de contexto e testa ganho real no seu workload; sem benchmark publicado, é compra no escuro a preço de flagship.
Perguntas frequentes
Quanto custa o Qwen3 Max na API?
US$ 0,78 por milhão de tokens de entrada e US$ 3,90 por milhão de tokens de saída, com cache a US$ 0,156 por milhão. É preço de modelo topo de linha, sem desconto agressivo de lançamento.
O Qwen3 Max tem benchmark de inteligência publicado?
Não no índice usado pelo blog até esta data. Os campos de IQ, coding e agentic estão vazios, então a comparação com o3, gpt-oss-120b e Qwen3 Next Thinking não é possível por número público.
Qwen3 Max é melhor que o gpt-oss-120b?
Sem nota comparável, não dá para afirmar. O que dá para dizer é de preço: o gpt-oss-120b custa US$ 0,17 por milhão de saída, quase 23 vezes menos que o Max. A escolha depende de você medir qualidade no seu caso de uso.