Qwen Plus 0728 thinking chega a US$ 0,78 por milhão de saída e pressiona o meio do ranking
Versão híbrida com 1 milhão de contexto da Alibaba custa 10 vezes menos que o o3 da OpenAI na saída, mas não tem índice de inteligência publicado.
O que muda quando o Alibaba aperta o lápis
Se você paga a conta da API no fim do mês, o número que importa hoje é este: a Qwen está cobrando US$ 0,78 por milhão de tokens de saída no Qwen Plus 0728 thinking, contra US$ 8,00 do OpenAI o3 no mesmo comparativo. São 10 vezes menos por cada resposta gerada — e essa é a conta que explode quando o seu produto encoda documentos inteiros ou devolve relatórios longos. A entrada custa US$ 0,26 por milhão, mesmo valor do gpt-oss-120b da OpenAI, então o ganho real está na ponta de saída.
A Alibaba soltou hoje duas variantes do mesmo modelo: a versão com raciocínio híbrido (a "thinking") e a versão padrão, ambas com 1 milhão de tokens de contexto e o mesmo preço. A diferença entre uma e outra está em como o modelo gasta tokens pensando antes de responder — a versão thinking usa o modo de raciocínio ligado, a outra responde direto.
O que o release diz e o que a fatura mostra
O anúncio chama o modelo de "balanced performance, speed, and cost combination". Traduzindo: é a versão de meio de catálogo da família Qwen3, feita para rodar bem sem custar caro. O conhecimento vai até março de 2025 e o contexto é de 1 milhão de tokens, o que coloca o modelo no clube seleto dos que engolem livros inteiros de uma vez.
Mas tem um porém honesto: o índice de inteligência do modelo não foi publicado. Você não tem como comparar diretamente com o o3 (31,1) ou com o gpt-oss-120b (24,1) só olhando benchmark. O que você tem é preço, contexto e a descrição do criador. Se a sua decisão depende de nota em prova de raciocínio, este lançamento não te dá munição hoje.
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen-plus-2025-07-28 |
| Criador | qwen |
| Preço de entrada | US$ 0.260 / M tokens |
| Preço de saída | US$ 0.780 / M tokens |
| Janela de contexto | 1M |
| Modalidade | text->text |
Onde o Qwen Plus 0728 se encaixa no tabuleiro
Olhando o topo do catálogo hoje, o o3 da OpenAI lidera o índice de inteligência com folga, mas cobra US$ 8 por milhão de saída. Logo abaixo vem o gpt-oss-120b, também da OpenAI, com IQ 24,1 e saída a US$ 0,17 — é a referência de custo-benefício entre os modelos abertos da casa. O Llama 4 Maverick, da Meta, aparece com IQ 14,5 a US$ 0,696 de saída.
O Qwen Plus 0728 thinking entra nesse meio de tabela sem nota de IQ: mais caro na saída que o gpt-oss-120b, mais barato que o o3, com contexto dez vezes maior que os rivais da OpenAI listados aqui. É a aposta da Alibaba em ocupar o espaço de quem precisa de muito contexto sem pagar o topo do ranking.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Qwen Plus 0728 (o novo) | — | 0.26 | 0.78 | 1M |
| o3 | 31.1 | 2 | 8 | 200k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
| gpt-oss-20b | 15.2 | 0.03 | 0.13 | 131k |
A linha completa lançada hoje
A Alibaba não soltou um modelo só — soltou um par. A versão sem o sufixo "thinking" tem o mesmo preço de entrada e saída, mesmo contexto de 1 milhão, e responde sem o passo de raciocínio explícito. Para workloads que não precisam do modo thinking, é a mesma conta com latência menor.
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Qwen Plus 0728 (thinking) | 0.26 | 0.78 | 1M |
Para quem vale e para quem não muda nada
Vale para você se: está rodando tarefas com documentos grandes (contratos, codebases, PDFs longos) e o o3 está caro demais; se já usa a família Qwen3 e quer mais contexto sem trocar de fornecedor; se o seu produto consegue conviver com a ausência de benchmark público de inteligência.
Não muda nada se: você depende de uma nota de IQ conhecida para fechar contrato com cliente enterprise; se o seu caso de uso cabe em 128 mil tokens e o gpt-oss-120b já resolve por menos; se você está num pipeline que exige reasoning mode com benchmark auditado.
A implicação prática: se contexto longo é gargalo e o o3 está sangrando seu orçamento, vale testar o Qwen Plus 0728 thinking esta semana. Se inteligência medida é o que te prende, espere a próxima medição antes de trocar.
Se contexto longo é gargalo e o o3 está caro, teste o Qwen Plus 0728 thinking esta semana; se você precisa de nota de IQ auditada, espere.
Perguntas frequentes
Quanto custa o Qwen Plus 0728 thinking por milhão de tokens?
US$ 0,26 por milhão de tokens de entrada e US$ 0,78 por milhão de tokens de saída. O catálogo não publicou preço de cache de leitura nesta listagem.
Qual a diferença entre Qwen Plus 0728 thinking e a versão padrão?
A versão thinking usa o modo de raciocínio híbrido ativado, gastando tokens para pensar antes de responder. A versão padrão responde direto. Ambas têm 1 milhão de contexto e o mesmo preço.
O Qwen Plus 0728 thinking tem benchmark de inteligência?
Não. O índice de inteligência não foi publicado para este modelo no catálogo, então não dá para comparar diretamente com o o3 (31,1) ou o gpt-oss-120b (24,1) só por benchmark.