Qwen Plus 0728 thinking custa 10× menos que o o3 sem IQ publicado
Modelo entra no catálogo com 1 milhão de contexto e preço de meio-termo. Falta o número que diz se a conta fecha.
Os US$ 0,78 por milhão de tokens de saída do Qwen Plus 0728 thinking não são baratos nem caros — estão num pedaço do mercado que ainda não tem dono. O o3 da OpenAI cobra US$ 8 pelo mesmo milhão, dez vezes mais. O Llama 4 Maverick da Meta sai por US$ 0,696. O gpt-oss-120b, também da OpenAI, cai para US$ 0,17. O modelo da Qwen está espremido entre os dois extremos, com a promessa de raciocínio híbrido e janela de contexto de 1 milhão de tokens.
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen-plus-2025-07-28 |
| Criador | qwen |
| Preço de entrada | US$ 0.260 / M tokens |
| Preço de saída | US$ 0.780 / M tokens |
| Janela de contexto | 1M |
| Modalidade | text->text |
O que é "thinking" híbrido
A descrição oficial chama o Plus 0728 thinking de "hybrid reasoning model" baseado na fundação Qwen3. Em vez de sempre raciocinar passo a passo ou sempre responder direto, o modelo decide internamente quando vale a pena gastar mais computação pensando e quando a resposta direta basta. Pense nele como um colega que só pega o caderno para rascunho quando a pergunta é difícil — nas fáceis, responde de bate-pronto. O corte de conhecimento é março de 2025: recente, mas não é tempo real, e tudo que aconteceu depois desse marco o modelo não viu.
Sem IQ, sem cache, sem benchmark
Aqui está o ponto que o release não destaca e que define sua decisão de compra. O catálogo listou o Qwen Plus 0728 thinking há cinco dias e não trouxe IQ, nem score de coding, nem agentic, nem blended. Comparar diretamente com o o3 (IQ 31,096) ou com o próprio Qwen3 Next 80B A3B Thinking (IQ 16,867) fica em terreno de chute. Você está pagando US$ 0,26 de entrada e US$ 0,78 de saída sem número de capacidade publicado para colocar na planilha — e o catálogo também não divulgou preço de cache, o que tira outra variável do cálculo de quem repete muito o mesmo contexto.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Para quem vale — e para quem não muda nada
A vantagem real do Plus 0728 thinking está nos 1 milhão de tokens de contexto, não no preço. É a mesma ordem de grandeza do Llama 4 Maverick e está bem acima da média do mercado atual, que reúne mais de 227 modelos vindos de 38 criadores diferentes. Para workloads que precisam engolir repositórios inteiros, meses de log ou transcrições longas sem resumo, esse é o argumento que conta. Vale, então, para três perfis: quem estourou contexto em outros modelos e quer alternativa com margem, quem monta agentes com histórico longo sem pagar o topo da pirâmide, e quem está testando a família Qwen3 e quer um SKU de produção com preço tabelado.
Para quem busca o topo em raciocínio puro, o o3 segue imbatível mesmo custando dez vezes mais por token de saída. Para quem quer commodity barata, os gpt-oss da OpenAI continuam entregando mais barato e com IQ publicado: o gpt-oss-20b sai por US$ 0,13 e o gpt-oss-120b por US$ 0,17. Para esses dois perfis, o Plus 0728 thinking é um intermediário sem vantagem clara.
O que fazer antes de decidir
Espere o catálogo publicar os números de capacidade antes de migrar carga crítica. Até lá, use o Plus 0728 thinking em protótipo para sentir a qualidade no seu caso real: cole uma transcrição de call de vendas, analise um repositório grande, monte um agente com histórico de 500 mil tokens. A janela de 1 milhão é o argumento de venda e a única coisa que você consegue validar sozinho, sem precisar de benchmark externo. Se a qualidade segurar, a conta fecha. Se não segurar, você descobriu antes de botar em produção.
Trate o Qwen Plus 0728 thinking como protótipo até o catálogo publicar IQ e preço de cache — o argumento de venda real é a janela de 1 milhão de tokens, não o preço.
Perguntas frequentes
O Qwen Plus 0728 thinking tem benchmark de IQ publicado?
Não. O modelo entrou no catálogo há cinco dias e não trouxe IQ, score de coding nem agentic. Comparar diretamente com o o3 (IQ 31,096) ou com o Qwen3 Next 80B A3B Thinking (IQ 16,867) nesse momento é chute — falta dado de capacidade para colocar na planilha.
Quanto custa rodar 1 milhão de tokens no Qwen Plus 0728 thinking?
Para 1 milhão de tokens de entrada e 1 milhão de saída, a conta fica em US$ 1,04 — US$ 0,26 de input mais US$ 0,78 de output. É cerca de dez vezes mais barato em saída que o o3, mas sem nota publicada para comparar a qualidade pelo mesmo volume.
Vale trocar o o3 pelo Qwen Plus 0728 thinking?
Depende do seu gargalo. Se você precisa do topo em raciocínio puro, não — o o3 segue imbatível mesmo custando dez vezes mais. Se o gargalo é a janela de 1 milhão de tokens, o Plus 0728 thinking pode fazer sentido, mas só em protótipo até os benchmarks saírem.