FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Qwen Plus 0728 thinking chega a US$ 0,78 por milhão de saída e pressiona o meio do ranking

Versão híbrida com 1 milhão de contexto da Alibaba custa 10 vezes menos que o o3 da OpenAI na saída, mas não tem índice de inteligência publicado.

Redação FalaVIP IA 3 min de leitura
US$ 0,78por milhão de tokens de saída
US$ 0,26por milhão de tokens de entrada
1.000.000tokens de contexto

O que muda quando o Alibaba aperta o lápis

Se você paga a conta da API no fim do mês, o número que importa hoje é este: a Qwen está cobrando US$ 0,78 por milhão de tokens de saída no Qwen Plus 0728 thinking, contra US$ 8,00 do OpenAI o3 no mesmo comparativo. São 10 vezes menos por cada resposta gerada — e essa é a conta que explode quando o seu produto encoda documentos inteiros ou devolve relatórios longos. A entrada custa US$ 0,26 por milhão, mesmo valor do gpt-oss-120b da OpenAI, então o ganho real está na ponta de saída.

A Alibaba soltou hoje duas variantes do mesmo modelo: a versão com raciocínio híbrido (a "thinking") e a versão padrão, ambas com 1 milhão de tokens de contexto e o mesmo preço. A diferença entre uma e outra está em como o modelo gasta tokens pensando antes de responder — a versão thinking usa o modo de raciocínio ligado, a outra responde direto.

Preço de saída (US$ por milhão de tokens)
Qwen Plus 07280,78o38gpt-oss-120b0,17gpt-oss-20b0,13US$/M
Fonte: OpenRouter

O que o release diz e o que a fatura mostra

O anúncio chama o modelo de "balanced performance, speed, and cost combination". Traduzindo: é a versão de meio de catálogo da família Qwen3, feita para rodar bem sem custar caro. O conhecimento vai até março de 2025 e o contexto é de 1 milhão de tokens, o que coloca o modelo no clube seleto dos que engolem livros inteiros de uma vez.

Mas tem um porém honesto: o índice de inteligência do modelo não foi publicado. Você não tem como comparar diretamente com o o3 (31,1) ou com o gpt-oss-120b (24,1) só olhando benchmark. O que você tem é preço, contexto e a descrição do criador. Se a sua decisão depende de nota em prova de raciocínio, este lançamento não te dá munição hoje.

Ficha técnica — Qwen Plus 0728
CampoValor
Identificadorqwen/qwen-plus-2025-07-28
Criadorqwen
Preço de entradaUS$ 0.260 / M tokens
Preço de saídaUS$ 0.780 / M tokens
Janela de contexto1M
Modalidadetext->text

Onde o Qwen Plus 0728 se encaixa no tabuleiro

Olhando o topo do catálogo hoje, o o3 da OpenAI lidera o índice de inteligência com folga, mas cobra US$ 8 por milhão de saída. Logo abaixo vem o gpt-oss-120b, também da OpenAI, com IQ 24,1 e saída a US$ 0,17 — é a referência de custo-benefício entre os modelos abertos da casa. O Llama 4 Maverick, da Meta, aparece com IQ 14,5 a US$ 0,696 de saída.

Índice de inteligência (Artificial Analysis)
o331,1gpt-oss-120b24,1gpt-oss-20b15,2índice
Fonte: Artificial Analysis

O Qwen Plus 0728 thinking entra nesse meio de tabela sem nota de IQ: mais caro na saída que o gpt-oss-120b, mais barato que o o3, com contexto dez vezes maior que os rivais da OpenAI listados aqui. É a aposta da Alibaba em ocupar o espaço de quem precisa de muito contexto sem pagar o topo do ranking.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Qwen Plus 0728 (o novo)0.260.781M
o331.128200k
gpt-oss-120b24.10.0370.17131k
gpt-oss-20b15.20.030.13131k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

A linha completa lançada hoje

A Alibaba não soltou um modelo só — soltou um par. A versão sem o sufixo "thinking" tem o mesmo preço de entrada e saída, mesmo contexto de 1 milhão, e responde sem o passo de raciocínio explícito. Para workloads que não precisam do modo thinking, é a mesma conta com latência menor.

Os outros modelos anunciados no mesmo dia
ModeloEntrada US$/MSaída US$/MContexto
Qwen Plus 0728 (thinking)0.260.781M

Para quem vale e para quem não muda nada

Vale para você se: está rodando tarefas com documentos grandes (contratos, codebases, PDFs longos) e o o3 está caro demais; se já usa a família Qwen3 e quer mais contexto sem trocar de fornecedor; se o seu produto consegue conviver com a ausência de benchmark público de inteligência.

Não muda nada se: você depende de uma nota de IQ conhecida para fechar contrato com cliente enterprise; se o seu caso de uso cabe em 128 mil tokens e o gpt-oss-120b já resolve por menos; se você está num pipeline que exige reasoning mode com benchmark auditado.

A implicação prática: se contexto longo é gargalo e o o3 está sangrando seu orçamento, vale testar o Qwen Plus 0728 thinking esta semana. Se inteligência medida é o que te prende, espere a próxima medição antes de trocar.

Em uma frase

Se contexto longo é gargalo e o o3 está caro, teste o Qwen Plus 0728 thinking esta semana; se você precisa de nota de IQ auditada, espere.

Perguntas frequentes

Quanto custa o Qwen Plus 0728 thinking por milhão de tokens?

US$ 0,26 por milhão de tokens de entrada e US$ 0,78 por milhão de tokens de saída. O catálogo não publicou preço de cache de leitura nesta listagem.

Qual a diferença entre Qwen Plus 0728 thinking e a versão padrão?

A versão thinking usa o modo de raciocínio híbrido ativado, gastando tokens para pensar antes de responder. A versão padrão responde direto. Ambas têm 1 milhão de contexto e o mesmo preço.

O Qwen Plus 0728 thinking tem benchmark de inteligência?

Não. O índice de inteligência não foi publicado para este modelo no catálogo, então não dá para comparar diretamente com o o3 (31,1) ou o gpt-oss-120b (24,1) só por benchmark.

Leia também