FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen Plus 0728: o modelo de US$ 0,78 que ninguém está olhando

Lançado há seis dias pela Alibaba, o Qwen Plus 0728 cobra quase dez vezes menos que o o3 por milhão de tokens de saída — mas o silêncio em torno dele diz algo.

Redação FalaVIP IA 3 min de leitura
US$ 0,26por milhão de tokens de entrada
US$ 0,78por milhão de tokens de saída
1.000.000tokens de contexto

O preço que a OpenAI não quer que você veja

A conta de API da OpenAI com o3 sai a US$ 8 por milhão de tokens de saída. A conta com o Qwen Plus 0728 sai a US$ 0,78 pelo mesmo milhão. A diferença é de quase dez vezes — e o modelo da Alibaba está no catálogo há seis dias, sem queimar a internet.

Esse é o tipo de assimetria que costuma passar batido quando o assunto é "qual modelo usar". A manchete da semana foi outra, o benchmark viral foi outro, e no fim do mês a fatura continua contando a história que ninguém escreveu.

Ficha técnica — Qwen Plus 0728 (thinking)
CampoValor
Identificadorqwen/qwen-plus-2025-07-28:thinking
Criadorqwen
Preço de entradaUS$ 0.260 / M tokens
Preço de saídaUS$ 0.780 / M tokens
Janela de contexto1M
Modalidadetext->text

O que o Qwen Plus 0728 entrega de verdade

O modelo é descrito como um híbrido de raciocínio baseado na fundação Qwen3, com janela de contexto de 1 milhão de tokens. Em tradução direta: cabe um livro inteiro em uma única chamada, e o modelo decide internamente quanto esforço de raciocínio aplicar em cada trecho.

O catálogo não publicou índice de inteligência, nota de coding nem benchmark agentic para ele. Isso não é detalhe menor — é o ponto. Você está olhando para um modelo cujo marketing diz "balanced performance, speed, and cost combination", sem número público que sustente a primeira palavra. Para quem compra API, isso muda o cálculo: você paga barato, mas não tem como comparar com o3 ou com o Maverick sem rodar seu próprio teste.

O corte de conhecimento é março de 2025. Para tarefas que dependem de eventos recentes, isso é uma limitação concreta.

Onde ele se encaixa no tabuleiro de hoje

O catálogo tem 227 modelos listados hoje, vindos de 38 criadores diferentes. Treze foram lançados nos últimos 30 dias. No topo do índice de inteligência atual, o o3 lidera com folga, seguido pelo gpt-oss-120b e pelo Qwen3 Next 80B A3B Thinking — todos com notas publicadas.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 227 modelos disponíveis no catálogo nesta data.

O Qwen Plus 0728 não aparece nesse ranking porque não tem nota publicada. Mas o Qwen3 Next 80B A3B Thinking, da mesma família, custa US$ 1,20 por milhão de tokens de saída e marca 16,9 no índice de inteligência. O Plus 0728 custa menos (US$ 0,78) e fica sem nota — o que sugere que a Alibaba posicionou este modelo abaixo do "Thinking" da casa, não acima.

Para efeito de comparação direta: o Llama 4 Maverick, da Meta, sai a US$ 0,696 por milhão de tokens de saída e marca 14,5 no índice atual. Custam parecido, mas só um dos dois tem benchmark público.

Para quem esse modelo vale a pena

Se você está montando um pipeline que processa volumes grandes de texto — sumarização de documentos longos, extração de informação, classificação em massa, RAG com chunks extensos — o contexto de 1 milhão de tokens muda a arquitetura da sua aplicação. Você para de fragmentar, começa a mandar tudo de uma vez, e o custo por chamada cai junto com a complexidade do código.

Nesses casos, o Qwen Plus 0728 entra como candidato sério: preço baixo, contexto longo, criador com track record de modelos abertos e de reasoning.

Para quem ele não muda nada

Se o seu gargalo é qualidade de raciocínio em tarefas difíceis — prova matemática, código complexo, agente autônomo tomando decisões em cadeia — pagar dez vezes menos não compensa se o modelo erra onde o o3 acerta. Sem benchmark público, a única forma de saber é testar no seu caso de uso, e esse teste tem custo de engenharia.

Se você precisa de eventos pós-março de 2025, o corte de conhecimento já elimina o candidato.

O que fazer com isso na segunda-feira

Antes de trocar o modelo da sua pipeline, rode um lote pequeno de chamadas reais no Qwen Plus 0728 e meça duas coisas: taxa de erro nas tarefas que importam e latência por chamada. Se a taxa de erro for aceitável, a economia mensal pode ser de quatro dígitos em reais — e aí a conversa deixa de ser técnica e vira conversa de CFO.

Se a taxa de erro não for aceitável, você ainda sai com informação útil: o piso de qualidade do segmento barato subiu, e o próximo lançamento chinês vai herdar essa régua.

Em uma frase

Rode um teste cego com suas chamadas reais antes de migrar; se a taxa de erro segurar, a economia mensal paga o teste em uma semana.

Perguntas frequentes

Quanto custa o Qwen Plus 0728 por milhão de tokens?

O catálogo lista US$ 0,26 por milhão de tokens de entrada e US$ 0,78 por milhão de tokens de saída. Não há preço de cache publicado, o que significa que a Alibaba não disponibilizou esse valor no catálogo.

O Qwen Plus 0728 tem benchmark de inteligência publicado?

Não. O catálogo não publicou índice de inteligência, nota de coding nem benchmark agentic para este modelo. Para comparar com o3 ou Maverick, você precisa rodar seu próprio teste.

Qual o contexto máximo do Qwen Plus 0728?

1 milhão de tokens, o que permite processar documentos muito longos em uma única chamada sem fragmentação.

Leia também