Qwen lança VL 30B Thinking a US$ 2,40 por milhão de saída
Modelo multimodal da Alibaba custa quase 4× menos que o o3 da OpenAI por token gerado, mas ainda não tem nota de inteligência no catálogo.
O que está circulando
A Qwen soltou hoje uma leva de modelos multimodais com o selo Thinking. O protagonista é o Qwen3 VL 30B A3B Thinking: aceita texto e imagem, devolve texto, e cobra US$ 0,20 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída. Em tradução direta, gerar um texto de tamanho médio com ele custa uma fração do que custa com o o3 da OpenAI, referência de raciocínio no catálogo. A diferença é grande o suficiente para mudar a conta no fim do mês.
O que mudou em relação ao que já existia
O catálogo tem hoje 248 modelos listados, vindos de 40 criadores diferentes. Entre os rivais diretos da Qwen no segmento multimodal com reasoning ativado, o o3 lidera em inteligência medida (31,096), mas cobra US$ 8 por milhão de tokens de saída — cerca de 3,3× o preço do VL 30B Thinking. O outro Qwen da lista, o Qwen3 Next 80B A3B Thinking, sai por US$ 1,20 por milhão de saída e tem IQ de 16,867, mas é só texto. Para quem precisa ver imagem e pensar sobre ela, a comparação mais justa hoje é mesmo contra o o3.
O que o release não diz
A página do modelo não traz nota de inteligência, nem benchmark de coding ou agentic. Também não há informação sobre pesos abertos, número de parâmetros ou velocidade. Isso não é furo — é o padrão quando o catálogo ainda não rodou a bateria completa. O knowledge cutoff é 31 de março de 2025, então o modelo não viu nada do que aconteceu no mundo depois disso. Para um multimodal novo, vale rodar seu próprio teste antes de migrar carga.
Para quem vale e para quem não muda nada
Vale se você está montando pipeline que recebe imagem e precisa de raciocínio encadeado por cima — análise de documento, agente que olha print, QA visual — e a fatura da API pesa na decisão. O contexto de 262.144 tokens permite colar PDFs longos ou séries de frames sem picotar. Não muda nada se você já está feliz com um modelo só-texto da própria Qwen, como o Next 80B Thinking, que sai pela metade do preço por token de saída. E não muda nada se o seu gargalo é benchmark bruto: sem nota de inteligência no catálogo, não dá para comparar com o3, GPT-OSS ou Maverick em pé de igualdade hoje.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Qwen3 VL 30B A3B Thinking (o novo) | — | 0.2 | 2.4 | 262k |
| o3 | 31.1 | 2 | 8 | 200k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
| Qwen3 Next 80B A3B Thinking | 16.9 | 0.15 | 1.2 | 262k |
A família completa de hoje
A Qwen não soltou só o Thinking. Veio junto o Qwen3 VL 30B A3B Instruct, variante sem o modo de raciocínio ativado: US$ 0,15 de entrada e US$ 0,60 de saída por milhão de tokens, mesmo contexto de 262.144. Para chamadas de alta volumetria e baixa complexidade — legenda de imagem, extração de campo, OCR simples — o Instruct é a opção barata da família. Para tarefas que pedem cadeia de pensamento antes da resposta, o Thinking é o caminho.
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Qwen3 VL 30B A3B Instruct | 0.15 | 0.6 | 262k |
O tabuleiro
A Qwen é o criador chinês que mais apareceu no top 5 de inteligência medida neste momento, com o Qwen3 Next 80B A3B Thinking em terceiro lugar (IQ 16,867, a US$ 1,20 por milhão de saída). A OpenAI domina as duas primeiras posições, mas cobra caro pelo o3. O Meta Llama 4 Maverick fecha a lista em quinto, a US$ 0,696 por milhão de saída. Em resumo: o topo da tabela é OpenAI, o meio é Qwen, e o custo-benefício mora no meio.
O que fazer com isso
Se a sua fila de multimodal está queimando tokens no o3, teste o VL 30B Thinking em uma fração do tráfego antes de trocar. Se a sua fila é Instruct puro, o VL 30B Instruct a US$ 0,60 de saída é candidato óbvio a benchmark interno. E se você está esperando nota de inteligência para decidir, espere: o catálogo costuma atualizar índices em ciclo curto, e até lá o melhor termômetro é o seu próprio caso de uso.
Troque uma fração do tráfego multimodal que hoje roda no o3 pelo Qwen3 VL 30B Thinking e meça custo por tarefa antes de migrar de vez — a economia por token é grande, mas a nota de inteligência ainda não chegou.
Perguntas frequentes
Quanto custa o Qwen3 VL 30B A3B Thinking?
US$ 0,20 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída, com contexto de 262.144 tokens. É cerca de 3,3× mais barato na saída do que o OpenAI o3.
Qual a diferença entre o Thinking e o Instruct da mesma família?
O Thinking ativa o modo de raciocínio encadeado e custa US$ 2,40 por milhão de saída; o Instruct é a versão direta, sem cadeia de pensamento, e sai por US$ 0,60 por milhão de saída.
O Qwen3 VL 30B Thinking tem nota de inteligência no catálogo?
Não. A página do modelo não traz índice de inteligência nem benchmarks de coding ou agentic no momento do lançamento. O knowledge cutoff informado é 31 de março de 2025.