FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Qwen lança VL 30B Thinking a US$ 2,40 por milhão de saída

Modelo multimodal da Alibaba custa quase 4× menos que o o3 da OpenAI por token gerado, mas ainda não tem nota de inteligência no catálogo.

Redação FalaVIP IA 3 min de leitura
US$ 2,40por milhão de tokens de saída do Qwen3 VL 30B Thinking
US$ 8,00por milhão de tokens de saída do OpenAI o3
262.144tokens de contexto do novo modelo

O que está circulando

A Qwen soltou hoje uma leva de modelos multimodais com o selo Thinking. O protagonista é o Qwen3 VL 30B A3B Thinking: aceita texto e imagem, devolve texto, e cobra US$ 0,20 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída. Em tradução direta, gerar um texto de tamanho médio com ele custa uma fração do que custa com o o3 da OpenAI, referência de raciocínio no catálogo. A diferença é grande o suficiente para mudar a conta no fim do mês.

O que mudou em relação ao que já existia

O catálogo tem hoje 248 modelos listados, vindos de 40 criadores diferentes. Entre os rivais diretos da Qwen no segmento multimodal com reasoning ativado, o o3 lidera em inteligência medida (31,096), mas cobra US$ 8 por milhão de tokens de saída — cerca de 3,3× o preço do VL 30B Thinking. O outro Qwen da lista, o Qwen3 Next 80B A3B Thinking, sai por US$ 1,20 por milhão de saída e tem IQ de 16,867, mas é só texto. Para quem precisa ver imagem e pensar sobre ela, a comparação mais justa hoje é mesmo contra o o3.

Preço de saída (US$ por milhão de tokens)
Qwen3 VL 30B A3B Thinking2,4o38gpt-oss-120b0,17Qwen3 Next 80B A3B Thinking1,2US$/M
Fonte: OpenRouter

O que o release não diz

A página do modelo não traz nota de inteligência, nem benchmark de coding ou agentic. Também não há informação sobre pesos abertos, número de parâmetros ou velocidade. Isso não é furo — é o padrão quando o catálogo ainda não rodou a bateria completa. O knowledge cutoff é 31 de março de 2025, então o modelo não viu nada do que aconteceu no mundo depois disso. Para um multimodal novo, vale rodar seu próprio teste antes de migrar carga.

Para quem vale e para quem não muda nada

Vale se você está montando pipeline que recebe imagem e precisa de raciocínio encadeado por cima — análise de documento, agente que olha print, QA visual — e a fatura da API pesa na decisão. O contexto de 262.144 tokens permite colar PDFs longos ou séries de frames sem picotar. Não muda nada se você já está feliz com um modelo só-texto da própria Qwen, como o Next 80B Thinking, que sai pela metade do preço por token de saída. E não muda nada se o seu gargalo é benchmark bruto: sem nota de inteligência no catálogo, não dá para comparar com o3, GPT-OSS ou Maverick em pé de igualdade hoje.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Qwen3 VL 30B A3B Thinking (o novo)0.22.4262k
o331.128200k
gpt-oss-120b24.10.0370.17131k
Qwen3 Next 80B A3B Thinking16.90.151.2262k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

A família completa de hoje

A Qwen não soltou só o Thinking. Veio junto o Qwen3 VL 30B A3B Instruct, variante sem o modo de raciocínio ativado: US$ 0,15 de entrada e US$ 0,60 de saída por milhão de tokens, mesmo contexto de 262.144. Para chamadas de alta volumetria e baixa complexidade — legenda de imagem, extração de campo, OCR simples — o Instruct é a opção barata da família. Para tarefas que pedem cadeia de pensamento antes da resposta, o Thinking é o caminho.

Os outros modelos anunciados no mesmo dia
ModeloEntrada US$/MSaída US$/MContexto
Qwen3 VL 30B A3B Instruct0.150.6262k

O tabuleiro

A Qwen é o criador chinês que mais apareceu no top 5 de inteligência medida neste momento, com o Qwen3 Next 80B A3B Thinking em terceiro lugar (IQ 16,867, a US$ 1,20 por milhão de saída). A OpenAI domina as duas primeiras posições, mas cobra caro pelo o3. O Meta Llama 4 Maverick fecha a lista em quinto, a US$ 0,696 por milhão de saída. Em resumo: o topo da tabela é OpenAI, o meio é Qwen, e o custo-benefício mora no meio.

Índice de inteligência (Artificial Analysis)
o331,1gpt-oss-120b24,1Qwen3 Next 80B A3B Thinking16,9índice
Fonte: Artificial Analysis

O que fazer com isso

Se a sua fila de multimodal está queimando tokens no o3, teste o VL 30B Thinking em uma fração do tráfego antes de trocar. Se a sua fila é Instruct puro, o VL 30B Instruct a US$ 0,60 de saída é candidato óbvio a benchmark interno. E se você está esperando nota de inteligência para decidir, espere: o catálogo costuma atualizar índices em ciclo curto, e até lá o melhor termômetro é o seu próprio caso de uso.

Em uma frase

Troque uma fração do tráfego multimodal que hoje roda no o3 pelo Qwen3 VL 30B Thinking e meça custo por tarefa antes de migrar de vez — a economia por token é grande, mas a nota de inteligência ainda não chegou.

Perguntas frequentes

Quanto custa o Qwen3 VL 30B A3B Thinking?

US$ 0,20 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída, com contexto de 262.144 tokens. É cerca de 3,3× mais barato na saída do que o OpenAI o3.

Qual a diferença entre o Thinking e o Instruct da mesma família?

O Thinking ativa o modo de raciocínio encadeado e custa US$ 2,40 por milhão de saída; o Instruct é a versão direta, sem cadeia de pensamento, e sai por US$ 0,60 por milhão de saída.

O Qwen3 VL 30B Thinking tem nota de inteligência no catálogo?

Não. A página do modelo não traz índice de inteligência nem benchmarks de coding ou agentic no momento do lançamento. O knowledge cutoff informado é 31 de março de 2025.

Leia também