Qwen3 VL 30B Thinking: visão e raciocínio por US$ 2,40 de saída
Modelo multimodal da Qwen entra no catálogo seis dias após o lançamento cobrando caro no token de saída — e isso muda o cálculo.
Se você está pagando a fatura da API no fim do mês, a primeira pergunta sobre o Qwen3 VL 30B A3B Thinking não é “ele é bom?”. É “quando ele entra no carrinho?”. A resposta curta: depende do que você joga nele.
O que ele é, em uma frase
É um modelo multimodal da Qwen — lê imagem e vídeo, devolve texto — com a variante Thinking voltada a raciocínio em STEM, matemática e tarefas complexas. Foi listado no catálogo em 6 de outubro de 2025; este texto sai seis dias depois. O contexto é generoso: 262 mil tokens. Você não vai ficar sem janela para mandar um PDF gigante ou um dump de código.
O preço que importa de verdade
A entrada é barata: US$ 0,20 por milhão de tokens. A saída é que cobra: US$ 2,40 por milhão. Em modelo de raciocínio, a saída tende a ser longa — cadeia de pensamento, passos intermediários, verificação. Multiplique isso pelo seu volume de geração e a conta muda de figura rápido. Se o seu uso é “mando imagem, recebo uma legenda curta”, o custo fica contido. Se é “mando gráfico de engenharia, recebo análise detalhada”, prepare-se.
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3-vl-30b-a3b-thinking |
| Criador | qwen |
| Preço de entrada | US$ 0.200 / M tokens |
| Preço de saída | US$ 2.40 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text+image->text |
Onde ele se encaixa no tabuleiro
O catálogo hoje tem mais de 253 modelos de 40 criadores, e 26 deles foram lançados nos últimos 30 dias. No topo de inteligência aparecem o OpenAI o3 (IQ 31,096, a US$ 8 por milhão de saída) e o gpt-oss-120b (IQ 24,126, a US$ 0,17). O Qwen3 VL 30B Thinking entra como peça de outra categoria: multimodal com raciocínio, sem preço de fronteira em inteligência pura. É a mesma família do Qwen3 Next 80B A3B Thinking, que aparece em terceiro no ranking com IQ 16,867 e US$ 1,20 de saída — referência útil para entender onde a Qwen costuma cobrar.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Para quem ele vale
Se o seu produto precisa olhar imagem e explicar o que vê — análise de captura de tela, interpretação de diagrama, leitura de documento escaneado, troubleshooting visual — e você já gasta com um modelo de raciocínio caro, vale testar. O contexto de 262k permite colar material inteiro sem malabarismo. Para STEM com imagem (problema de física com figura, questão de matemática manuscrita, esquema técnico), a variante Thinking é o que justifica o prêmio sobre um multimodal comum.
Para quem ele não muda nada
Se você só processa texto, há opções mais baratas no catálogo com IQ mais alto — o próprio Qwen3 Next 80B A3B Thinking, por exemplo, cobra menos na saída. Se você precisa do topo absoluto de raciocínio, o o3 está lá, com outro patamar de IQ (e outro preço). E se o seu uso é classificar imagem em uma palavra, pagar US$ 2,40 por milhão de saída por Thinking é overkill — um multimodal enxuto resolve.
O detalhe que ninguém comenta
O catálogo não publicou IQ, nota de coding, agentic, blended, nem velocidade para este modelo. Você não tem benchmark público para comparar com o concorrente antes de gastar. A única forma de saber se o Thinking entrega o que promete no seu caso é rodar com um volume pequeno e medir qualidade contra o que você já usa. Em modelo novo de raciocínio multimodal, a conta de API é também o seu teste cego.
O que fazer com isso
Antes de adicionar o Qwen3 VL 30B Thinking ao fluxo, meça três coisas: quanto você gasta hoje em multimodal, qual o tamanho médio da resposta que você consome (Thinking infla isso), e se a tarefa realmente exige a cadeia de raciocínio ou se um multimodal sem “Thinking” entrega o mesmo. Se os três números fecham, ele vira peça de produção. Se não, fica como experimento — e a fatura agradece.
Use o Qwen3 VL 30B Thinking quando a tarefa multimodal exigir raciocínio profundo e a resposta longa não for problema; para o resto, há opções mais baratas no próprio catálogo da Qwen.
Perguntas frequentes
Quanto custa o Qwen3 VL 30B A3B Thinking na API?
US$ 0,20 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída. O catálogo não publicou preço de cache neste modelo.
O Qwen3 VL 30B Thinking serve para quê?
Tarefas multimodais que exigem raciocínio: análise de imagens e vídeos em STEM, interpretação de diagramas, leitura de documentos complexos e problemas de matemática ou física com figura.
Ele é melhor que o o3 da OpenAI?
São modelos de categorias diferentes. O o3 lidera o ranking de inteligência do catálogo com IQ 31,096, mas é só texto. O Qwen3 VL 30B Thinking entra como multimodal com raciocínio — o catálogo não publicou IQ para ele, então a comparação direta por benchmark ainda não é possível.