Qwen coloca visão de 235B no catálogo por US$ 4,40 por milhão de saída
Versão Thinking do Qwen3-VL estreia multimodal raciocinante a metade do preço do o3, mas sem nota de inteligência ainda medida
O que muda na prateleira hoje
A Qwen jogou quatro modelos no catálogo em um único dia, mas o que merece sua atenção é o Qwen3-VL-235B-A22B Thinking: um multimodal de 235 bilhões de parâmetros pensado para raciocinar sobre imagem e vídeo, não só descrevê-los. O preço de saída é US$ 4 por milhão de tokens — exatamente metade do que a OpenAI cobra pelo o3, o modelo que lidera o índice de inteligência hoje.
A conta fica mais interessante quando você olha o pacote completo. A versão Instruct do mesmo VL 235B sai por US$ 1,90 por milhão de saída, o Qwen3 Max por US$ 3,90 e o Qwen3 Coder Plus por US$ 3,25. É uma família inteira aparecendo de uma vez, com a versão Thinking claramente posicionada como o topo da linha multimodal.
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3-vl-235b-a22b-thinking |
| Criador | qwen |
| Preço de entrada | US$ 0.400 / M tokens |
| Preço de saída | US$ 4.00 / M tokens |
| Janela de contexto | 131k |
| Modalidade | text+image->text |
O que "Thinking" quer dizer aqui
Pensa no Thinking como o modo "mostra a conta" do modelo. Em vez de cuspir a resposta, ele gasta tokens extras percorrendo o raciocínio passo a passo antes de chegar no veredito. Em problemas de STEM e matemática isso normalmente paga o preço extra em latência e tokens com respostas mais certeiras — é o mesmo padrão que o o3 e o Qwen3 Next 80B Thinking já seguem.
A diferença é que aqui o Thinking também enxerga. Você manda uma imagem de um diagrama elétrico ou um frame de vídeo e o modelo percorre o caminho lógico sobre o que está vendo. Para quem constrói agentes que precisam olhar um screenshot, ler um gráfico ou inspecionar uma UI, é exatamente esse o caso de uso.
Onde ele se encaixa no tabuleiro
O índice de inteligência atual tem o o3 disparado na frente, com IQ de 31,096, seguido do gpt-oss-120b (24,126) e do próprio Qwen3 Next 80B Thinking (16,867). O Qwen3-VL Thinking ainda não tem nota publicada no índice — então qualquer comparação direta de capacidade cognitiva hoje é chute.
O que dá para comparar de verdade é o custo. Pelo preço de saída, o multimodal da Qwen fica entre o gpt-oss-120b (US$ 0,17, mas sem visão) e o o3 (US$ 8). É um meio-termo que faz sentido se você precisa de visão e não quer pagar o topo do topo da OpenAI.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Qwen3 VL 235B A22B Thinking (o novo) | — | 0.4 | 4 | 131k |
| o3 | 31.1 | 2 | 8 | 200k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
| Qwen3 Next 80B A3B Thinking | 16.9 | 0.15 | 1.2 | 262k |
Para quem vale — e para quem não muda nada
Vale para você se está montando um pipeline multimodal com raciocínio — análise de screenshots, interpretação de gráficos, agentes que leem UI — e o o3 estava caro demais para o volume que você roda. O contexto de 131 mil tokens comporta documentos visuais inteiros sem malabarismo.
Não muda nada se você já está satisfeito com o gpt-oss-120b em texto puro e não precisa de visão, ou se o seu caso é multimodal simples (legenda de imagem, OCR) onde a versão Instruct a US$ 1,90 já resolve sem o overhead do Thinking.
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Qwen3 Coder Plus | 0.65 | 3.25 | 1M |
| Qwen3 Max | 0.78 | 3.9 | 262k |
| Qwen3 VL 235B A22B Instruct | 0.21 | 1.9 | 262k |
A linha completa do dia
A Qwen não soltou só o Thinking. Vieram juntos o Qwen3-VL Instruct (mesmo porte, sem raciocínio, mais barato), o Qwen3 Max (texto puro, 262 mil de contexto) e o Qwen3 Coder Plus (um milhão de contexto, voltado a código). É um pacote "cobre todos os buracos" — visão raciocinante, visão barata, texto geral, código.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
A leitura prática: se você esperava um concorrente direto do o3 em raciocínio puro, ainda não é — falta benchmark. Se você esperava um multimodal que não sangra o orçamento, é exatamente o que chegou.
Teste o Qwen3-VL Thinking em tarefas de visão com raciocínio onde o o3 pesa no custo; ignore se multimodal sem lógica for suficiente.
Perguntas frequentes
Quanto custa o Qwen3-VL 235B Thinking?
US$ 0,40 por milhão de tokens de entrada e US$ 4,00 por milhão de tokens de saída. Não há preço de cache publicado no catálogo.
O Qwen3-VL Thinking tem nota de inteligência?
Ainda não. O índice atual só traz o Qwen3 Next 80B Thinking (IQ 16,867) da própria Qwen; o VL Thinking foi listado hoje sem medição publicada.
Qual a diferença entre a versão Thinking e a Instruct do Qwen3-VL?
A Thinking gasta tokens extras percorrendo o raciocínio antes de responder e custa US$ 4 por milhão de saída; a Instruct responde direto e sai por US$ 1,90.