Qwen3 VL Thinking custa metade do o3 — mas só se você precisar de visão
Modelo multimodal da Qwen entra sem nota de IQ publicada no catálogo, a US$ 4 por milhão de saída, e deixa em aberto se vale o gasto.
US$ 4 por milhão de tokens de saída. É o que a Qwen está cobrando pelo Qwen3 VL 235B A22B Thinking, lançado há sete dias. À primeira vista, é preço premium. Confrontado com o o3 da OpenAI — US$ 8 por milhão na saída —, cai para metade. Mas medido contra o próprio irmão de texto da Qwen, o Qwen3 Next 80B A3B Thinking, sai 3,3 vezes mais caro. A conta só fecha se você realmente for usar os olhos do modelo.
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3-vl-235b-a22b-thinking |
| Criador | qwen |
| Preço de entrada | US$ 0.400 / M tokens |
| Preço de saída | US$ 4.00 / M tokens |
| Janela de contexto | 131k |
| Modalidade | text+image->text |
O que ele faz — e o que ele cobra
O Qwen3 VL 235B A22B Thinking é a variante "Thinking" da família multimodal da Qwen. Aceita texto e imagem — e vídeo, segundo a descrição do criador —, devolve texto. A janela de contexto é de 131 mil tokens. O corte de conhecimento é 31 de março de 2025, então ele desconhece o que aconteceu nos últimos seis meses.
O catálogo publica apenas os preços de entrada e saída: US$ 0,40 por milhão de entrada e US$ 4 por milhão de saída. Não há preço de cache — campo vazio nos dados. Se o seu setup depende de cache de prompt para reduzir custo, você ou negocia à parte, ou descobre sozinho cobrando.
Uma semana depois do lançamento, o catálogo não tem medição de IQ para esse modelo. Tampouco notas de coding, agentic ou blended. Em outras palavras: o que normalmente orienta a escolha está em branco.
O tabuleiro em 30 de setembro
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Olhando o topo do mercado hoje, a fotografia é esta. O o3 da OpenAI lidera com IQ 31 e custa US$ 8 por milhão de saída. Logo abaixo, o gpt-oss-120b marca IQ 24 por US$ 0,17 — disparado a melhor relação inteligência/dinheiro do topo da lista. O Qwen3 Next 80B A3B Thinking, da mesma Qwen, ocupa o terceiro lugar com IQ 16,87 e US$ 1,20 por milhão.
O Qwen3 VL Thinking entra nesse cenário sem nota de IQ publicada. Se entregar perto dos melhores da casa, vai brigar na faixa de US$ 1 a US$ 4 por milhão — competitivo. Se ficar abaixo, vai ter de justificar o preço com o diferencial multimodal.
Para quem vale a troca
Você trabalha com STEM, matemática ou raciocínio sobre imagem — diagramas técnicos, gráficos de engenharia, screenshots de código, provas em LaTeX, plantas baixas. É exatamente o caso descrito pelo criador, e o sufixo "Thinking" promete entregar mais do que um VL comum entregaria.
Você tem carga multimodal real, não eventual. É fluxo contínuo de documento-imagem-texto passando pelo modelo. Nesse cenário, US$ 4 por milhão de saída começa a fazer sentido comparado ao o3, que é a referência na faixa de capacidade e custa o dobro.
Você está montando um pipeline de visão+raciocínio em produção e quer diversificar fora da OpenAI. O histórico recente da Qwen — terceiro lugar geral com o Next 80B — é o melhor ativo que esse modelo tem hoje.
Para quem não muda absolutamente nada
Se seu uso é texto puro, o Qwen3 Next 80B A3B Thinking faz a mesma família por US$ 1,20 por milhão de saída, um terço do preço. Mesmo sem multimodal, cobre a maior parte dos workloads de linguagem.
Se você só quer extrair texto de imagem sem raciocínio complexo, modelos menores e muito mais baratos resolvem. Esse Thinking existe para pensar sobre o que vê, não para ser um OCR caro.
Se você toma decisão por benchmark, espere. Sem nota de IQ publicada, qualquer escolha hoje é palpite informado. E se você depende de cache barato, a ausência de preço de cache já é uma bandeira vermelha — pode nem estar implementado nesse modelo.
O que fazer com isso
Se você já roda visão+raciocínio com o3 ou equivalente, vale colocar o Qwen3 VL Thinking em paralelo por uma semana. Meça qualidade por dólar real — não o preço de tabela, mas o gasto efetivo no seu padrão real de entrada e saída.
Se você está começando um projeto multimodal do zero, ele entra na lista curta de candidatos ao lado do o3, com a vantagem de custar metade e a desvantagem de não trazer benchmark público ainda. A decisão, por ora, é um voto no histórico da Qwen — que até aqui entregou o terceiro colocado geral do mercado e tem motivos para ser levada a sério.
Rode o Qwen3 VL Thinking em paralelo com o o3 por uma semana e meça custo efetivo por chamada real — se a qualidade acompanhar, você corta a fatura pela metade; para texto puro, o Qwen3 Next 80B segue sendo a escolha interna da casa por um terço do preço.
Perguntas frequentes
O que é o Qwen3 VL 235B A22B Thinking?
É um modelo multimodal da Qwen lançado em 23 de setembro de 2025. Aceita texto e imagem (incluindo vídeo, segundo o criador) e devolve texto, com janela de 131 mil tokens. A variante 'Thinking' é otimizada para raciocínio visual em STEM e matemática.
Quanto custa o Qwen3 VL Thinking por milhão de tokens?
US$ 0,40 por milhão de tokens de entrada e US$ 4 por milhão de tokens de saída. O catálogo não publicou preço de cache, então não há como precificar chamadas com cache de prompt só com os dados públicos.
Quando faz sentido escolher o Qwen3 VL Thinking em vez do o3?
Quando o fluxo realmente depende de visão e raciocínio combinado e o custo efetivo por chamada importa — o Qwen custa metade do o3 na saída. Para texto puro, o Qwen3 Next 80B da mesma casa é três vezes mais barato que este modelo.