FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 VL Thinking custa metade do o3 — mas só se você precisar de visão

Modelo multimodal da Qwen entra sem nota de IQ publicada no catálogo, a US$ 4 por milhão de saída, e deixa em aberto se vale o gasto.

Redação FalaVIP IA 3 min de leitura
US$ 4por milhão de tokens de saída
US$ 0,40por milhão de tokens de entrada
131 miltokens de contexto

US$ 4 por milhão de tokens de saída. É o que a Qwen está cobrando pelo Qwen3 VL 235B A22B Thinking, lançado há sete dias. À primeira vista, é preço premium. Confrontado com o o3 da OpenAI — US$ 8 por milhão na saída —, cai para metade. Mas medido contra o próprio irmão de texto da Qwen, o Qwen3 Next 80B A3B Thinking, sai 3,3 vezes mais caro. A conta só fecha se você realmente for usar os olhos do modelo.

Ficha técnica — Qwen3 VL 235B A22B Thinking
CampoValor
Identificadorqwen/qwen3-vl-235b-a22b-thinking
Criadorqwen
Preço de entradaUS$ 0.400 / M tokens
Preço de saídaUS$ 4.00 / M tokens
Janela de contexto131k
Modalidadetext+image->text

O que ele faz — e o que ele cobra

O Qwen3 VL 235B A22B Thinking é a variante "Thinking" da família multimodal da Qwen. Aceita texto e imagem — e vídeo, segundo a descrição do criador —, devolve texto. A janela de contexto é de 131 mil tokens. O corte de conhecimento é 31 de março de 2025, então ele desconhece o que aconteceu nos últimos seis meses.

O catálogo publica apenas os preços de entrada e saída: US$ 0,40 por milhão de entrada e US$ 4 por milhão de saída. Não há preço de cache — campo vazio nos dados. Se o seu setup depende de cache de prompt para reduzir custo, você ou negocia à parte, ou descobre sozinho cobrando.

Uma semana depois do lançamento, o catálogo não tem medição de IQ para esse modelo. Tampouco notas de coding, agentic ou blended. Em outras palavras: o que normalmente orienta a escolha está em branco.

O tabuleiro em 30 de setembro

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 244 modelos disponíveis no catálogo nesta data.

Olhando o topo do mercado hoje, a fotografia é esta. O o3 da OpenAI lidera com IQ 31 e custa US$ 8 por milhão de saída. Logo abaixo, o gpt-oss-120b marca IQ 24 por US$ 0,17 — disparado a melhor relação inteligência/dinheiro do topo da lista. O Qwen3 Next 80B A3B Thinking, da mesma Qwen, ocupa o terceiro lugar com IQ 16,87 e US$ 1,20 por milhão.

O Qwen3 VL Thinking entra nesse cenário sem nota de IQ publicada. Se entregar perto dos melhores da casa, vai brigar na faixa de US$ 1 a US$ 4 por milhão — competitivo. Se ficar abaixo, vai ter de justificar o preço com o diferencial multimodal.

Para quem vale a troca

Você trabalha com STEM, matemática ou raciocínio sobre imagem — diagramas técnicos, gráficos de engenharia, screenshots de código, provas em LaTeX, plantas baixas. É exatamente o caso descrito pelo criador, e o sufixo "Thinking" promete entregar mais do que um VL comum entregaria.

Você tem carga multimodal real, não eventual. É fluxo contínuo de documento-imagem-texto passando pelo modelo. Nesse cenário, US$ 4 por milhão de saída começa a fazer sentido comparado ao o3, que é a referência na faixa de capacidade e custa o dobro.

Você está montando um pipeline de visão+raciocínio em produção e quer diversificar fora da OpenAI. O histórico recente da Qwen — terceiro lugar geral com o Next 80B — é o melhor ativo que esse modelo tem hoje.

Para quem não muda absolutamente nada

Se seu uso é texto puro, o Qwen3 Next 80B A3B Thinking faz a mesma família por US$ 1,20 por milhão de saída, um terço do preço. Mesmo sem multimodal, cobre a maior parte dos workloads de linguagem.

Se você só quer extrair texto de imagem sem raciocínio complexo, modelos menores e muito mais baratos resolvem. Esse Thinking existe para pensar sobre o que vê, não para ser um OCR caro.

Se você toma decisão por benchmark, espere. Sem nota de IQ publicada, qualquer escolha hoje é palpite informado. E se você depende de cache barato, a ausência de preço de cache já é uma bandeira vermelha — pode nem estar implementado nesse modelo.

O que fazer com isso

Se você já roda visão+raciocínio com o3 ou equivalente, vale colocar o Qwen3 VL Thinking em paralelo por uma semana. Meça qualidade por dólar real — não o preço de tabela, mas o gasto efetivo no seu padrão real de entrada e saída.

Se você está começando um projeto multimodal do zero, ele entra na lista curta de candidatos ao lado do o3, com a vantagem de custar metade e a desvantagem de não trazer benchmark público ainda. A decisão, por ora, é um voto no histórico da Qwen — que até aqui entregou o terceiro colocado geral do mercado e tem motivos para ser levada a sério.

Em uma frase

Rode o Qwen3 VL Thinking em paralelo com o o3 por uma semana e meça custo efetivo por chamada real — se a qualidade acompanhar, você corta a fatura pela metade; para texto puro, o Qwen3 Next 80B segue sendo a escolha interna da casa por um terço do preço.

Perguntas frequentes

O que é o Qwen3 VL 235B A22B Thinking?

É um modelo multimodal da Qwen lançado em 23 de setembro de 2025. Aceita texto e imagem (incluindo vídeo, segundo o criador) e devolve texto, com janela de 131 mil tokens. A variante 'Thinking' é otimizada para raciocínio visual em STEM e matemática.

Quanto custa o Qwen3 VL Thinking por milhão de tokens?

US$ 0,40 por milhão de tokens de entrada e US$ 4 por milhão de tokens de saída. O catálogo não publicou preço de cache, então não há como precificar chamadas com cache de prompt só com os dados públicos.

Quando faz sentido escolher o Qwen3 VL Thinking em vez do o3?

Quando o fluxo realmente depende de visão e raciocínio combinado e o custo efetivo por chamada importa — o Qwen custa metade do o3 na saída. Para texto puro, o Qwen3 Next 80B da mesma casa é três vezes mais barato que este modelo.

Leia também