Qwen3 VL 235B Thinking custa metade do o3 e lê imagens
Modelo multimodal da Alibaba chega por US$ 4 por milhão de tokens de saída, com contexto de 131 mil — mas o índice de inteligência ainda não foi medido.
O que importa não é o nome, é a conta
Você já viu o suficiente de release de IA para saber que a parte interessante nunca está no título. A Alibaba soltou hoje uma leva de modelos da família Qwen3, e o que abre a conversa é o Qwen3 VL 235B A22B Thinking, um modelo multimodal que entende imagem e vídeo e responde em texto. O preço de saída é US$ 4 por milhão de tokens. O do o3, da OpenAI, é US$ 8. Mesma categoria de raciocínio, metade do custo por token gerado.
A entrada é ainda mais barata: US$ 0,40 por milhão de tokens. Em um cenário típico de análise de documento com OCR e resumo, onde você manda muito texto e recebe pouco, isso muda a conta no fim do mês.
O que esse modelo realmente faz
A sigla VL significa vision-language: o modelo recebe texto, imagem ou vídeo e devolve texto. A versão Thinking é a variante otimizada para raciocínio em STEM e matemática, segundo a descrição publicada. É como ter um analista que não só lê a foto de um gráfico como também explica por que a curva cai naquele ponto.
O contexto é de 131.072 tokens. Em termos práticos: cabe um livro de médio porte inteiro, ou um PDF de几百 páginas com imagens, sem precisar dividir em pedaços. O conhecimento de treino vai até março de 2025, então eventos dos últimos seis meses ele não conhece.
| Campo | Valor |
|---|---|
| Identificador | openai/gpt-5-codex |
| Criador | openai |
| Preço de entrada | US$ 1.25 / M tokens |
| Preço de saída | US$ 10.00 / M tokens |
| Janela de contexto | 400k |
| Modalidade | text+image->text |
| Leitura de cache | US$ 0.125 / M (90% de desconto) |
A família completa que chegou junto
A Alibaba não soltou um modelo — soltou quatro. O Thinking multimodal é o carro-chefe, mas a linha do dia mostra a estratégia:
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| GPT-5 Codex (batch) | 0.625 | 5 | 400k |
O Qwen3 VL 235B Instruct é a versão sem raciocínio extra, mais barata (US$ 1,90 por milhão de saída) e com o dobro de contexto (262 mil tokens). Para quem só quer extrair informação de imagem, é o caminho.
O Qwen3 Max e o Qwen3 Coder Plus ocupam outros nichos: o Max é o modelo de texto mais caro da casa (US$ 3,90 de saída) e o Coder Plus tem contexto de 1 milhão de tokens — útil para repositórios inteiros de código.
Onde ele se encaixa no tabuleiro
O índice de inteligência do VL 235B Thinking ainda não foi medido pela Artificial Analysis, então não dá para colocá-lo no ranking com o3 (IQ 31) ou com o próprio Qwen3 Next Thinking (IQ 16,87). O que dá para dizer é onde ele está em preço.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| GPT-5 Codex (o novo) | — | 1.25 | 10 | 400k |
| o3 | 31.1 | 2 | 8 | 200k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
| Qwen3 Next 80B A3B Thinking | 16.9 | 0.15 | 1.2 | 262k |
O o3 custa US$ 8 por milhão de saída. O gpt-oss-120b, da própria OpenAI, custa US$ 0,17 — mas é um modelo aberto com capacidades diferentes. O Qwen3 Next Thinking, da mesma Alibaba, sai por US$ 1,20. O VL Thinking entra em US$ 4, posicionado entre o topo de gama da casa e o o3.
Para quem vale e para quem não muda nada
Vale para você se o seu produto envolve mandar imagem ou PDF para a API e pagar conta no fim do mês: análise de faturas, leitura de formulários, extração de dados de print, descrição de produto. O custo de entrada é baixo o suficiente para processar volumes grandes sem estourar o orçamento.
Não muda nada se você já está rodando o o3 para raciocínio pesado em texto puro — o VL Thinking não substitui isso sem benchmark independente. E se você precisa de geração de imagem ou áudio, nenhum dos quatro modelos de hoje entrega: a modalidade é exclusivamente texto+imagem (ou vídeo) → texto.
O que fazer com isso hoje
Se multimodal com raciocínio é gargalo de custo, vale rodar um piloto com o VL Instruct primeiro (mais barato, sem a camada Thinking) e subir para a versão Thinking só nos casos onde a resposta simples não basta. O catálogo não publicou preço de cache para nenhum dos modelos do dia, então quem usa cache hit vai precisar testar antes de assumir economia.
Para workloads multimodais com volume, o Qwen3 VL 235B Thinking corta a conta pela metade frente ao o3 — mas sem benchmark de inteligência ainda, não substitui o topo da OpenAI em raciocínio puro.
Perguntas frequentes
Quanto custa o Qwen3 VL 235B A22B Thinking?
US$ 0,40 por milhão de tokens de entrada e US$ 4 por milhão de tokens de saída. O catálogo não publicou preço de cache, então esse valor não está garantido.
O Qwen3 VL 235B Thinking é melhor que o o3?
Ainda não dá para afirmar. O índice de inteligência Artificial Analysis não foi medido para esse modelo até a publicação. Em preço, ele custa metade do o3 por token de saída.
Quais modelos a Alibaba lançou no mesmo dia?
Quatro: Qwen3 VL 235B Thinking, Qwen3 VL 235B Instruct, Qwen3 Max e Qwen3 Coder Plus. Todos da família Qwen3, voltados a multimodal, texto geral e código.