FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Qwen3 VL 235B Thinking custa metade do o3 e lê imagens

Modelo multimodal da Alibaba chega por US$ 4 por milhão de tokens de saída, com contexto de 131 mil — mas o índice de inteligência ainda não foi medido.

Redação FalaVIP IA 3 min de leitura
US$ 4por milhão de tokens de saída
131.072tokens de contexto
US$ 0,40por milhão de tokens de entrada

O que importa não é o nome, é a conta

Você já viu o suficiente de release de IA para saber que a parte interessante nunca está no título. A Alibaba soltou hoje uma leva de modelos da família Qwen3, e o que abre a conversa é o Qwen3 VL 235B A22B Thinking, um modelo multimodal que entende imagem e vídeo e responde em texto. O preço de saída é US$ 4 por milhão de tokens. O do o3, da OpenAI, é US$ 8. Mesma categoria de raciocínio, metade do custo por token gerado.

A entrada é ainda mais barata: US$ 0,40 por milhão de tokens. Em um cenário típico de análise de documento com OCR e resumo, onde você manda muito texto e recebe pouco, isso muda a conta no fim do mês.

Preço de saída (US$ por milhão de tokens)
GPT-5 Codex10o38gpt-oss-120b0,17Qwen3 Next 80B A3B Thinking1,2US$/M
Fonte: OpenRouter

O que esse modelo realmente faz

A sigla VL significa vision-language: o modelo recebe texto, imagem ou vídeo e devolve texto. A versão Thinking é a variante otimizada para raciocínio em STEM e matemática, segundo a descrição publicada. É como ter um analista que não só lê a foto de um gráfico como também explica por que a curva cai naquele ponto.

O contexto é de 131.072 tokens. Em termos práticos: cabe um livro de médio porte inteiro, ou um PDF de几百 páginas com imagens, sem precisar dividir em pedaços. O conhecimento de treino vai até março de 2025, então eventos dos últimos seis meses ele não conhece.

Ficha técnica — GPT-5 Codex
CampoValor
Identificadoropenai/gpt-5-codex
Criadoropenai
Preço de entradaUS$ 1.25 / M tokens
Preço de saídaUS$ 10.00 / M tokens
Janela de contexto400k
Modalidadetext+image->text
Leitura de cacheUS$ 0.125 / M (90% de desconto)

A família completa que chegou junto

A Alibaba não soltou um modelo — soltou quatro. O Thinking multimodal é o carro-chefe, mas a linha do dia mostra a estratégia:

Os outros modelos anunciados no mesmo dia
ModeloEntrada US$/MSaída US$/MContexto
GPT-5 Codex (batch)0.6255400k

O Qwen3 VL 235B Instruct é a versão sem raciocínio extra, mais barata (US$ 1,90 por milhão de saída) e com o dobro de contexto (262 mil tokens). Para quem só quer extrair informação de imagem, é o caminho.

O Qwen3 Max e o Qwen3 Coder Plus ocupam outros nichos: o Max é o modelo de texto mais caro da casa (US$ 3,90 de saída) e o Coder Plus tem contexto de 1 milhão de tokens — útil para repositórios inteiros de código.

Onde ele se encaixa no tabuleiro

O índice de inteligência do VL 235B Thinking ainda não foi medido pela Artificial Analysis, então não dá para colocá-lo no ranking com o3 (IQ 31) ou com o próprio Qwen3 Next Thinking (IQ 16,87). O que dá para dizer é onde ele está em preço.

Índice de inteligência (Artificial Analysis)
o331,1gpt-oss-120b24,1Qwen3 Next 80B A3B Thinking16,9índice
Fonte: Artificial Analysis
Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
GPT-5 Codex (o novo)1.2510400k
o331.128200k
gpt-oss-120b24.10.0370.17131k
Qwen3 Next 80B A3B Thinking16.90.151.2262k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

O o3 custa US$ 8 por milhão de saída. O gpt-oss-120b, da própria OpenAI, custa US$ 0,17 — mas é um modelo aberto com capacidades diferentes. O Qwen3 Next Thinking, da mesma Alibaba, sai por US$ 1,20. O VL Thinking entra em US$ 4, posicionado entre o topo de gama da casa e o o3.

Inteligência × preço de saída
o3gpt-oss-120bQwen3 Next 80B A3B ThinkingUS$ por milhão (saída, escala log)índice de inteligência

Para quem vale e para quem não muda nada

Vale para você se o seu produto envolve mandar imagem ou PDF para a API e pagar conta no fim do mês: análise de faturas, leitura de formulários, extração de dados de print, descrição de produto. O custo de entrada é baixo o suficiente para processar volumes grandes sem estourar o orçamento.

Não muda nada se você já está rodando o o3 para raciocínio pesado em texto puro — o VL Thinking não substitui isso sem benchmark independente. E se você precisa de geração de imagem ou áudio, nenhum dos quatro modelos de hoje entrega: a modalidade é exclusivamente texto+imagem (ou vídeo) → texto.

O que fazer com isso hoje

Se multimodal com raciocínio é gargalo de custo, vale rodar um piloto com o VL Instruct primeiro (mais barato, sem a camada Thinking) e subir para a versão Thinking só nos casos onde a resposta simples não basta. O catálogo não publicou preço de cache para nenhum dos modelos do dia, então quem usa cache hit vai precisar testar antes de assumir economia.

Em uma frase

Para workloads multimodais com volume, o Qwen3 VL 235B Thinking corta a conta pela metade frente ao o3 — mas sem benchmark de inteligência ainda, não substitui o topo da OpenAI em raciocínio puro.

Perguntas frequentes

Quanto custa o Qwen3 VL 235B A22B Thinking?

US$ 0,40 por milhão de tokens de entrada e US$ 4 por milhão de tokens de saída. O catálogo não publicou preço de cache, então esse valor não está garantido.

O Qwen3 VL 235B Thinking é melhor que o o3?

Ainda não dá para afirmar. O índice de inteligência Artificial Analysis não foi medido para esse modelo até a publicação. Em preço, ele custa metade do o3 por token de saída.

Quais modelos a Alibaba lançou no mesmo dia?

Quatro: Qwen3 VL 235B Thinking, Qwen3 VL 235B Instruct, Qwen3 Max e Qwen3 Coder Plus. Todos da família Qwen3, voltados a multimodal, texto geral e código.

Leia também