Qwen3 VL 235B estreia sem nota de inteligência e custa 58% mais
Cinco dias depois do lançamento, o multimodal da Qwen segue sem índice publicado no catálogo. Custa US$ 1,90 por milhão de tokens de saída e mira casos em que texto sozinho não basta.
Você não consegue comparar o Qwen3 VL 235B A22B Instruct com quase ninguém. Cinco dias depois do lançamento, em 23 de setembro, o multimodal da Qwen segue sem índice de inteligência, sem nota de código, sem nota agentic e sem blended score na principal régua que o mercado usa para decidir. O catálogo tem mais de 240 modelos hoje, e 21 deles foram lançados nos últimos 30 dias — não é raro um modelo chegar sem benchmark. Quando ele custa US$ 1,90 por milhão de tokens de saída, a ausência pesa.
O que está na ficha (e o que está faltando)
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3-vl-235b-a22b-instruct |
| Criador | qwen |
| Preço de entrada | US$ 0.210 / M tokens |
| Preço de saída | US$ 1.90 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text+image->text |
| Leitura de cache | US$ 0.100 / M (52% de desconto) |
A descrição do catálogo descreve o modelo como multimodal de pesos abertos, com janela de 262.144 tokens e cutoff de conhecimento em março de 2025. A modalidade é text+image → text: o modelo lê imagens, incluindo vídeo, e devolve texto. Os casos de uso citados são VQA, parsing de documentos e leitura de gráficos e tabelas. Não gera imagem.
O que falta é a régua que permite olhar para o modelo e dizer "está acima de X, abaixo de Y". O topo atual do catálogo é o o3, da OpenAI, com 31,096. Logo abaixo vem o gpt-oss-120b, da própria OpenAI, com 24,126. O Qwen3 Next 80B A3B Thinking, da mesma Qwen e da mesma geração, marca 16,867. O VL 235B: nada. Comparar o multimodal novo com qualquer um deles hoje exige aceitar que um lado da equação está em branco.
O tabuleiro de preços
Em dólares por milhão de tokens, o VL 235B cobra US$ 0,21 de entrada, US$ 1,90 de saída e US$ 0,10 em cache. Pôr isso na mesa ao lado de três vizinhos ajuda a calibrar:
- Qwen3 Next 80B A3B Thinking (irmão de geração, só texto): US$ 1,20 de saída. O VL 235B custa 58% mais.
- OpenAI o3 (referência de topo, 31,096 de IQ): US$ 8,00 de saída. O VL 235B custa cerca de quatro vezes menos.
- Meta Llama 4 Maverick (multimodal concorrente, 14,477 de IQ): US$ 0,696 de saída. O VL 235B custa quase o triplo.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
A leitura é direta: o preço não é absurdo, mas também não é argumento de compra. Está acima do multimodal mais barato com score público e abaixo do topo absoluto, sem ocupar nenhum dos dois polos.
Para quem esse modelo faz sentido
VL grande, contexto de 262K e preço de cache camarada (US$ 0,10) pedem um caso de uso específico: documentos longos com figuras, contratos com tabelas embutidas, agentes que precisam olhar um gráfico antes de responder. Nesses cenários o ganho não é "ser mais inteligente" — é "ver o que os outros não veem". O cache barato também ajuda quem repete a mesma imagem várias vezes, como num pipeline de QA visual.
Para texto puro, o Qwen3 Next 80B A3B Thinking entrega por menos e com nota. Para o topo de capacidade pura, o o3 é o teto, e a conta sobe quatro vezes. Para multimodal barato com benchmark, o Llama 4 Maverick continua na frente em preço.
Cinco dias depois, a decisão
Se o seu produto é só texto, ignore. Se lê imagem, coloque o Qwen3 VL 235B na fila de teste ao lado do Llama 4 Maverick e de qualquer outro multimodal com score público. Sem índice de inteligência disponível, a única forma de saber se ele paga os US$ 1,90 é rodar nos seus próprios documentos e medir a taxa de acerto. A Qwen entregou a capacidade; a régua, ainda não.
Coloque o Qwen3 VL 235B na fila de teste se você precisa ler imagens, mas não migre nada sem rodar eval próprio nos seus documentos — o catálogo ainda não publicou nota de inteligência para ele.
Perguntas frequentes
O Qwen3 VL 235B é open source?
A descrição do catálogo descreve o modelo como open-weight, ou seja, com pesos abertos. O campo de pesos abertos do catálogo veio vazio, então vale confirmar a licença no repositório oficial antes de qualquer uso comercial.
Quanto custa processar imagens com o Qwen3 VL 235B?
O catálogo só mostra preço de texto: US$ 0,21 por milhão de entrada, US$ 1,90 por milhão de saída e US$ 0,10 em cache. Tokens de imagem costumam ter tabela própria — é preciso consultar a página do provedor para saber quanto cada imagem processada consome.
Quando vale trocar o Qwen3 Next 80B pelo Qwen3 VL 235B?
Quando o seu fluxo precisa ler o que está em uma imagem, PDF ou gráfico. Para texto puro, o Qwen3 Next 80B A3B Thinking é mais barato (US$ 1,20 por milhão de saída) e tem índice de inteligência publicado, então a troca não se justifica.