FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 VL 32B Instruct chega por US$ 0,42 o milhão de saída

Modelo multimodal chinês de 32B quer brigar com Claude Haiku e GPT-OSS em visão — sem benchmark público de IA no catálogo.

Redação FalaVIP IA 3 min de leitura
US$ 0,42por milhão de tokens de saída
US$ 0,10por milhão de tokens de entrada
131.072tokens de contexto

O que está em jogo

O catálogo de modelos de IA fechou a semana com 263 modelos ativos, vindos de 41 criadores diferentes. Entrou na lista, há quatro dias, um multimodal da Qwen com 32 bilhões de parâmetros, treinado para entender texto, imagem e vídeo. O preço de tabela chama atenção: US$ 0,10 por milhão de tokens de entrada e US$ 0,42 por milhão de tokens de saída. É barato — mas barato em quê, exatamente?

O preço que você vê e o preço que você paga

A conta é simples se você só envia texto curto e recebe uma legenda. Mas um modelo de visão não funciona assim: a imagem vira tokens antes de chegar ao modelo, e essa tokenização custa. Em pipelines típicos de visão, a imagem sozinha consome entre 500 e 2.000 tokens de entrada. Some o prompt do sistema, o histórico e a resposta — e o "barato" começa a depender muito do tamanho da imagem e do comprimento da resposta.

Para comparar: o Claude Haiku 4.5, da Anthropic, cobra US$ 1 por milhão de entrada e US$ 5 por milhão de saída. O GPT-OSS-120B, da OpenAI, cobra US$ 0,15 e US$ 0,60. O Qwen3 VL 32B Instruct está abaixo dos dois em todas as colunas — entrada e saída. A diferença para o Haiku é grande o suficiente para mudar a conta no fim do mês em produtos que processam muitas imagens.

Ficha técnica — Qwen3 VL 32B Instruct
CampoValor
Identificadorqwen/qwen3-vl-32b-instruct
Criadorqwen
Preço de entradaUS$ 0.104 / M tokens
Preço de saídaUS$ 0.416 / M tokens
Janela de contexto131k
Modalidadetext+image->text

Onde ele entra no tabuleiro

Olhando o topo do catálogo hoje, a régua de inteligência coloca o OpenAI o3 na frente, com IQ 31,096 a US$ 8 por milhão de saída. Logo abaixo vem o Claude Haiku 4.5, com IQ 29,892 a US$ 5. O Qwen3 VL 32B Instruct não tem índice de inteligência publicado no catálogo — e isso não é detalhe pequeno. Sem nota, você não sabe onde ele se encaixa em raciocínio geral, em coding ou em uso agente. Só dá para afirmar que é multimodal e que cabe no bolso.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 263 modelos disponíveis no catálogo nesta data.

O Qwen3 Next 80B A3B Thinking, do mesmo criador, aparece com IQ 16,867 a US$ 1,20 o milhão de saída — é um modelo de raciocínio, não de visão. O GPT-OSS-20B, da OpenAI, marca IQ 15,225 a US$ 0,13. Esses são os vizinhos de preço e de proposta. O Qwen3 VL 32B Instruct custa mais que o GPT-OSS-20B na saída, mas oferece algo que o GPT-OSS-20B não oferece: entrada de imagem. É essa troca que define a escolha.

Para quem vale — e para quem não muda nada

Vale para quem está montando produto com imagem hoje e paga caro pelo Claude Haiku 4.5 só pelo multimodal. Vale para quem precisa processar vídeo em escala e quer testar uma alternativa mais barata antes de comprometer orçamento. Vale para quem já roda pipeline da Qwen e quer manter um único provedor.

Não muda nada para quem usa o modelo só para texto — existem opções mais baratas e com benchmark público. Não muda nada para quem precisa de raciocínio forte ou uso agente pesado: sem nota de IQ e sem dado de agentic no catálogo, é cedo para apostar. Não muda nada para quem exige suporte comercial em inglês, contrato enterprise ou SLA — o catálogo não traz país de origem nem tipo de suporte, e isso importa quando a fatura é corporativa.

O que fazer com isso

Se visão é o gargalo da sua conta, teste o Qwen3 VL 32B Instruct em uma rota secundária e meça custo por imagem processada, não por token. Se visão é um extra que você usa de vez em quando, espere alguém publicar benchmark independente antes de migrar. E se você está só olhando preço, lembre: o número bonito é por milhão de tokens — e em multimodal, o token que mais pesa é o da imagem.

Em uma frase

Teste o Qwen3 VL 32B Instruct como rota secundária para visão se o Claude Haiku 4.5 está pesando na fatura, mas espere benchmark independente antes de migrar produção.

Perguntas frequentes

Quanto custa o Qwen3 VL 32B Instruct na API?

US$ 0,10 por milhão de tokens de entrada e US$ 0,42 por milhão de tokens de saída, segundo o catálogo. O preço de cache não foi publicado.

O Qwen3 VL 32B Instruct tem benchmark de inteligência?

Não. O catálogo não traz índice de IQ, nem nota de coding ou agentic para esse modelo — então não dá para compará-lo diretamente com Claude Haiku 4.5 ou GPT-OSS em raciocínio.

Ele serve para processar vídeo?

A descrição diz que sim — combina percepção visual com raciocínio de texto e foi treinado para vídeo. Mas sem dado de velocidade ou benchmark de vídeo no catálogo, o teste prático é o único caminho para saber se aguenta seu caso.

Leia também