Qwen3 VL 32B Instruct custa 5% do preço do Claude Haiku 4.5
Modelo multimodal chinês de 32B chega ao catálogo com entrada de US$ 0,104 e saída de US$ 0,416 por milhão de tokens — mas sem nota de inteligência publicada.
O número que importa está no rodapé da fatura
Você viu o anúncio do Qwen3 VL 32B Instruct e provavelmente pulou para o parágrafo de "capacidade multimodal". Faz sentido — é a parte bonita. Mas quem paga a API lê de baixo para cima, e o que está no rodapé diz o seguinte: US$ 0,104 por milhão de tokens de entrada e US$ 0,416 por milhão de tokens de saída. Em um mercado onde o Claude Haiku 4.5 cobra US$ 5 e o o3 cobra US$ 8 pelo mesmo milhão de saída, esse número não é detalhe. É a manchete.
O que a Qwen entregou hoje
O Qwen3 VL 32B Instruct é um modelo de 32 bilhões de parâmetros treinado para entender texto, imagem e vídeo com a mesma interface. Janela de contexto de 131.072 tokens, modalidade text+image->text, sem cache de prompt publicado. É um modelo multimodal de peso aberto, da família Qwen3, voltado para quem precisa de visão computacional sem inflar a conta no fim do mês.
O problema é que a ficha técnica traz um campo em branco que costuma definir o jogo: o índice de inteligência não foi publicado. Não dá para afirmar que ele é melhor ou pior que o o3 em raciocínio — porque o catálogo simplesmente não mediu. E sem essa nota, o argumento de venda do Qwen vira puramente preço.
A conta, sem maquiagem
Vamos colocar lado a lado o que muda na fatura de quem chama um multimodal hoje. O o3 custa US$ 8 por milhão de tokens de saída. O Claude Haiku 4.5 custa US$ 5. O Qwen3 VL 32B Instruct custa US$ 0,416. Em uma chamada típica de 10 mil tokens de saída — uma análise de imagem com legenda longa, um resumo de documento visual — você gasta US$ 0,08 com o Qwen, US$ 0,05 com o Haiku 4.5 e US$ 0,08 com o o3. Espere, refiz a conta: US$ 0,0042 com o Qwen, US$ 0,05 com o Haiku e US$ 0,08 com o o3. O chinês custa cerca de 12 vezes menos que o Haiku e 19 vezes menos que o o3, na saída.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| MiniMax M2 (o novo) | — | 0.255 | 1.02 | 205k |
| o3 | 31.1 | 2 | 8 | 200k |
| Claude Haiku 4.5 | 29.9 | 1 | 5 | 200k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
É uma diferença grande o suficiente para reposicionar produto. Não é um "modelo bom e barato" — é um modelo cujo único argumento verificável até agora é o preço.
Para quem isso muda alguma coisa
Se você roda um pipeline de visão em lote — milhares de imagens por dia, extração de campos em notas fiscais, classificação de produtos, OCR com raciocínio — o Qwen3 VL 32B Instruct entra como candidato óbvio a teste. O custo por chamada cai uma ordem de grandeza, e multimodalidade com 32B de parâmetros costuma rodar em hardware razoável se você hospedar.
Se você precisa de raciocínio pesado sobre imagem — algo como "leia este gráfico de barras e me explique a tendência comparando com o trimestre anterior" —, a ausência de nota de inteligência pesa. Você vai pagar US$ 0,416 para descobrir se o modelo entrega, e o catálogo não te dá essa resposta antes.
Para quem já usa o Claude Haiku 4.5 ou o o3 em produção multimodal, o Qwen3 VL 32B Instruct não substitui nada hoje — mas vira uma opção de chão de fábrica. Algo para colocar na esteira de tarefas onde o erro é tolerável e o volume é alto.
Onde o tabuleiro está
O catálogo fechou o dia com 263 modelos listados de 41 criadores. Nos últimos 30 dias, 26 modelos foram lançados — um ritmo que não para. O topo de inteligência segue com o3 (31,096), Claude Haiku 4.5 (29,892) e gpt-oss-120b (24,126), todos com notas publicadas. O Qwen3 VL 32B Instruct entra sem nota, então não aparece nesse ranking — e a comparação direta de capacidade fica em aberto até alguém rodar benchmark.
O que está claro é a faixa de preço. A Qwen está posicionando a família Qwen3 VL na faixa dos modelos abertos de baixo custo, brigando por centavos onde o o3 briga por dólares. É uma estratégia, não um acidente.
O que você faz com isso amanhã
Pegue o caso de uso multimodal mais caro da sua operação — aquele que dói na fatura. Rode o Qwen3 VL 32B Instruct em uma amostra de 100 chamadas e meça qualidade contra o modelo atual. Se a taxa de erro aceitável for compatível, você tem um corte de custo de 90% esperando para ser ativado. Se não for, você perdeu uma tarde e aprendeu onde está o limite do barato.
Para volume alto de visão com tolerância a erro, vale testar o Qwen3 VL 32B Instruct — o preço é uma ordem de grandeza menor, mas a nota de inteligência ainda não foi publicada.
Perguntas frequentes
Quanto custa o Qwen3 VL 32B Instruct na API?
US$ 0,104 por milhão de tokens de entrada e US$ 0,416 por milhão de tokens de saída. O catálogo não publicou preço de cache de prompt.
O Qwen3 VL 32B Instruct é melhor que o Claude Haiku 4.5?
O catálogo não publicou índice de inteligência para o Qwen3 VL 32B Instruct, então não dá para comparar diretamente. A diferença verificável hoje é de preço: a saída custa cerca de 12 vezes menos que a do Haiku 4.5.
O Qwen3 VL 32B Instruct é multimodal?
Sim. Aceita texto e imagem como entrada e gera texto como saída, com janela de contexto de 131.072 tokens e 32 bilhões de parâmetros.