FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Qwen3 VL 32B Instruct custa 5% do preço do Claude Haiku 4.5

Modelo multimodal chinês de 32B chega ao catálogo com entrada de US$ 0,104 e saída de US$ 0,416 por milhão de tokens — mas sem nota de inteligência publicada.

Redação FalaVIP IA 3 min de leitura
US$ 0,416por milhão de tokens de saída
US$ 0,104por milhão de tokens de entrada
131.072tokens de contexto

O número que importa está no rodapé da fatura

Você viu o anúncio do Qwen3 VL 32B Instruct e provavelmente pulou para o parágrafo de "capacidade multimodal". Faz sentido — é a parte bonita. Mas quem paga a API lê de baixo para cima, e o que está no rodapé diz o seguinte: US$ 0,104 por milhão de tokens de entrada e US$ 0,416 por milhão de tokens de saída. Em um mercado onde o Claude Haiku 4.5 cobra US$ 5 e o o3 cobra US$ 8 pelo mesmo milhão de saída, esse número não é detalhe. É a manchete.

O que a Qwen entregou hoje

O Qwen3 VL 32B Instruct é um modelo de 32 bilhões de parâmetros treinado para entender texto, imagem e vídeo com a mesma interface. Janela de contexto de 131.072 tokens, modalidade text+image->text, sem cache de prompt publicado. É um modelo multimodal de peso aberto, da família Qwen3, voltado para quem precisa de visão computacional sem inflar a conta no fim do mês.

Preço de saída (US$ por milhão de tokens)
MiniMax M21,02o38Claude Haiku 4.55gpt-oss-120b0,17US$/M
Fonte: OpenRouter

O problema é que a ficha técnica traz um campo em branco que costuma definir o jogo: o índice de inteligência não foi publicado. Não dá para afirmar que ele é melhor ou pior que o o3 em raciocínio — porque o catálogo simplesmente não mediu. E sem essa nota, o argumento de venda do Qwen vira puramente preço.

A conta, sem maquiagem

Vamos colocar lado a lado o que muda na fatura de quem chama um multimodal hoje. O o3 custa US$ 8 por milhão de tokens de saída. O Claude Haiku 4.5 custa US$ 5. O Qwen3 VL 32B Instruct custa US$ 0,416. Em uma chamada típica de 10 mil tokens de saída — uma análise de imagem com legenda longa, um resumo de documento visual — você gasta US$ 0,08 com o Qwen, US$ 0,05 com o Haiku 4.5 e US$ 0,08 com o o3. Espere, refiz a conta: US$ 0,0042 com o Qwen, US$ 0,05 com o Haiku e US$ 0,08 com o o3. O chinês custa cerca de 12 vezes menos que o Haiku e 19 vezes menos que o o3, na saída.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
MiniMax M2 (o novo)0.2551.02205k
o331.128200k
Claude Haiku 4.529.915200k
gpt-oss-120b24.10.0370.17131k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

É uma diferença grande o suficiente para reposicionar produto. Não é um "modelo bom e barato" — é um modelo cujo único argumento verificável até agora é o preço.

Para quem isso muda alguma coisa

Se você roda um pipeline de visão em lote — milhares de imagens por dia, extração de campos em notas fiscais, classificação de produtos, OCR com raciocínio — o Qwen3 VL 32B Instruct entra como candidato óbvio a teste. O custo por chamada cai uma ordem de grandeza, e multimodalidade com 32B de parâmetros costuma rodar em hardware razoável se você hospedar.

Se você precisa de raciocínio pesado sobre imagem — algo como "leia este gráfico de barras e me explique a tendência comparando com o trimestre anterior" —, a ausência de nota de inteligência pesa. Você vai pagar US$ 0,416 para descobrir se o modelo entrega, e o catálogo não te dá essa resposta antes.

Para quem já usa o Claude Haiku 4.5 ou o o3 em produção multimodal, o Qwen3 VL 32B Instruct não substitui nada hoje — mas vira uma opção de chão de fábrica. Algo para colocar na esteira de tarefas onde o erro é tolerável e o volume é alto.

Onde o tabuleiro está

O catálogo fechou o dia com 263 modelos listados de 41 criadores. Nos últimos 30 dias, 26 modelos foram lançados — um ritmo que não para. O topo de inteligência segue com o3 (31,096), Claude Haiku 4.5 (29,892) e gpt-oss-120b (24,126), todos com notas publicadas. O Qwen3 VL 32B Instruct entra sem nota, então não aparece nesse ranking — e a comparação direta de capacidade fica em aberto até alguém rodar benchmark.

Inteligência × preço de saída
o3Claude Haiku 4.5gpt-oss-120bUS$ por milhão (saída, escala log)índice de inteligência

O que está claro é a faixa de preço. A Qwen está posicionando a família Qwen3 VL na faixa dos modelos abertos de baixo custo, brigando por centavos onde o o3 briga por dólares. É uma estratégia, não um acidente.

O que você faz com isso amanhã

Pegue o caso de uso multimodal mais caro da sua operação — aquele que dói na fatura. Rode o Qwen3 VL 32B Instruct em uma amostra de 100 chamadas e meça qualidade contra o modelo atual. Se a taxa de erro aceitável for compatível, você tem um corte de custo de 90% esperando para ser ativado. Se não for, você perdeu uma tarde e aprendeu onde está o limite do barato.

Em uma frase

Para volume alto de visão com tolerância a erro, vale testar o Qwen3 VL 32B Instruct — o preço é uma ordem de grandeza menor, mas a nota de inteligência ainda não foi publicada.

Perguntas frequentes

Quanto custa o Qwen3 VL 32B Instruct na API?

US$ 0,104 por milhão de tokens de entrada e US$ 0,416 por milhão de tokens de saída. O catálogo não publicou preço de cache de prompt.

O Qwen3 VL 32B Instruct é melhor que o Claude Haiku 4.5?

O catálogo não publicou índice de inteligência para o Qwen3 VL 32B Instruct, então não dá para comparar diretamente. A diferença verificável hoje é de preço: a saída custa cerca de 12 vezes menos que a do Haiku 4.5.

O Qwen3 VL 32B Instruct é multimodal?

Sim. Aceita texto e imagem como entrada e gera texto como saída, com janela de contexto de 131.072 tokens e 32 bilhões de parâmetros.

Leia também