FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 VL 8B custa pouco, mas não entrega o que o nome sugere

O multimodal barato da Qwen chega sete dias depois do lançamento com janela gigante e preço de modelo pequeno — só que a conta nem sempre fecha.

Redação FalaVIP IA 3 min de leitura
US$ 0,117por milhão de tokens de entrada
US$ 0,455por milhão de tokens de saída
262.144tokens de contexto

Sete dias no catálogo e o Qwen3 VL 8B Instruct já aparece como uma das opções multimodais mais baratas do mercado — e é exatamente aí que mora a armadilha. O preço de entrada, US$ 0,117 por milhão de tokens, parece um achado. Mas é multimodal: você está pagando para o modelo olhar a imagem e devolver texto. Quem só manda texto está pagando caro por um recurso que não usa.

O que o modelo de fato entrega

A ficha é clara: text+image→text, contexto de 262.144 tokens, lançamento em 14 de outubro de 2025. É um modelo de 8B parâmetros da família Qwen3-VL, voltado para entender imagem e cruzar com texto. A janela de contexto enorme é o chamariz real — você enfia um PDF inteiro, um vídeo em frames, uma sequência longa de screenshots, sem se preocupar.

O problema é o que falta na ficha. Não tem índice de inteligência publicado, não tem benchmark de coding, não tem nota agentic, não tem preço de cache, não tem velocidade, não tem país de origem confirmado. Quando um modelo chega sem essas medidas, a pergunta deixa de ser "quanto custa" e passa a ser "quanto custa descobrir se ele presta".

Preço na vitrine vs. preço na fatura

Vamos fazer a conta que o release não faz. Entrada a US$ 0,117 e saída a US$ 0,455 por milhão. Para uma tarefa típica de visão — descrever uma imagem, extrair dados de um print, responder perguntas sobre um gráfico — o texto gerado costuma ser menor que o texto de entrada somado à imagem. Mas em fluxos agentic, onde o modelo devolve muito texto por chamada, a saída pesa.

Compare com o topo do catálogo hoje. O OpenAI o3 lidera com IQ 31,096 a US$ 8 por milhão de saída. O Claude Haiku 4.5 vem logo atrás, IQ 29,892 a US$ 5. O gpt-oss-120b, da própria OpenAI, marca IQ 24,126 a US$ 0,17 de saída — multimodal? Não, é só texto. O Qwen3 Next 80B A3B Thinking fecha o bloco com IQ 16,867 a US$ 1,20.

Ficha técnica — Qwen3 VL 8B Instruct
CampoValor
Identificadorqwen/qwen3-vl-8b-instruct
Criadorqwen
Preço de entradaUS$ 0.117 / M tokens
Preço de saídaUS$ 0.455 / M tokens
Janela de contexto262k
Modalidadetext+image->text
O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 261 modelos disponíveis no catálogo nesta data.

O Qwen3 VL 8B Instruct entra abaixo de todos esses em preço de saída — US$ 0,455. Mas preço de saída menor só importa se o modelo entregar qualidade próxima. Sem benchmark publicado, "entregar" é um ato de fé.

Para quem vale

Se você precisa processar volume de imagem e texto com orçamento apertado — automação de triagem de prints, extração de dados de documentos escaneados, legendagem em massa — o Qwen3 VL 8B Instruct é candidato sério. A janela de 262K tokens significa que você empilha dezenas de páginas em uma chamada só, o que derruba custo por documento.

Se você está montando um pipeline onde o multimodal é o coração da operação e o orçamento é o gargalo, faz sentido testar. A diferença entre US$ 0,455 e US$ 5 por milhão de saída é de uma ordem de magnitude. Em cem milhões de tokens de saída por mês, são US$ 4.500 contra US$ 455.

Para quem NÃO vale

Se o seu uso principal é texto puro, você está pagando pelo encoder de imagem à toa. O gpt-oss-120b, com IQ 24,126 e US$ 0,17 de saída, é texto-only e mais barato na saída. Mesmo o gpt-oss-20b, IQ 15,225 a US$ 0,13, entrega mais por menos em workload sem imagem.

Se você precisa de raciocínio forte sobre imagem — interpretação de gráfico complexo, raciocínio visual em múltiplos passos, agentic que olha tela —, a ausência de benchmark agentic e de IQ é um sinal de alerta. Você vai descobrir na produção se ele aguenta, e descobrir na produção custa dinheiro.

O tabuleiro em 21 de outubro de 2025

O catálogo tem 261 modelos listados de 41 criadores. Nos últimos 30 dias, 31 modelos foram lançados — é um mercado que não para de girar. A Qwen, da Alibaba, é uma das criadoras mais prolíficas, e a estratégia aqui é óbvia: ocupar a faixa de preço baixo com multimodal. Funciona como portfólio. Funciona menos como decisão de compra individual sem dados de qualidade.

A pergunta que fica não é "o Qwen3 VL 8B Instruct é bom?". É "bom para quê, com qual margem de erro, em qual volume?". Sem resposta da Qwen em números, a resposta é sua — e sai do seu bolso.

Na prática: teste em uma amostra pequena do seu workload real, meça taxa de erro, e só então escale. Se a taxa de erro for 2x a de um modelo mais caro, a economia de US$ 0,30 por milhão de saída vira prejuízo.

Em uma frase

Use o Qwen3 VL 8B Instruct quando volume de imagem com orçamento apertado for o caso — e só depois de medir erro no seu workload, porque sem benchmark publicado a economia prometida pode virar custo escondido.

Perguntas frequentes

O Qwen3 VL 8B Instruct é gratuito?

Não. O catálogo lista preço de US$ 0,117 por milhão de tokens de entrada e US$ 0,455 por milhão de tokens de saída. Não há tier gratuito publicado.

Quanto de contexto o Qwen3 VL 8B Instruct aceita?

A janela publicada é de 262.144 tokens, uma das maiores do catálogo para modelos multimodais. Na prática, isso permite empilhar documentos longos ou sequências de frames em uma única chamada.

O Qwen3 VL 8B Instruct tem benchmark de inteligência publicado?

Não. No catálogo desta data, os campos de IQ, coding, agentic e velocidade estão sem valor. Isso não significa que o modelo é fraco — significa que a Qwen não publicou essas medidas, e cabe a você testar no seu caso.

Leia também