Qwen3 VL 8B Thinking cobra caro para pensar em imagem
Oito dias após o lançamento, o modelo multimodal de raciocínio da Qwen chega com preço de categoria premium e sem nota pública de inteligência para comparar.
Oito dias no catálogo e a conta já assusta
A Qwen publicou em 14 de outubro de 2025 uma variante de raciocínio do seu modelo multimodal compacto, o Qwen3 VL 8B Thinking. Oito dias depois, ele segue listado, ao lado de outros 260 modelos no catálogo — mas o que chama atenção não é a existência dele, e sim o que ele cobra para fazer o que promete: pensar sobre imagens e documentos com cadeia de raciocínio visível.
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3-vl-8b-thinking |
| Criador | qwen |
| Preço de entrada | US$ 0.180 / M tokens |
| Preço de saída | US$ 2.10 / M tokens |
| Janela de contexto | 131k |
| Modalidade | text+image->text |
O preço diz uma coisa, o tamanho diz outra
Você paga US$ 0,18 por milhão de tokens de entrada e US$ 2,10 por milhão de tokens de saída. Esse segundo número é o que dói. É mais do que o dobro do que o Claude Haiku 4.5 cobra para gerar texto raciocinado (US$ 5,00 pela métrica do catálogo, mas o Haiku é modelo de fronteira completo, não um 8B). Comparado com um multimodal compacto, é caro.
A grande questão é: por que um modelo de 8 bilhões de parâmetros custa preço de categoria premium? Resposta honesta: tokens de raciocínio são tokens de raciocínio. Quando o modelo "pensa em voz alta" antes de responder, cada imagem processada vira centenas de tokens intermediários cobrados na saída. Você não está pagando por uma resposta — está pagando por uma deliberação.
Quem está no topo do mercado hoje, e onde este modelo (não) entra
Olhando os cinco primeiros do catálogo nesta data, a fotografia é clara: OpenAI o3 lidera com IQ 31,096 a US$ 8,00 de saída; Claude Haiku 4.5 vem em segundo com IQ 29,892 a US$ 5,00; depois cai para gpt-oss-120b com IQ 24,126 a US$ 0,17. O Qwen3 VL 8B Thinking não tem índice de inteligência publicado — os campos iq, coding, agentic, blended e reasoning vieram vazios no dado. Isso significa que, no momento, não há benchmark padronizado para você comparar capacidade contra capacidade.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
O que dá para afirmar sem inventar: este é um modelo compacto (8B), multimodal (texto + imagem → texto), com 131.072 tokens de contexto, criado pela Qwen. Não há no dado a confirmação de que os pesos são abertos, nem o país de origem, nem a velocidade de inferência. Esses buracos existem por omissão do catálogo, não por falha sua.
Para quem ele faz sentido (e para quem não)
Faz sentido para você se: precisa analisar imagens complexas — diagramas técnicos, fluxogramas, documentos com layout denso — e quer um modelo compacto que cabe em orçamento de produção sem chamar uma API de fronteira. A capacidade de raciocínio multimodal é o diferencial real frente a um multimodal "burro" que só descreve.
Não muda nada se: você já roda um multimodal localmente, se o seu caso de uso é classificação simples de imagem, ou se o seu pipeline não suporta a latência extra que raciocínio traz. Para OCR puro ou extração estruturada, há modelos mais baratos. Para raciocínio puro sem imagem, o Claude Haiku 4.5 ou o o3 entregam mais e cobram de forma mais previsível.
A armadilha clássica: usar este modelo em volume alto de saída sem calcular tokens de pensamento. Você olha US$ 0,18 de entrada e acha barato; quando a fatura chega, metade veio dos tokens de raciocínio cobrados a US$ 2,10. Multiplique por dezenas de milhões e a brincadeira fica séria.
A implicação prática
Antes de integrar o Qwen3 VL 8B Thinking em produção, faça um teste de uma semana com um caso real, conte os tokens de saída gerados (não só os tokens finais) e compare o custo por tarefa concluída com o Claude Haiku 4.5 em multimodal ou com um modelo local de visão. Se a diferença de qualidade justificar o prêmio, vai. Se não, você acabou de descobrir que compacto não significa barato — significa pequeno.
Teste em produção real contando tokens de raciocínio antes de migrar; este modelo pode caber no seu pipeline de visão complexa, mas o custo de saída exige validação.
Perguntas frequentes
Quanto custa o Qwen3 VL 8B Thinking na API?
US$ 0,18 por milhão de tokens de entrada e US$ 2,10 por milhão de tokens de saída, segundo o catálogo nesta data. Não há taxa de cache publicada. O valor de saída é alto para um modelo de 8B e reflete o custo dos tokens de raciocínio.
O Qwen3 VL 8B Thinking é melhor que o Claude Haiku 4.5?
Sem benchmark público de inteligência para o Qwen3 VL 8B Thinking no catálogo, não dá para afirmar capacidade comparada. O que dá para dizer é que o Haiku 4.5 tem IQ 29,892 e custa US$ 5,00 por milhão de saída, enquanto o Qwen custa US$ 2,10 — mas são modelos de tamanhos e propostas diferentes.
Para que serve um modelo multimodal com raciocínio?
Serve para tarefas em que o modelo precisa interpretar imagem e texto juntos com cadeia de pensamento explícita: análise de gráficos, resposta a perguntas sobre diagramas, leitura crítica de documentos com layout complexo. Para descrição simples de imagem ou OCR, há opções mais baratas e rápidas.