Qwen3 VL 8B Thinking custa quase 4× mais caro que o irmão Instruct
Versão de raciocínio do multimodal de 8B da Qwen estreia a US$ 2,10 por milhão de tokens de saída, enquanto a variante Instruct sai por US$ 0,46
O gancho está na diferença entre as duas versões
Você abre o catálogo da Qwen hoje e encontra dois modelos com nomes quase iguais: Qwen3 VL 8B Thinking e Qwen3 VL 8B Instruct. Mesma marca, mesmo tamanho, mesma multimodalidade (texto + imagem entrando, texto saindo). A conta, porém, diz outra coisa. A variante Thinking cobra US$ 2,10 por milhão de tokens de saída. A Instruct, US$ 0,46. Para cada quatro tokens que você gera com a Thinking, a Instruct entrega quase cinco.
É o clássico caso em que o "Thinking" do nome não é enfeite: é um multiplicador no boleto.
O que cada um faz, sem enrolação
O Thinking é a versão otimizada para raciocínio do multimodal de 8B da Qwen. A descrição oficial fala em "raciocínio visual e textual avançado em cenas complexas, documentos e sequências temporais" — ou seja, é o modelo que você chamaria para olhar uma imagem e explicar o que está acontecendo ali, em vez de só descrever. O Instruct é a versão padrão, mais barata, para tarefas mais diretas.
A diferença aparece também na janela de contexto: o Thinking opera com 131.072 tokens, enquanto o Instruct dobra isso, para 262.144. Pense na janela como o tamanho da mesa onde o modelo espalha os papéis: o Thinking tem uma mesa menor, mas lê com mais cuidado.
Onde isso entra no catálogo de hoje
Para situar o Thinking no tabuleiro, vale olhar quem já estava jogando. O índice de inteligência do catálogo (Artificial Analysis, medição atual) tem o OpenAI o3 na ponta, com IQ 31,1 e preço de saída de US$ 8 por milhão de tokens. Logo abaixo vem o gpt-oss-120b, da própria OpenAI, com IQ 24,1 e preço de US$ 0,17 — o que mostra que "modelo de raciocínio" não precisa custar caro. O Qwen3 Next 80B A3B Thinking, também da Qwen e já no catálogo, marca IQ 16,9 a US$ 1,20.
O Qwen3 VL 8B Thinking não tem índice de inteligência publicado no catálogo. Isso não é detalhe: significa que, até onde os dados públicos desta data mostram, não há benchmark padronizado para comparar diretamente. Você está comprando no escuro quanto à performance relativa.
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3-vl-8b-thinking |
| Criador | qwen |
| Preço de entrada | US$ 0.180 / M tokens |
| Preço de saída | US$ 2.10 / M tokens |
| Janela de contexto | 131k |
| Modalidade | text+image->text |
Para quem vale, para quem não muda nada
Vale para você se está montando um pipeline que precisa olhar imagem e texto juntos e justificar cada chamada de API com raciocínio mais profundo — por exemplo, extrair lógica de um fluxograma, ler um documento técnico com diagramas, ou seguir uma sequência de quadros. O Thinking foi feito para isso, e a diferença de preço se paga se a tarefa realmente exige o passo a passo.
Não muda nada para você se já está usando o Instruct e está feliz. A versão barata cobre descrição de imagem, OCR simples e perguntas diretas sobre anexos. Pagar 4,6× mais por token de saída para essas tarefas é queimar dinheiro.
Cuidado também se você depende de janela de contexto grande: o Thinking corta a mesa pela metade em relação ao Instruct. Se o seu prompt mais o histórico mais a imagem somam mais de 131 mil tokens, este modelo nem é opção.
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Qwen3 VL 8B Instruct | 0.117 | 0.455 | 262k |
O cenário mais amplo
O catálogo fechou o dia com 256 modelos listados de 40 criadores, e 29 lançamentos nos últimos 30 dias. O movimento de hoje da Qwen é cirúrgico: não traz um flagship, traz uma variante de raciocínio num modelo multimodal pequeno, com preço coerente com a categoria. A pergunta que fica não é "este modelo é bom?" — é "para qual das minhas tarefas de visão eu realmente preciso pagar pelo Thinking?".
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Use o Qwen3 VL 8B Instruct por padrão e só troque para o Thinking quando a tarefa exigir raciocínio visual passo a passo — caso contrário, você paga quase cinco vezes mais por token sem ganho claro.
Perguntas frequentes
Qual a diferença entre Qwen3 VL 8B Thinking e Instruct?
O Thinking é a variante otimizada para raciocínio sobre imagens e textos complexos; o Instruct é a versão padrão, mais barata e indicada para tarefas diretas. O Thinking custa US$ 2,10 por milhão de tokens de saída contra US$ 0,46 do Instruct.
O Qwen3 VL 8B Thinking tem benchmark de inteligência publicado?
Não. No catálogo desta data, o modelo aparece sem índice de inteligência registrado, então não há como compará-lo diretamente com o3, gpt-oss-120b ou outros pelo Artificial Analysis.
Quando o Thinking não compensa?
Quando a tarefa é descrição simples de imagem, OCR ou perguntas diretas sobre anexos — para isso o Instruct resolve por menos de um quarto do preço. Também não compensa se você precisa de mais de 131.072 tokens de contexto, limite do Thinking.