FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Qwen3 VL 8B Thinking custa quase 4× mais caro que o irmão Instruct

Versão de raciocínio do multimodal de 8B da Qwen estreia a US$ 2,10 por milhão de tokens de saída, enquanto a variante Instruct sai por US$ 0,46

Redação FalaVIP IA 3 min de leitura
US$ 2,10por milhão de tokens de saída do Thinking
US$ 0,46por milhão de tokens de saída do Instruct
131.072tokens de contexto do Thinking

O gancho está na diferença entre as duas versões

Você abre o catálogo da Qwen hoje e encontra dois modelos com nomes quase iguais: Qwen3 VL 8B Thinking e Qwen3 VL 8B Instruct. Mesma marca, mesmo tamanho, mesma multimodalidade (texto + imagem entrando, texto saindo). A conta, porém, diz outra coisa. A variante Thinking cobra US$ 2,10 por milhão de tokens de saída. A Instruct, US$ 0,46. Para cada quatro tokens que você gera com a Thinking, a Instruct entrega quase cinco.

É o clássico caso em que o "Thinking" do nome não é enfeite: é um multiplicador no boleto.

O que cada um faz, sem enrolação

O Thinking é a versão otimizada para raciocínio do multimodal de 8B da Qwen. A descrição oficial fala em "raciocínio visual e textual avançado em cenas complexas, documentos e sequências temporais" — ou seja, é o modelo que você chamaria para olhar uma imagem e explicar o que está acontecendo ali, em vez de só descrever. O Instruct é a versão padrão, mais barata, para tarefas mais diretas.

A diferença aparece também na janela de contexto: o Thinking opera com 131.072 tokens, enquanto o Instruct dobra isso, para 262.144. Pense na janela como o tamanho da mesa onde o modelo espalha os papéis: o Thinking tem uma mesa menor, mas lê com mais cuidado.

Preço de saída (US$ por milhão de tokens)
Qwen3 VL 8B Thinking2,1o38gpt-oss-120b0,17Qwen3 Next 80B A3B Thinking1,2US$/M
Fonte: OpenRouter

Onde isso entra no catálogo de hoje

Para situar o Thinking no tabuleiro, vale olhar quem já estava jogando. O índice de inteligência do catálogo (Artificial Analysis, medição atual) tem o OpenAI o3 na ponta, com IQ 31,1 e preço de saída de US$ 8 por milhão de tokens. Logo abaixo vem o gpt-oss-120b, da própria OpenAI, com IQ 24,1 e preço de US$ 0,17 — o que mostra que "modelo de raciocínio" não precisa custar caro. O Qwen3 Next 80B A3B Thinking, também da Qwen e já no catálogo, marca IQ 16,9 a US$ 1,20.

Índice de inteligência (Artificial Analysis)
o331,1gpt-oss-120b24,1Qwen3 Next 80B A3B Thinking16,9índice
Fonte: Artificial Analysis

O Qwen3 VL 8B Thinking não tem índice de inteligência publicado no catálogo. Isso não é detalhe: significa que, até onde os dados públicos desta data mostram, não há benchmark padronizado para comparar diretamente. Você está comprando no escuro quanto à performance relativa.

Ficha técnica — Qwen3 VL 8B Thinking
CampoValor
Identificadorqwen/qwen3-vl-8b-thinking
Criadorqwen
Preço de entradaUS$ 0.180 / M tokens
Preço de saídaUS$ 2.10 / M tokens
Janela de contexto131k
Modalidadetext+image->text

Para quem vale, para quem não muda nada

Vale para você se está montando um pipeline que precisa olhar imagem e texto juntos e justificar cada chamada de API com raciocínio mais profundo — por exemplo, extrair lógica de um fluxograma, ler um documento técnico com diagramas, ou seguir uma sequência de quadros. O Thinking foi feito para isso, e a diferença de preço se paga se a tarefa realmente exige o passo a passo.

Não muda nada para você se já está usando o Instruct e está feliz. A versão barata cobre descrição de imagem, OCR simples e perguntas diretas sobre anexos. Pagar 4,6× mais por token de saída para essas tarefas é queimar dinheiro.

Cuidado também se você depende de janela de contexto grande: o Thinking corta a mesa pela metade em relação ao Instruct. Se o seu prompt mais o histórico mais a imagem somam mais de 131 mil tokens, este modelo nem é opção.

Os outros modelos anunciados no mesmo dia
ModeloEntrada US$/MSaída US$/MContexto
Qwen3 VL 8B Instruct0.1170.455262k

O cenário mais amplo

O catálogo fechou o dia com 256 modelos listados de 40 criadores, e 29 lançamentos nos últimos 30 dias. O movimento de hoje da Qwen é cirúrgico: não traz um flagship, traz uma variante de raciocínio num modelo multimodal pequeno, com preço coerente com a categoria. A pergunta que fica não é "este modelo é bom?" — é "para qual das minhas tarefas de visão eu realmente preciso pagar pelo Thinking?".

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 256 modelos disponíveis no catálogo nesta data.
Em uma frase

Use o Qwen3 VL 8B Instruct por padrão e só troque para o Thinking quando a tarefa exigir raciocínio visual passo a passo — caso contrário, você paga quase cinco vezes mais por token sem ganho claro.

Perguntas frequentes

Qual a diferença entre Qwen3 VL 8B Thinking e Instruct?

O Thinking é a variante otimizada para raciocínio sobre imagens e textos complexos; o Instruct é a versão padrão, mais barata e indicada para tarefas diretas. O Thinking custa US$ 2,10 por milhão de tokens de saída contra US$ 0,46 do Instruct.

O Qwen3 VL 8B Thinking tem benchmark de inteligência publicado?

Não. No catálogo desta data, o modelo aparece sem índice de inteligência registrado, então não há como compará-lo diretamente com o3, gpt-oss-120b ou outros pelo Artificial Analysis.

Quando o Thinking não compensa?

Quando a tarefa é descrição simples de imagem, OCR ou perguntas diretas sobre anexos — para isso o Instruct resolve por menos de um quarto do preço. Também não compensa se você precisa de mais de 131.072 tokens de contexto, limite do Thinking.

Leia também