FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 VL 30B sai por US$ 0,60 sem nota de IQ publicada

Três dias depois do lançamento, o multimodal da Qwen já tem tabela de cobrança mas nenhum benchmark público no catálogo. Para um modelo de visão, isso muda como você decide.

Redação FalaVIP IA 3 min de leitura
US$ 0,15por milhão de tokens de entrada
US$ 0,60por milhão de tokens de saída
262.144 tokensde contexto (256K)

US$ 0,15 para entrar, US$ 0,60 para sair. Três dias depois do lançamento, essa é a única coisa sólida que dá para afirmar sobre o Qwen3 VL 30B A3B Instruct. O índice de IQ está vazio no catálogo. O benchmark de codificação, idem. O agentic, idem. Pela primeira vez em muito tempo, o preço chegou antes do boletim — e a conta saiu sem o placar.

Ficha técnica — Qwen3 VL 30B A3B Instruct
CampoValor
Identificadorqwen/qwen3-vl-30b-a3b-instruct
Criadorqwen
Preço de entradaUS$ 0.150 / M tokens
Preço de saídaUS$ 0.600 / M tokens
Janela de contexto262k
Modalidadetext+image->text

Você não está olhando para um caso isolado. Em outubro de 2025, o catálogo lista 26 modelos lançados nos últimos 30 dias. Entrar nesse fluxo sem benchmark é escolher entre esperar alguém testar ou pilotar por conta própria.

O que o preço diz (e o que ele esconde)

A conta é simples: US$ 0,15 por milhão de tokens na entrada, US$ 0,60 por milhão na saída. Não tem cache publicado — o catálogo simplesmente não trouxe esse número. Quem depende de cache de prompt para reduzir custo em chamadas repetidas fica no escuro até a Qwen divulgar (ou até alguém testar e contar).

Comparado com o que existe de medido hoje:

  • o3 (topo do ranking de IQ, 31,1): US$ 8,00 por milhão na saída — treze vezes mais caro.
  • gpt-oss-120b: US$ 0,17 por milhão na saída — mais barato, mas texto puro e pesos abertos.
  • Llama 4 Maverick: US$ 0,696 por milhão na saída — multimodal, preço parecido.
O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 250 modelos disponíveis no catálogo nesta data.

O par mais honesto é o Llama 4 Maverick. Os dois são multimodais, os dois saem na casa de US$ 0,60–0,70 por milhão. O Qwen entrega mais contexto (256K tokens); em troca, abre mão do índice de IQ publicado. Sem essa nota, vira duelo de fé — e você testa no seu workload antes de comprometer verba.

256K de contexto tem um motivo

262.144 tokens não é número gratuito. É a conta que a Qwen está fazendo: workflows com várias imagens simultâneas, vídeos longos analisados frame a frame, documentos visuais densos que não cabem em 32K ou 64K. Para bate-papo é exagero; para pipelines de visão com entrada pesada, é exatamente o que separa esse modelo das variantes menores da própria família.

A outra data que importa: knowledge cutoff em 31 de março de 2025. O modelo não sabe de nada dos últimos seis meses. Se o produto precisa de informação atualizada, isso é teto, não piso — e em outubro isso já significa perder um semestre de eventos.

O que ele faz, na prática

É text + image → text. Ele lê imagem e vídeo, escreve sobre eles. Não gera imagem, não gera vídeo. Onde isso compete de verdade:

  • OCR de documentos em escala.
  • Leitura de gráficos, diagramas e fluxogramas.
  • Screenshot-to-code em interfaces.
  • QA visual sobre mudanças de UI.
  • Análise de frames de vídeo dentro do orçamento de contexto.

Não compete contra o3 em raciocínio puro — o topo do ranking de IQ é dominado por modelos de texto, e nenhum multimodal entra nos cinco primeiros. Não substitui um GPT-4 ou Claude em conversa geral. Onde ele entra é no slot específico de "modelo de visão a preço médio": abaixo do o3, ao lado do Maverick, acima dos modelos pequenos demais para vídeos longos.

Para quem vale — e para quem não muda nada

Vale para times montando pipelines de visão que precisam de 256K para múltiplas imagens ou vídeo, não querem pagar a tabela do o3, e aceitam pilotar sem benchmark público para justificar a escolha interna.

Não muda nada se você precisa de cadeia de raciocínio pesada (o3 lidera com 31,1 de IQ e nenhum multimodal chega perto), se você precisa gerar imagem (este modelo só lê), ou se a informação precisa estar atualizada depois de março de 2025. Nesses casos, volta para os modelos de raciocínio ou para os generativos de imagem — e deixa o Qwen VL no lugar onde ele tem chance de ganhar: visão multimodal de entrada grande, preço médio, sem promessa que o catálogo ainda não confirmou.

Em uma frase

Se visão multimodal com entrada grande é o seu caso, o Qwen3 VL 30B entra como opção de preço médio em outubro de 2025 — mas como nenhum benchmark foi publicado ainda, a decisão precisa de teste próprio no seu workload antes de comprometer verba de produção.

Perguntas frequentes

O Qwen3 VL 30B tem benchmark de inteligência publicado?

Não. Em 9 de outubro de 2025, o índice de IQ, o benchmark de codificação e o agentic estão vazios no catálogo. Isso é comum em modelos recém-lançados, mas significa que você não tem nota pública para comparar com concorrentes multimodais como o Llama 4 Maverick.

Quanto custa chamar o Qwen3 VL 30B pela API?

US$ 0,15 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída. O preço de cache não foi divulgado pela Qwen no catálogo, então quem depende de cache de prompt precisa testar antes ou esperar uma publicação oficial.

Para que serve o Qwen3 VL 30B?

É um modelo de visão: lê imagem e vídeo e devolve texto. Serve para OCR em escala, leitura de gráficos e diagramas, screenshot-to-code, QA visual de UI e análise de frames de vídeo dentro do orçamento de 256K de contexto. Não gera imagem nem vídeo.

Leia também