Qwen3 VL 30B sai por US$ 0,60 sem nota de IQ publicada
Três dias depois do lançamento, o multimodal da Qwen já tem tabela de cobrança mas nenhum benchmark público no catálogo. Para um modelo de visão, isso muda como você decide.
US$ 0,15 para entrar, US$ 0,60 para sair. Três dias depois do lançamento, essa é a única coisa sólida que dá para afirmar sobre o Qwen3 VL 30B A3B Instruct. O índice de IQ está vazio no catálogo. O benchmark de codificação, idem. O agentic, idem. Pela primeira vez em muito tempo, o preço chegou antes do boletim — e a conta saiu sem o placar.
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3-vl-30b-a3b-instruct |
| Criador | qwen |
| Preço de entrada | US$ 0.150 / M tokens |
| Preço de saída | US$ 0.600 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text+image->text |
Você não está olhando para um caso isolado. Em outubro de 2025, o catálogo lista 26 modelos lançados nos últimos 30 dias. Entrar nesse fluxo sem benchmark é escolher entre esperar alguém testar ou pilotar por conta própria.
O que o preço diz (e o que ele esconde)
A conta é simples: US$ 0,15 por milhão de tokens na entrada, US$ 0,60 por milhão na saída. Não tem cache publicado — o catálogo simplesmente não trouxe esse número. Quem depende de cache de prompt para reduzir custo em chamadas repetidas fica no escuro até a Qwen divulgar (ou até alguém testar e contar).
Comparado com o que existe de medido hoje:
- o3 (topo do ranking de IQ, 31,1): US$ 8,00 por milhão na saída — treze vezes mais caro.
- gpt-oss-120b: US$ 0,17 por milhão na saída — mais barato, mas texto puro e pesos abertos.
- Llama 4 Maverick: US$ 0,696 por milhão na saída — multimodal, preço parecido.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
O par mais honesto é o Llama 4 Maverick. Os dois são multimodais, os dois saem na casa de US$ 0,60–0,70 por milhão. O Qwen entrega mais contexto (256K tokens); em troca, abre mão do índice de IQ publicado. Sem essa nota, vira duelo de fé — e você testa no seu workload antes de comprometer verba.
256K de contexto tem um motivo
262.144 tokens não é número gratuito. É a conta que a Qwen está fazendo: workflows com várias imagens simultâneas, vídeos longos analisados frame a frame, documentos visuais densos que não cabem em 32K ou 64K. Para bate-papo é exagero; para pipelines de visão com entrada pesada, é exatamente o que separa esse modelo das variantes menores da própria família.
A outra data que importa: knowledge cutoff em 31 de março de 2025. O modelo não sabe de nada dos últimos seis meses. Se o produto precisa de informação atualizada, isso é teto, não piso — e em outubro isso já significa perder um semestre de eventos.
O que ele faz, na prática
É text + image → text. Ele lê imagem e vídeo, escreve sobre eles. Não gera imagem, não gera vídeo. Onde isso compete de verdade:
- OCR de documentos em escala.
- Leitura de gráficos, diagramas e fluxogramas.
- Screenshot-to-code em interfaces.
- QA visual sobre mudanças de UI.
- Análise de frames de vídeo dentro do orçamento de contexto.
Não compete contra o3 em raciocínio puro — o topo do ranking de IQ é dominado por modelos de texto, e nenhum multimodal entra nos cinco primeiros. Não substitui um GPT-4 ou Claude em conversa geral. Onde ele entra é no slot específico de "modelo de visão a preço médio": abaixo do o3, ao lado do Maverick, acima dos modelos pequenos demais para vídeos longos.
Para quem vale — e para quem não muda nada
Vale para times montando pipelines de visão que precisam de 256K para múltiplas imagens ou vídeo, não querem pagar a tabela do o3, e aceitam pilotar sem benchmark público para justificar a escolha interna.
Não muda nada se você precisa de cadeia de raciocínio pesada (o3 lidera com 31,1 de IQ e nenhum multimodal chega perto), se você precisa gerar imagem (este modelo só lê), ou se a informação precisa estar atualizada depois de março de 2025. Nesses casos, volta para os modelos de raciocínio ou para os generativos de imagem — e deixa o Qwen VL no lugar onde ele tem chance de ganhar: visão multimodal de entrada grande, preço médio, sem promessa que o catálogo ainda não confirmou.
Se visão multimodal com entrada grande é o seu caso, o Qwen3 VL 30B entra como opção de preço médio em outubro de 2025 — mas como nenhum benchmark foi publicado ainda, a decisão precisa de teste próprio no seu workload antes de comprometer verba de produção.
Perguntas frequentes
O Qwen3 VL 30B tem benchmark de inteligência publicado?
Não. Em 9 de outubro de 2025, o índice de IQ, o benchmark de codificação e o agentic estão vazios no catálogo. Isso é comum em modelos recém-lançados, mas significa que você não tem nota pública para comparar com concorrentes multimodais como o Llama 4 Maverick.
Quanto custa chamar o Qwen3 VL 30B pela API?
US$ 0,15 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída. O preço de cache não foi divulgado pela Qwen no catálogo, então quem depende de cache de prompt precisa testar antes ou esperar uma publicação oficial.
Para que serve o Qwen3 VL 30B?
É um modelo de visão: lê imagem e vídeo e devolve texto. Serve para OCR em escala, leitura de gráficos e diagramas, screenshot-to-code, QA visual de UI e análise de frames de vídeo dentro do orçamento de 256K de contexto. Não gera imagem nem vídeo.