Qwen3.5-9B batch custa US$ 0,25 por milhão de saída e mira volume
Versão batch do modelo de 9B parâmetros chega 67% mais barata que a edição padrão, mas sem índice de inteligência publicado
A Qwen soltou hoje duas versões do seu modelo de 9B parâmetros, e a história toda está no sufixo: batch. A edição padrão do Qwen3.5-9B cobra US$ 0,10 de entrada e US$ 0,15 de saída por milhão de tokens. A nova variante Qwen3.5-9B (batch) sobe para US$ 0,17 de entrada e US$ 0,25 de saída — ou seja, 67% mais cara por token que a versão não-batch. Em troca, você entrega o trabalho em lote e aceita latência de até 24 horas. É o oposto do que parece à primeira vista.
O que "batch" significa na prática
Pense no batch como o frete econômico dos Correios: você despacha um caminhão cheio de pacotes, não rastreia em tempo real, mas a tarifa por item despenca. Aqui acontece o contrário. A Qwen está dizendo: "se você não precisa da resposta agora, posso cobrar mais barato pelo processamento?" A resposta, neste caso, foi não — o preço por token sobe. O que muda é a janela: jobs batch entram numa fila, rodam quando há capacidade sobrando no cluster e voltam horas depois. Para quem faz resumo de milhares de documentos, classificação de logs ou geração massiva de dados sintéticos, isso é uma feature, não um bug.
Onde o Qwen3.5-9B se encaixa no tabuleiro
O catálogo hoje tem mais de 360 modelos listados, vindos de 53 criadores. No topo da régua de inteligência, o Google Gemini 3.1 Pro Preview lidera com IQ 47,7 e cobra US$ 12 por milhão de saída. O GPT-5.3-Codex vem logo atrás (IQ 45,5, US$ 14). O Claude Sonnet 4.6 fecha o pódio com IQ 35,1 e US$ 15. O Qwen3.5 397B A17B, da mesma família, marca IQ 34,3 a US$ 2,34 — já era a opção de "quase topo por uma fração do preço".
O novo Qwen3.5-9B (batch) entra muito abaixo disso tudo em preço: US$ 0,25 por milhão de saída é uma ordem de grandeza menor que qualquer modelo acima de IQ 45. A questão é que o catálogo não publicou índice de inteligência, benchmark de código nem score agentic para esta versão. Você está comprando barato no escuro.
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3.5-9b:batch |
| Criador | qwen |
| Preço de entrada | US$ 0.170 / M tokens |
| Preço de saída | US$ 0.250 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text+image+video->text |
Para quem isso vale — e para quem não muda nada
Serve para você se: roda pipelines assíncronos em grande volume, tem SLAs folgados e quer cada token de saída mais barato que o do modelo padrão da mesma família. Um job de madrugada que processa 50 milhões de tokens por noite e não tem pressa é o caso de uso típico.
Não muda nada se: você precisa de resposta em tempo real (chat, agente, tool-use síncrono) ou se o gargalo do seu sistema é a qualidade da resposta e não o custo. Para essas cargas, a versão padrão do Qwen3.5-9B continua sendo a escolha lógica — e mesmo assim, vale comparar com o MiMo-V2-Flash da Xiaomi, que marca IQ 34,0 a US$ 0,30 de saída.
A linha completa da Qwen hoje
A Qwen não soltou só esse modelo. No mesmo dia, a versão padrão do Qwen3.5-9B também entrou no catálogo, com a mesma janela de 262.144 tokens de contexto, multimodal (texto, imagem e vídeo como entrada, texto como saída), mas sem o rótulo batch e com o preço menor.
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Qwen3.5-9B | 0.1 | 0.15 | 262k |
É um movimento de catálogo, não de salto tecnológico: a família Qwen3.5 já tem o 397B A17B brigando na faixa intermediária do ranking de inteligência. O que aparece hoje é a ponta de entrada da mesma família, com a opção batch para quem quer otimizar custo em workloads que toleram espera.
O que você faz com isso amanhã
Se você já roda jobs batch em outro modelo pequeno, vale rodar um piloto com 100 mil tokens de saída e comparar qualidade percebida — porque o índice de inteligência não foi publicado. Se você nunca usou batch e está preocupado com latência, não comece por aqui: a versão padrão do Qwen3.5-9B é o caminho. E se a sua carga é síncrona e exige o melhor raciocínio por dólar, o Qwen3.5 397B A17B a US$ 2,34 segue sendo a referência da própria Qwen na faixa intermediária do mercado.
Use o Qwen3.5-9B batch em jobs assíncronos que toleram horas de espera e meça qualidade antes de migrar; para qualquer coisa síncrona, fique com a versão padrão ou suba para o 397B A17B.
Perguntas frequentes
Quanto custa o Qwen3.5-9B batch?
US$ 0,17 por milhão de tokens de entrada e US$ 0,25 por milhão de tokens de saída, com janela de contexto de 262.144 tokens. É mais caro por token que a versão padrão, mas aceita latência de até 24 horas em troca de processamento em fila.
Qual a diferença entre Qwen3.5-9B e Qwen3.5-9B batch?
A versão batch é processada em fila, com latência de até 24 horas, e custa US$ 0,25 de saída por milhão de tokens — 67% mais que a edição padrão (US$ 0,15). As duas compartilham a mesma arquitetura multimodal e a mesma janela de 262k tokens.
O Qwen3.5-9B batch tem benchmark de inteligência?
Não. O catálogo não publicou índice de inteligência, score de código nem avaliação agentic para esta versão. Você precisa rodar seu próprio piloto para saber se a qualidade serve para o seu caso de uso.