FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3.5-27B custa 1,56 dólar por milhão de saída e não tem nota de IQ

Modelo denso de 27B com visão e contexto de 262k chega barato, mas sem benchmark publicado — vale para quem roda alto volume e dispensa o topo do ranking.

Redação FalaVIP IA 3 min de leitura
US$ 1,56por milhão de tokens de saída
US$ 0,195por milhão de tokens de entrada
262.144tokens de contexto

O que está em jogo aqui

Você está olhando para um modelo de 27B parâmetros, multimodal (texto, imagem e vídeo entram; só texto sai), contexto de 262.144 tokens, e o catálogo não publicou nota de IQ, coding, agentic nem blended. Em outras palavras: a Qwen entregou o hardware, mas não entregou a planilha de testes. E é exatamente isso que separa esse lançamento dos cinco que aparecem no topo do mercado hoje.

Para situar o tabuleiro: o ranking atual tem Gemini 3.1 Pro Preview da Google no primeiro lugar (IQ 47,7, a US$ 12 por milhão de saída), seguido por GPT-5.3-Codex da OpenAI (IQ 45,5, a US$ 14), Claude Sonnet 4.6 da Anthropic (IQ 35,1, a US$ 15), o Qwen3.5 397B A17B da própria Qwen (IQ 34,2, a US$ 2,34) e o MiMo-V2-Flash da Xiaomi (IQ 34,0, a US$ 0,30). O Qwen3.5-27B que você está avaliando sai por US$ 1,56 — está mais barato que o irmão maior 397B e muito mais barato que qualquer modelo acima do IQ 45.

Ficha técnica — Qwen3.5-27B
CampoValor
Identificadorqwen/qwen3.5-27b
Criadorqwen
Preço de entradaUS$ 0.195 / M tokens
Preço de saídaUS$ 1.56 / M tokens
Janela de contexto262k
Modalidadetext+image+video->text

O que o preço está te dizendo

A conta é simples: para cada milhão de tokens que entram no prompt, você paga cerca de 19 centavos de dólar. Para cada milhão que saem na resposta, US$ 1,56. Traduzindo o marketing: se você está processando 10 milhões de tokens de saída por mês nesse modelo, a fatura fica em torno de US$ 15,60 — menos do que o custo de uma única requisição pesada em um Sonnet 4.6. O "45% mais barato" que costuma aparecer em release aqui se materializa quando você compara contra o Claude Sonnet 4.6 na mesma régua de saída.

A pegadinha está no que não mudou: o preço de cache não foi publicado, então qualquer otimização com prompt caching fica no escuro até você testar. E como não há benchmark de inteligência publicado, a pergunta "ele é bom o suficiente?" não tem resposta oficial — você descobre rodando.

Atenção linear: o que muda na prática

A descrição oficial diz que o modelo usa um mecanismo de atenção linear. Pense na atenção tradicional como um fiscal que confere cada item da fila de documentos um por um antes de liberar a resposta; a atenção linear é como um fiscal que olha o padrão geral da fila e segue em frente. Resultado: resposta mais rápida em contextos longos, com menos memória ocupada por token. Para quem processa documentos de 100k tokens ou analisa vídeos longos, isso importa direto na latência e no custo de infraestrutura — não só no preço da API.

Para quem vale e para quem não muda nada

Vale para você se: roda volume alto de tarefas multimodais (imagem e vídeo virando texto), precisa de contexto longo e quer pagar pouco por token de saída, e está disposto a montar seu próprio teste de qualidade antes de colocar em produção. O caso clássico é sumarização de vídeo, extração de dados de PDFs grandes, ou qualquer pipeline onde a velocidade de resposta pesa mais que a nota máxima em benchmark.

Não muda nada se: você precisa do topo absoluto de raciocínio e coding (Gemini 3.1 Pro Preview e GPT-5.3-Codex estão lá por algum motivo), se o seu caso de uso cabe no MiMo-V2-Flash da Xiaomi a US$ 0,30 por milhão de saída, ou se você quer comparar IQ contra IQ — esse modelo simplesmente não entra nessa conversa hoje.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
MiMo-V2-Flash34.00.3
Entre os 357 modelos disponíveis no catálogo nesta data.

O que você faz com isso amanhã

Se você está pagando caro em API para tarefas multimodais de alto volume, vale rodar um piloto de uma semana no Qwen3.5-27B: meça latência, qualidade percebida e fatura real. Se a qualidade aguentar o seu padrão, a economia pode ser de mais de 80% contra Sonnet 4.6 no mesmo workload de saída. Se não aguentar, você ainda tem o MiMo-V2-Flash como segunda opção barata antes de subir para o topo do ranking. E fica de olho: 27 modelos foram lançados nos últimos 30 dias no catálogo — esse é só um deles, e o próximo pode vir com benchmark publicado.

Em uma frase

Rode um piloto de uma semana no Qwen3.5-27B se você tem workload multimodal de alto volume; sem nota de IQ publicada, a única forma de saber se vale é medir latência, qualidade e fatura no seu caso real.

Perguntas frequentes

Quanto custa o Qwen3.5-27B por milhão de tokens?

US$ 0,195 por milhão de tokens de entrada e US$ 1,56 por milhão de tokens de saída. O preço de cache não foi publicado pelo catálogo, então otimizações com prompt caching precisam ser testadas empiricamente.

O Qwen3.5-27B tem benchmark de inteligência publicado?

Não. O catálogo não trouxe nota de IQ, coding, agentic nem blended para esse modelo. Isso significa que você não tem como compará-lo diretamente com Gemini 3.1 Pro Preview, GPT-5.3-Codex ou Claude Sonnet 4.6 no ranking atual.

Para que tipo de tarefa o Qwen3.5-27B faz sentido?

Workloads multimodais de alto volume (imagem e vídeo virando texto), contextos longos de até 262k tokens e pipelines onde latência e custo pesam mais que nota máxima em benchmark. Não é o modelo certo se você precisa do topo em raciocínio ou coding.

Leia também