Qwen3.5-Flash cobra US$ 0,26 por milhão de saída: vale para o quê?
Modelo lançado há 8 dias pela Qwen chega barato, multimodal e com 1M de contexto — mas sem nota de inteligência publicada e sem rival direto no recorte.
Anunciou barato, cobrou barato. O Qwen3.5-Flash entrou no catálogo em 25 de fevereiro de 2026 cobrando US$ 0,065 por milhão de tokens de entrada e US$ 0,26 por milhão de saída. Em uma conta simples, uma rodada de geração que cuspir 10 milhões de tokens custa US$ 2,60 — menos do que um lanche. A pergunta que interessa não é se o preço é baixo; é se ele é baixo com alguma coisa em troca.
O que o Flash traz de diferente
O modelo é multimodal de verdade: aceita texto, imagem e vídeo, e devolve texto. O contexto de 1 milhão de tokens é o mesmo piso que a Qwen já vinha oferecendo na família 3.5, e é o que coloca o Flash no mesmo clube do Gemini 3.1 Pro Preview e do GPT-5.3-Codex — não por capacidade, mas por capacidade de caber um repositório inteiro numa única chamada.
A descrição oficial destaca a arquitetura híbrida: atenção linear combinada com mixture-of-experts esparso, vendida como ganho de eficiência de inferência. Traduzindo: a Qwen está dizendo que o modelo usa menos computação ativa por token do que um denso puro usaria. Para quem paga a API, isso importa menos do que parece — você não está rodando o modelo no seu datacenter —, mas importa para a Qwen, que pode cobrar pouco sem sangrar margem.
O problema: não tem nota
Aqui está o ponto que o release não coloca em destaque. O catálogo não publicou índice de inteligência, coding, agentic, blended, raciocínio nem velocidade para o Qwen3.5-Flash. Todos esses campos vieram vazios. Em um mercado em que o Gemini 3.1 Pro Preview marca 47,7 e o GPT-5.3-Codex marca 45,5 no topo da régua atual, um modelo sem nota pública é um modelo em que você está apostando no escuro.
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3.5-flash-02-23 |
| Criador | qwen |
| Preço de entrada | US$ 0.065 / M tokens |
| Preço de saída | US$ 0.260 / M tokens |
| Janela de contexto | 1M |
| Modalidade | text+image+video->text |
Onde ele se encaixa no tabuleiro
Olhe para o topo do catálogo nesta data. O Gemini 3.1 Pro Preview cobra US$ 12 por milhão de saída — quase 46 vezes mais que o Flash. O GPT-5.3-Codex cobra US$ 14. O Claude Sonnet 4.6 cobra US$ 15. O Qwen3.5 397B A17B, da própria Qwen, cobra US$ 2,34. O Xiaomi MiMo-V2-Flash cobra US$ 0,30 — um centavo mais caro que o Flash por milhão de saída, em um patamar parecido.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
| MiMo-V2-Flash | 34.0 | 0.3 |
A leitura fria: o Qwen3.5-Flash é o modelo multimodal de 1M de contexto mais barato do catálogo hoje. Se você precisa só de texto e quer ainda mais barato, o caminho provavelmente passa por outro Flash de outro criador — mas o Flash da Qwen entra com a vantagem da multimodalidade nativa e do contexto gigante.
Para quem vale
Vale para três perfis. Primeiro, quem está fazendo ingestão de documentos longos com imagens e vídeo embutidos e precisa classificar, resumir ou extrair estrutura — trabalho em que o modelo só precisa ser decente, não brilhante, e o volume de tokens torna cada centavo por milhão relevante. Segundo, quem está prototipando um pipeline multimodal e não quer queimar orçamento antes de validar a ideia. Terceiro, quem opera em jurisdições onde fornecedores chineses são uma opção viável e quer manter o custo variável baixo.
Para quem não muda nada
Não muda nada para quem está rodando o GPT-5.3-Codex ou o Claude Sonnet 4.6 em produção com qualidade validada. A diferença de preço é tentadora, mas sem benchmark público, migrar é trocar o conhecido pelo incerto — e o custo de uma migração ruim costuma ser maior que a economia de vários meses de API. Também não muda nada para quem precisa de raciocínio forte: a régua atual de inteligência tem o Flash da Xiaomi a 34,0 e o Qwen3.5 397B a 34,3, e o Flash sem nota pública tende a ficar abaixo do irmão maior, não acima. Se você está pagando caro por capacidade de raciocínio, o Flash não é o atalho.
O que fazer agora
Trate o Qwen3.5-Flash como uma ferramenta de volume multimodal, não como substituto do seu modelo principal. Monte um teste cego em cima de um lote real do seu trabalho — documentos longos, vídeos curtos, imagens com texto — e meça taxa de acerto e custo total por tarefa concluída. Se a taxa ficar dentro do aceitável, você acabou de encontrar um novo andar no seu prédio de custos. Se ficar abaixo, o Flash continua sendo uma peça de borda, útil em rascunhos e pré-processamento, e nada mais.
Use o Qwen3.5-Flash para multimodal de alto volume e contexto longo quando o orçamento pesa mais que a nota de inteligência; não migre produção crítica sem teste cego.
Perguntas frequentes
O Qwen3.5-Flash é de graça?
Não. O modelo é pago. Custa US$ 0,065 por milhão de tokens de entrada e US$ 0,26 por milhão de tokens de saída. O catálogo não lista preço de cache nem sinaliza versão gratuita.
Quanto custa gerar 10 milhões de tokens no Qwen3.5-Flash?
Pelos preços publicados, 10 milhões de tokens de saída custam US$ 2,60. Some a entrada na mesma proporção e a conta fica na casa de poucos dólares por milhão de tokens processados.
O Qwen3.5-Flash tem benchmark de inteligência?
Não no catálogo. Os campos de IQ, coding, agentic, raciocínio e velocidade vieram sem valor publicado, então qualquer comparação com Gemini 3.1 Pro Preview ou GPT-5.3-Codex passa por teste próprio, não por régua pública.