FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3.5-Flash custa US$ 0,26 por milhão de saída — e não tem nota de inteligência

Lançado há oito dias, o modelo barato da Qwen chega sem benchmark público de IQ e precisa ser avaliado por eliminação, não por propaganda.

Redação FalaVIP IA 3 min de leitura
US$ 0,26por milhão de tokens de saída
US$ 0,065por milhão de tokens de entrada
1.000.000tokens de contexto

O que está em jogo quando o preço é esse

A conta da API não mente. O Qwen3.5-Flash cobra US$ 0,065 por milhão de tokens de entrada e US$ 0,26 por milhão de tokens de saída. Para visualizar: dá para processar o equivalente a uma novela de 300 páginas pagando menos de um centavo de dólar, e gerar uma resposta do tamanho de uma página por algo em torno de US$ 0,0003. Em workloads de classificação, extração, sumarização em massa e geração de rascunhos, esse patamar muda a economia de produtos inteiros.

O problema é que preço baixo sem nota de inteligência é uma promessa em branco. O catálogo registra IQ, raciocínio, coding e agentic para o modelo como nulos — ou seja, o próprio agregador não tem medição pública para comparar com o restante do mercado. Você não está comprando um modelo testado; está comprando um modelo barato e apostando que ele entrega.

Ficha técnica — Qwen3.5-Flash
CampoValor
Identificadorqwen/qwen3.5-flash-02-23
Criadorqwen
Preço de entradaUS$ 0.065 / M tokens
Preço de saídaUS$ 0.260 / M tokens
Janela de contexto1M
Modalidadetext+image+video->text

O tabuleiro em 5 de março de 2026

Para situar o Qwen3.5-Flash, vale olhar quem está no topo do catálogo hoje. O ranking de inteligência tem o Gemini 3.1 Pro Preview da Google na frente, com IQ 47,7 e saída a US$ 12 por milhão. Logo abaixo, o GPT-5.3-Codex da OpenAI marca IQ 45,5 a US$ 14. O Claude Sonnet 4.6 da Anthropic vem em terceiro, com IQ 35,1 a US$ 15. Aí aparece a primeira surpresa chinesa: o Qwen3.5 397B A17B, da própria Qwen, com IQ 34,2 cobrando US$ 2,34 por milhão de saída — quase seis vezes mais barato que o Sonnet para um patamar de inteligência próximo.

E logo atrás dele, a US$ 0,30 por milhão de saída, está o Xiaomi MiMo-V2-Flash, com IQ 34,0. É o concorrente direto do Qwen3.5-Flash: preço parecido, capacidade parecida, marca diferente. A diferença entre os dois? O MiMo-V2-Flash tem nota de inteligência medida; o Qwen3.5-Flash, não.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
MiMo-V2-Flash34.00.3
Entre os 357 modelos disponíveis no catálogo nesta data.

O que o release diz — e o que ele não diz

A descrição oficial fala de uma arquitetura híbrida que combina atenção linear com mixture-of-experts esparso, prometendo maior eficiência de inferência. É o tipo de frase que soa bem em uma apresentação e não te diz nada sobre o que esperar em produção. "Maior eficiência" comparada a quê? Em qual workload? Para qual tipo de prompt?

O que o dado entrega de concreto: contexto de 1 milhão de tokens, modalidade texto+imagem+vídeo como entrada e texto como saída, e um preço de saída que é menos de 1/45 do Gemini 3.1 Pro Preview. O catálogo tem hoje 357 modelos listados de 53 criadores, e 30 deles foram lançados nos últimos 30 dias — ou seja, você está olhando para um modelo em um mercado que não para de se mover.

Para quem vale — e para quem não muda nada

Vale a pena testar o Qwen3.5-Flash se você roda volume grande de tarefas simples ou médias: classificação de tickets, extração de campos, sumarização de logs, geração de JSON estruturado a partir de texto bruto, primeiro rascunho de e-mails ou descrições de produto. Nesses casos, a economia por token se traduz em economia real na fatura, e uma possível queda de qualidade é absorvida pelo processo.

Não vale se o seu caso depende de raciocínio encadeado, código complexo, planejamento multi-etapa ou fidelidade a instruções longas e ambíguas. Para isso, o caminho continua sendo o topo da tabela — e o topo custa de 46 a 58 vezes mais por milhão de tokens de saída. A conta é sua.

O que fazer agora

Antes de migrar qualquer workload de produção, rode um conjunto de 200 a 500 prompts reais do seu produto contra o Qwen3.5-Flash e contra o MiMo-V2-Flash, lado a lado. Meça taxa de aceitação humana, taxa de retrabalho e custo total por tarefa concluída. Se o Flash entregar taxa de retrabalho aceitável para o seu caso, a economia aparece no fim do mês. Se não entregar, você descobriu isso antes de colocar na fatura.

Em uma frase

Para tarefas de alto volume e baixa complexidade, o Qwen3.5-Flash é uma aposta barata que vale testar com prompts reais antes de migrar produção; para raciocínio e código, o topo da tabela continua custando 50 vezes mais e entregando mais.

Perguntas frequentes

Quanto custa o Qwen3.5-Flash na API?

US$ 0,065 por milhão de tokens de entrada e US$ 0,26 por milhão de tokens de saída, com janela de contexto de 1 milhão de tokens. O catálogo não publicou preço de cache para este modelo.

O Qwen3.5-Flash tem benchmark de inteligência?

Não. O catálogo registra IQ, raciocínio, coding e agentic como nulos para este modelo, então não há nota pública para comparar diretamente com Gemini 3.1 Pro Preview, GPT-5.3-Codex ou Claude Sonnet 4.6.

Qual a diferença entre o Qwen3.5-Flash e o Xiaomi MiMo-V2-Flash?

Os dois ficam na faixa dos US$ 0,26 a US$ 0,30 por milhão de tokens de saída, mas o MiMo-V2-Flash tem IQ 34,0 medido no catálogo, enquanto o Qwen3.5-Flash ainda não tem nota pública.

Leia também