FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Qwen3.7 Flash estreia a US$ 0,13 por milhão de tokens, mas sem nota de inteligência

Modelo multimodal da Alibaba chega com 1 milhão de contexto e preço de saída quase 10 vezes menor que a opção mais barata já medida no catálogo.

Redação FalaVIP IA 3 min de leitura
US$ 0,13por milhão de tokens de saída
US$ 0,03por milhão de tokens de entrada
1 milhãotokens de contexto

Um preço que muda a planilha

A Qwen, da Alibaba, colocou no catálogo hoje um modelo multimodal — aceita texto, imagem e vídeo, devolve texto — com janela de 1 milhão de tokens. O preço de saída: US$ 0,13 por milhão de tokens. O de entrada: US$ 0,03. O de cache, aquele que você paga quando reaproveita prefixo: US$ 0,006.

Preço de saída (US$ por milhão de tokens)
Qwen3.7 Flash0,13Claude Opus 525Claude Fable 550GPT-5.6 Sol10MiniMax M31,2GPT-5.6 Luna1,2US$/M
Fonte: OpenRouter

Esse valor não é "barato" em abstrato. É barato perto do que existe. O Claude Opus 5, que lidera o índice de inteligência do catálogo, cobra US$ 25 por milhão de tokens de saída. São 192 vezes mais. O GPT-5.6 Sol, da OpenAI, está em US$ 10. Até o modelo mais em conta entre os que têm IQ medido acima de 45, o MiniMax M3, sai por US$ 1,20 por milhão — quase dez vezes o Qwen3.7 Flash.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Qwen3.7 Flash (o novo)0.030.131M
Claude Opus 563.15251M
Claude Fable 562.110501M
GPT-5.6 Sol60.92101.05M
MiniMax M345.40.31.21.05M
GPT-5.6 Luna52.30.21.21.05M
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Para contextualizar: o catálogo lista hoje mais de 522 modelos ativos, vindos de 66 criadores diferentes. Esse número é um piso — modelos removidos depois não aparecem mais na contagem. Nos últimos 30 dias, 45 modelos foram lançados. A rotatividade é alta. O Qwen3.7 Flash entra nesse ritmo, mas com uma proposta de tarifa que pede atenção separada — multimodal com contexto de 1M por um valor que cabe em qualquer orçamento de protótipo.

O detalhe que ninguém pode preencher hoje

A pergunta óbvia: vale quanto em qualidade? E aqui está o problema. O Qwen3.7 Flash foi listado hoje. Não há nota de inteligência publicada — nem coding, nem agentic, nem blended. A descrição oficial destaca uso em agentes multimodais, codificação visual, busca e interação com computador, com força em reconhecimento de objeto, entendimento espacial e tarefas do mundo real. Mas "descrição oficial" não é benchmark.

Estrear sem nota virou rotina. Em 30 dias, 45 modelos entraram; nem todos recebem medição imediata. Você está olhando para um modelo que ainda não foi pesado na balança comum. Comprar assim é operar no escuro.

Para quem decide modelo olhando só o preço, o número de hoje é irresistível. Para quem olha preço E qualidade medida, o número vem com asterisco. Vale lembrar: o topo do índice de inteligência do catálogo segue com Anthropic (Opus 5 e Fable 5) e OpenAI (Sol e Terra). O Qwen3.7 Flash, por enquanto, está fora desse ranking — não por ser ruim, mas por ainda não ter sido testado nas mesmas condições.

Inteligência × preço de saída
Claude Opus 5Claude Fable 5GPT-5.6 SolMiniMax M3GPT-5.6 LunaUS$ por milhão (saída, escala log)índice de inteligência

Para quem muda a conta — e para quem não muda

Se você roda um agente que consome imagem e vídeo, a tarifa muda o break-even. Um pipeline que cospe 10 milhões de tokens de saída por mês gasta US$ 1,30 com Qwen3.7 Flash. Com Claude Opus 5, gasta US$ 250. Com GPT-5.6 Sol, US$ 100. A diferença não é ajuste fino — é outro projeto no papel.

A lógica do Flash é simples: multimodal barato para volume. Se sua operação precisa processar um vídeo, extrair entidades, devolver um JSON curto, o custo por chamada cai em uma ordem de grandeza. Se sua operação precisa do modelo pensando 30 segundos em um problema difícil, a equação é outra.

Mas se seu fluxo depende de raciocínio longo, código não-trivial ou tarefa agentic robusta, não dá pra trocar sem medir. O catálogo ainda não mediu nada disso para esse modelo. Preço baixo sem benchmark é promessa, não garantia. Você trocaria um modelo que você sabe que funciona por um que pode funcionar e custa menos, sem nem ter visto os números?

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Opus 563.125
Claude Fable 562.150
GPT-5.6 Sol60.910
Kimi K359.715
GPT-5.6 Terra56.612
Entre os 522 modelos disponíveis no catálogo nesta data.

O que fazer amanhã

Monte um teste A/B em paralelo. Compare saída por saída, mas meça onde a descrição oficial diz que o modelo brilha: reconhecimento de objeto, entendimento espacial, interação com interface. Se a taxa de erro ficar dentro do tolerável, a economia muda o chão do seu produto. Se passar do aceitável, você volta ao modelo anterior sabendo que testou — não que chutou.

Cobre o resultado do teste com uma esteira: latência, custo, taxa de alucinação. Os três números juntos decidem se o Qwen3.7 Flash entra em produção, fica em fallback ou some da fila. E quando a nota de inteligência do modelo entrar no índice geral do catálogo, vale revisitar a posição com o benchmark na mão. Até lá, a regra é: barateia o que dá pra baratear, mede o que não dá.

Em uma frase

Se multimodal é gargalo de custo no seu produto, vale rodar A/B com o Qwen3.7 Flash em paralelo; sem benchmark publicado, a decisão ainda é teste, não troca cega.

Perguntas frequentes

O Qwen3.7 Flash substitui o Claude Opus 5?

Não. São produtos em faixas de preço e de qualidade muito diferentes. O Opus 5 lidera o índice de inteligência do catálogo; o Qwen3.7 Flash ainda não foi medido. A comparação direta só faz sentido quando o benchmark do Flash for publicado.

Por que o Qwen3.7 Flash é tão mais barato que os concorrentes?

A Qwen tem precificado historicamente abaixo da média nos modelos da linha Flash, mirando volume e custo por chamada. O preço de US$ 0,13 por milhão de tokens de saída é coerente com essa estratégia de ocupar a base do mercado, não o topo do ranking.

Quando sai a nota de inteligência do Qwen3.7 Flash?

O catálogo costuma publicar benchmarks de modelos novos nas semanas seguintes ao lançamento, mas não há data confirmada para este modelo especificamente. Até lá, a única forma de medir valor real é testar em produção.

Leia também