FalaVIP IA quinta-feira, 03 de setembro de 2026
Preços

GLM 5.3 Flash cai a US$ 0,25, mas Qwen não exibe tarifa

O GLM 5.3 Flash combina janela de contexto de 1.310.720 tokens com preço de entrada de US$ 0,075 por milhão. Já o Qwen3.8-Flash-Next aparece bem avaliado no Artificial Analysis, mas sem tarifa operacional correspondente no OpenRouter.

Redação FalaVIP IA 4 min de leitura
US$ 0,075por milhão de tokens de entrada do GLM 5.3 Flash
US$ 0,25por milhão de tokens de saída do GLM 5.3 Flash
1.310.720tokens na janela de contexto do GLM 5.3 Flash

O número que importa para quem paga API é este: o GLM 5.3 Flash cobra US$ 0,075 por milhão de tokens de entrada e US$ 0,25 por milhão de tokens de saída no OpenRouter. A janela de contexto chega a 1.310.720 tokens. O modelo entrega uma combinação rara de preço baixo e contexto longo, mas o anúncio sobre o Qwen3.8-Flash-Next esbarra em um problema prático: o Artificial Analysis registra preço de US$ 0,23 por milhão, enquanto o OpenRouter não apresenta uma ficha operacional correspondente nos dados disponíveis.

O que realmente estreou

O GLM 5.3 Flash aparece na ficha do OpenRouter com 320 bilhões de parâmetros, 18 bilhões ativos e pesos abertos. O índice do Artificial Analysis atribui ao modelo nota de inteligência de 57,5, além de notas de 71,535 em código e 58,156 em tarefas agênticas.

Essa posição o coloca abaixo do GLM 5.3, que marca 59,5 de inteligência e custa US$ 1,40 por milhão de tokens de entrada e US$ 4,40 por milhão de tokens de saída. A troca é clara: você abre mão de parte da pontuação e reduz muito o custo de cada chamada.

O Qwen3.8-Flash-Next estreia com nota de inteligência de 55,8. No ranking de melhor custo-benefício do Artificial Analysis, aparece com preço de US$ 0,23 por milhão de tokens. Mas essa cifra não pode ser tratada automaticamente como a tarifa completa de uma API: não há preço separado de entrada e saída nem janela de contexto do modelo nos dados do OpenRouter.

A pauta foi impulsionada por vídeos de Paula Bernardes (Qwen3.8-Flash-Next e GLM 5.3 Flash), além de Inteligência Mil Grau e Vini — AI Coders Academy. O ponto que muda a decisão, porém, está na diferença entre uma nota de custo-benefício e uma tarifa pronta para produção.

Contexto longo sem preço de modelo grande

O GLM 5.3 Flash tem uma janela maior que a do GPT-5.3 Chat, limitada a 128.000 tokens, e também supera a janela de 1.000.000 tokens do Qwen3.8 Flash listado no OpenRouter. O Qwen3.8 Flash cobra US$ 0,15 por milhão de tokens de entrada, US$ 0,47 por milhão de tokens de saída e US$ 0,016 por milhão de tokens em cache.

A comparação mostra por que o contexto longo não basta para estimar a fatura. O preço de saída do Qwen3.8 Flash é quase o dobro do GLM 5.3 Flash, enquanto o valor de entrada é o dobro. Se sua aplicação reenvia documentos extensos ou mantém histórico em cache, cada componente pode pesar de forma diferente.

O Qwen3.8 2.4T A95B oferece janela de 1.048.576 tokens, mas custa US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída. É outra categoria de produto: mais cara, voltada a quem precisa de capacidade máxima, não à redução agressiva do custo por chamada.

A nota alta não transforma o modelo em líder absoluto

O GLM 5.3 Flash marca 57,5 no Artificial Analysis. O Qwen3.8-Flash-Next fica em 55,8. Os dois aparecem abaixo do Qwen3.8 Max, com 58,1, e do GLM 5.3, com 59,5. No topo do índice, o Claude Opus 5 chega a 63,1, mas custa US$ 10 por milhão de tokens.

A leitura correta é menos cinematográfica e mais útil: os modelos chineses estão comprimindo o custo para uma faixa de centavos sem abandonar pontuações competitivas. Isso não prova superioridade geral sobre modelos americanos, nem garante que o desempenho em código, uso de ferramentas, visão ou atendimento coincida com a nota agregada de inteligência.

Também há instabilidade de preços no próprio catálogo. No mesmo dia, o Qwen3.5-35B-A3B aparece tanto com alta de US$ 1,25 para US$ 1,80 quanto com queda de US$ 1,80 para US$ 1,25. O Tencent Hy3 também registra movimentos em direções opostas, de US$ 0,33 para US$ 0,528 e de US$ 0,528 para US$ 0,33. A fatura depende da tarifa vigente e do identificador exato escolhido.

Para quem vale

Se você processa grandes volumes de texto, precisa de histórico extenso ou usa agentes que geram muitas respostas, o GLM 5.3 Flash merece um teste imediato. O custo de saída de US$ 0,25 por milhão de tokens é o dado mais relevante para fluxos que produzem relatórios, código ou múltiplas etapas.

O modelo também interessa a equipes que querem pesos abertos e uma alternativa de contexto longo. Ainda assim, pesos abertos não eliminam o custo de hospedagem quando você roda a infraestrutura por conta própria, e os dados não informam velocidade ou desempenho operacional do Qwen3.8-Flash-Next.

Para quem precisa de uma tarifa transparente do Qwen, a estreia ainda não muda a decisão: o número do Artificial Analysis precisa ser confirmado na rota de API antes de entrar no orçamento. Para cargas pequenas, sem contexto longo ou com poucas respostas, a diferença pode não compensar uma migração e o modelo atual pode continuar sendo a escolha mais simples.

Na prática, coloque o GLM 5.3 Flash em um teste controlado, meça tokens de saída e compare a qualidade com seu tráfego real; trate os US$ 0,23 do Qwen3.8-Flash-Next como referência de benchmark, não como promessa de fatura.

Em uma frase

O GLM 5.3 Flash já oferece uma tarifa operacional agressiva para produção, enquanto o Qwen3.8-Flash-Next só deve entrar no orçamento depois que sua tarifa de API for confirmada.

Perguntas frequentes

Quanto custa o GLM 5.3 Flash na API?

No OpenRouter, o GLM 5.3 Flash custa US$ 0,075 por milhão de tokens de entrada e US$ 0,25 por milhão de tokens de saída. A janela de contexto é de 1.310.720 tokens.

O Qwen3.8-Flash-Next é mais barato que o GLM 5.3 Flash?

O Artificial Analysis lista o Qwen3.8-Flash-Next a US$ 0,23 por milhão de tokens no ranking de custo-benefício, contra US$ 0,238 do GLM 5.3 Flash. Como o OpenRouter não informa uma tarifa separada de entrada e saída para o Qwen3.8-Flash-Next, não é possível comparar a fatura diretamente.

Qual modelo tem melhor desempenho, GLM 5.3 Flash ou Qwen3.8-Flash-Next?

No Artificial Analysis, o GLM 5.3 Flash marca 57,5 de inteligência, enquanto o Qwen3.8-Flash-Next marca 55,8. Essa diferença não determina qual será melhor em um fluxo específico de código, agentes ou atendimento.

Fontes

Leia também