11 quedas de preço, mas quatro APIs ficaram mais caras
Z.ai, DeepSeek e Qwen reduziram tarifas no OpenRouter em 15 mudanças registradas em 15 de agosto. A conta, porém, também inclui aumentos e reajustes sucessivos no mesmo modelo.
A conta de inferência ficou menor em 11 das 15 mudanças de preço registradas no OpenRouter em 15 de agosto de 2026. Mas quatro reajustes foram para cima — incluindo 185,7% no Tencent Hy3 preview — e alguns modelos aparecem com mais de uma alteração no mesmo dia.
Para quem usa APIs em produção, a notícia é boa, mas não é uma queda uniforme do mercado. Z.ai, DeepSeek e Qwen cortaram preços relevantes em modelos usados para raciocínio e tarefas gerais. Ao mesmo tempo, a fatura depende do identificador exato escolhido e da sequência de reajustes aplicada a ele.
DeepSeek concentra os cortes mais agressivos
O DeepSeek V4 Flash 0423 aparece duas vezes na lista de mudanças. Primeiro, o preço caiu de US$ 0,28 para US$ 0,154 por milhão de tokens. Depois, foi de US$ 0,154 para US$ 0,129, uma redução adicional de 16,4%.
Na prática, o valor listado terminou 53,9% abaixo do primeiro preço registrado para esse modelo. A versão identificada como DeepSeek V4 Flash Latest também teve dois cortes: de US$ 0,16 para US$ 0,157 e, depois, para US$ 0,135.
Isso favorece aplicações com grande volume de chamadas, como classificação, extração, atendimento automatizado e etapas intermediárias de agentes. Não significa, por si só, que o modelo ficou mais rápido, mais inteligente ou mais confiável: não houve estreia de benchmark no período.
O Artificial Analysis lista uma variante diferente, a DeepSeek V4 Flash 0731 com raciocínio e esforço máximo, entre as opções de melhor custo-benefício, com índice de inteligência de 51,8 e preço de US$ 0,66 por milhão. Esse dado não deve ser confundido com o preço do V4 Flash 0423 ou do Latest no OpenRouter.
Z.ai reduz GLM, mas também eleva um modelo
O GLM 5.2 teve o maior corte nominal entre os modelos da Z.ai: de US$ 3,74 para US$ 1,54 por milhão de tokens, seguido por uma nova redução para US$ 1,452. O GLM 5.1 caiu de US$ 4,40 para US$ 3,036, enquanto o GLM 5 passou de US$ 2,55 para US$ 1,92.
A direção não foi igual para toda a família. O GLM 4.6 subiu de US$ 2 para US$ 2,20. A ficha desse modelo no OpenRouter informa US$ 0,55 por milhão na entrada, US$ 2,20 na saída, cache a US$ 0,11 e janela de contexto de 204.800 tokens.
Essa diferença é importante para quem está comparando fornecedores por nome de família. Se você usa o GLM 5.2, o reajuste reduz o custo listado. Se usa o GLM 4.6, não há economia a comemorar nesse movimento específico.
Qwen corta 35% em duas opções
Os dois modelos Qwen incluídos nas mudanças tiveram redução de 35%. O Qwen Plus 0728 com thinking passou de US$ 1,20 para US$ 0,78 por milhão, enquanto o Qwen3.5 397B A17B caiu de US$ 3,60 para US$ 2,34.
Para equipes que mantêm uma camada de roteamento, esses cortes ampliam o espaço para direcionar tarefas de menor margem a modelos mais baratos. O ganho aparece principalmente quando o volume de tokens é alto e quando a aplicação não precisa enviar todas as solicitações para um modelo premium.
Ainda assim, o preço não mede sozinho a economia. Uma resposta mais longa, mais tentativas de raciocínio ou um fluxo agêntico com várias chamadas pode consumir mais tokens e neutralizar parte do corte. Os dados do dia não trazem novas notas de código, inteligência ou desempenho agêntico para esses modelos.
A queda geral tem exceções relevantes
O MoonshotAI Kimi K2.6 expõe a maior ambiguidade da lista. Ele aparece primeiro subindo de US$ 2,36 para US$ 3,41, alta de 44,5%, e depois caindo de US$ 3,41 para US$ 2,28, redução de 33,1%.
Se os registros forem lidos em sequência, o preço final fica abaixo do valor inicial. Portanto, chamar o movimento simplesmente de corte esconde uma alta intermediária que pode afetar uma janela específica de faturamento.
Também houve alta de 14,9% no Meta Llama 4 Maverick, de US$ 0,696 para US$ 0,80. O Tencent Hy3 preview subiu de US$ 0,21 para US$ 0,60. A redução de custos, portanto, vale sobretudo para quem consegue migrar ou alternar modelos — não para quem mantém um único endpoint sem revisar o preço vigente.
Quem economiza agora
A mudança beneficia desenvolvedores e empresas que consomem muitos tokens nos modelos DeepSeek V4 Flash, GLM 5, GLM 5.1, GLM 5.2 e Qwen listados. Também pode ajudar quem usa roteamento dinâmico e consegue aproveitar preços diferentes por tarefa.
Para quem utiliza Claude Opus 4.6, por exemplo, nada muda com esses reajustes: a ficha no OpenRouter mantém US$ 5 por milhão na entrada, US$ 25 na saída, cache a US$ 0,50 e contexto de 1.000.000 de tokens. O catálogo também mostra que há 549 modelos de 68 criadores, mas variedade não elimina a necessidade de conferir o identificador e a tarifa antes de trocar em produção.
A implicação prática é direta: revise hoje a tabela de preços do endpoint usado, simule o volume mensal e trate cada variante como um produto diferente antes de concluir que a sua fatura caiu.
A economia é real para vários modelos, mas só aparece na fatura se você conferir o endpoint exato e ajustar o roteamento.
Perguntas frequentes
Quais modelos de API ficaram mais baratos em 15 de agosto de 2026?
DeepSeek V4 Flash 0423, DeepSeek V4 Flash Latest, GLM 5, GLM 5.1, GLM 5.2, Qwen Plus 0728 com thinking e Qwen3.5 397B A17B tiveram reduções listadas no OpenRouter. O Kimi K2.6 também terminou abaixo do preço inicial registrado, mas passou antes por uma alta.
O DeepSeek V4 Flash ficou quanto mais barato?
O DeepSeek V4 Flash 0423 passou de US$ 0,28 para US$ 0,154 e depois para US$ 0,129 por milhão de tokens. A versão Latest terminou em US$ 0,135, após dois cortes.
Todos os modelos ficaram mais baratos?
Não. Foram 11 reduções e quatro aumentos entre 15 mudanças registradas. Tencent Hy3 preview, Kimi K2.6 em um dos reajustes, Llama 4 Maverick e GLM 4.6 tiveram altas em algum registro.