Batch dobra de preço e pressiona contas de APIs de IA
Cinco modelos tiveram alta de 100% no processamento em lote. Na API padrão, o GLM 5.2 subiu 97,1%, mas a onda não foi uniforme: alguns preços também caíram.
Se você usa processamento em lote em produção, a conta pode ter dobrado nesta quarta-feira. Os preços listados no OpenRouter mostram altas de 100% em cinco modelos batch: Kimi K2.7 Code, GLM 5.2, Inkling, MiniMax M3 e Nemotron 3 Ultra.
O movimento atinge tarefas que aceitam esperar mais pela resposta, como classificação, extração, geração de conteúdo e processamento de grandes filas. A modalidade continua sendo uma opção para reduzir o custo em relação à API síncrona em alguns modelos, mas a vantagem diminuiu — e, em certos casos, o orçamento precisa ser revisto imediatamente.
Cinco modelos dobraram no batch
O GLM 5.2 passou de US$ 2,20 para US$ 4,40 por milhão de tokens de saída no processamento em lote. O Kimi K2.7 Code foi de US$ 2 para US$ 4. O Inkling subiu de US$ 2,025 para US$ 4,05.
Também houve alta de US$ 0,60 para US$ 1,20 no MiniMax M3 e de US$ 1,80 para US$ 3,60 no Nemotron 3 Ultra, da NVIDIA. Em todos os cinco casos, o reajuste representa 100%.
Para quem calcula a fatura por volume, a mudança é direta: a mesma fila, com o mesmo número de tokens, passa a custar duas vezes mais na tarifa de saída. O impacto tende a aparecer primeiro em pipelines que rodam milhares ou milhões de chamadas sem intervenção humana.
API padrão também ficou mais cara
O reajuste não ficou restrito ao batch. O GLM 5.2, na API padrão, passou de US$ 1,54 para US$ 3,036 por milhão de tokens de saída — alta de 97,1%, segundo os preços do OpenRouter.
O Kimi K2.6 subiu de US$ 2,36 para US$ 4, uma alta de 69,5%. O DeepSeek V4 Pro avançou de US$ 1,98 para US$ 2,88, ou 45,5%.
A diferença entre as modalidades é importante. No caso do GLM 5.2, por exemplo, o preço padrão final de US$ 3,036 por milhão de tokens ficou abaixo dos US$ 4,40 cobrados no batch. Se o seu sistema não precisa de resposta imediata, ainda vale comparar as duas rotas; o rótulo “batch” deixou de significar automaticamente a tarifa mais baixa entre as opções disponíveis.
A onda não atingiu todos os modelos
O quadro é mais irregular do que a manchete da alta sugere. O próprio Kimi K2.6 aparece novamente na lista de mudanças com redução de US$ 4 para US$ 2,36, queda de 41%. O registro indica uma alteração em sentido contrário para o mesmo modelo, algo que exige atenção à variante, ao provedor ou à condição tarifária selecionada no OpenRouter.
Também caíram os preços de saída do Qwen3.5-35B-A3B, de US$ 1,80 para US$ 1,25; do Kimi K2.5, de US$ 2,85 para US$ 2,25; e do Qwen3.6 27B, de US$ 2,40 para US$ 2. O DeepSeek Chat V3 0324 recuou de US$ 1,12 para US$ 1.
O DeepSeek V4 Flash teve alta pequena, de US$ 0,16 para US$ 0,165, enquanto a versão Latest caiu de US$ 0,157 para US$ 0,153. Portanto, não houve um reajuste geral para cima. A pressão se concentra em modelos e modalidades específicos.
Para quem isso muda a decisão
A mudança importa principalmente se você usa GLM 5.2, Kimi K2.7 Code, Inkling, MiniMax M3 ou Nemotron 3 Ultra em processamento em lote. Também afeta aplicações síncronas baseadas no GLM 5.2, Kimi K2.6 ou DeepSeek V4 Pro, especialmente quando a saída representa a maior parte do consumo.
Para quem usa modelos que tiveram redução, a fatura pode cair ou permanecer estável. E, se a aplicação roda pouco volume, o reajuste absoluto talvez não justifique uma migração imediata. Ainda assim, a variação é grande o bastante para quebrar previsões de custo feitas com tarifas antigas.
O Artificial Analysis registra, no mesmo dia, uma estreia do GLM-5.3 (max), com nota de inteligência de 59,5 e preço de US$ 2,15 por milhão de tokens. Isso amplia a comparação para além do modelo que ficou mais caro, mas preço e qualidade precisam ser avaliados junto com latência, estabilidade e compatibilidade do seu fluxo.
Na prática, revise hoje os identificadores das rotas batch, confira se o provedor selecionado corresponde à tarifa esperada e rode uma amostra com modelos que tiveram queda antes de aceitar o novo custo como inevitável.
Se sua aplicação processa alto volume em batch, congele a previsão antiga e compare rotas alternativas antes da próxima fatura.
Perguntas frequentes
Quais modelos tiveram aumento de 100% no processamento batch?
Kimi K2.7 Code, GLM 5.2, Inkling, MiniMax M3 e Nemotron 3 Ultra dobraram de preço no batch. Os valores finais por milhão de tokens de saída ficaram entre US$ 1,20 e US$ 4,40.
Quanto subiu o preço padrão do Z.ai GLM 5.2?
O GLM 5.2 passou de US$ 1,54 para US$ 3,036 por milhão de tokens de saída. A alta foi de 97,1%, segundo os preços listados no OpenRouter.
Todos os modelos de IA ficaram mais caros em 19 de agosto de 2026?
Não. Qwen3.5-35B-A3B, Kimi K2.5, Qwen3.6 27B e DeepSeek Chat V3 0324 tiveram redução. A lista também registra uma queda de 41% para o Kimi K2.6 em uma alteração distinta da alta de 69,5%.