Llama sobe 121,9% e DeepSeek V4 Pro encarece 51,9%
Os preços listados no OpenRouter mostram reajustes capazes de alterar a fatura de aplicações em produção. Tencent e alguns modelos Qwen ficaram mais baratos, enquanto três modelos estrearam com janelas de contexto acima de 1 milhão de tokens.
Se você usa o Llama 3.3 70B Instruct em produção, o custo listado no OpenRouter saltou de US$ 0,32 para US$ 0,71 por milhão de tokens. A alta foi de 121,9% em 26 de agosto de 2026. É o reajuste mais agressivo do dia e muda a conta sem que seja necessário aumentar o tráfego da aplicação.
O DeepSeek V4 Pro 0423 também ficou mais caro: passou de US$ 1,146 para US$ 1,74 por milhão de tokens, uma alta de 51,9%. O DeepSeek V4 Flash 0731 subiu de US$ 0,08 para US$ 0,12, alta de 50%.
Para quem paga a API, a consequência é direta: estimativas baseadas nos preços anteriores deixaram de representar o custo atual. Antes de manter um fallback, uma rota automática ou um modelo fixado em produção, vale conferir o preço do identificador exato usado pela aplicação.
A alta não atingiu toda a linha DeepSeek
O rótulo “DeepSeek V4” esconde movimentos diferentes. O V4 Pro 0423 subiu 51,9%, mas o V4 Pro 0813 avançou 17,6%, de US$ 3,366 para US$ 3,96 por milhão de tokens. Já o DeepSeek V4 Flash 0423 aparece em dois registros conflitantes: um indica queda de 8,5%, de US$ 0,177 para US$ 0,162; outro aponta alta de 7,3%, de US$ 0,165 para US$ 0,177.
Também houve redução no DeepSeek V4 Flash Latest, de US$ 0,10 para US$ 0,075, queda de 25%. Portanto, trocar “DeepSeek V4” por outro nome da mesma família não garante economia. O identificador completo e a rota selecionada no provedor passam a ser parte da gestão de custos.
Isso vale principalmente para aplicações com muito volume de saída, como geração de texto, atendimento automatizado e agentes que produzem respostas longas. Se o uso é eventual ou concentrado em entradas curtas, o impacto financeiro pode ser menor, mas o preço de saída ainda precisa entrar na projeção.
Tencent e Qwen oferecem alívio — com uma ressalva
O Tencent Hy3 caiu 37,5%, de US$ 0,528 para US$ 0,33 por milhão de tokens. Entre os modelos Qwen, o Qwen3.5 397B A17B recuou 35%, de US$ 3,60 para US$ 2,34, enquanto o Qwen2.5 VL 72B Instruct baixou 25%, de US$ 1 para US$ 0,75.
Mas os registros do Qwen3.6 27B não permitem afirmar uma direção única. O mesmo identificador aparece com uma alta de 12,5%, de US$ 3,20 para US$ 3,60, e com uma queda de 11,1%, de US$ 3,60 para US$ 3,20. Essa inconsistência precisa ser tratada como alerta operacional, não como uma redução confirmada.
A vantagem, para quem pode trocar de modelo, é ter alternativas de preço no catálogo. O risco é comparar apenas o nome da família e ignorar versão, sufixo e rota. Em uma integração via OpenRouter, essa diferença pode aparecer na fatura mesmo quando o código da aplicação não muda.
Três estreias ampliam as opções de contexto
O dia também teve três lançamentos. O Qwen3.8 Flash chegou ao OpenRouter com entrada a US$ 0,15 e saída a US$ 0,47 por milhão de tokens, além de contexto de 1.000.000 de tokens.
O GLM 5.3 Flash, da Z.ai, estreou com entrada a US$ 0,075, saída a US$ 0,25 e contexto de 1.048.576 tokens. A versão batch aparece separadamente, com entrada a US$ 0,15, saída a US$ 0,50 e contexto de 1.048.575 tokens.
O Artificial Analysis atribui ao GLM 5.3 Flash notas de 71,535 em código e 58,156 em tarefas agênticas. O modelo tem pesos abertos e 320 bilhões de parâmetros. Essas métricas podem ajudar na triagem técnica, mas não substituem um teste com os prompts, ferramentas e limites da sua aplicação.
Quem precisa agir agora
A revisão é prioritária para quem usa Llama 3.3 70B Instruct ou DeepSeek V4 Pro 0423 em produção, especialmente com alto volume de tokens de saída. Também interessa a quem mantém esses modelos como fallback: uma rota pouco usada hoje pode se tornar cara quando acionada por uma falha do modelo principal.
Para quem usa Tencent Hy3 ou versões específicas do Qwen que caíram de preço, o movimento pode reduzir a fatura. Ainda assim, a troca só faz sentido depois de validar qualidade, latência e compatibilidade. Para quem não chama nenhum dos modelos afetados, as mudanças do dia não alteram diretamente o custo atual.
A ação prática é recalcular a projeção com os preços exibidos no OpenRouter, separar cada versão por identificador e colocar alertas de orçamento antes que o próximo ciclo de tráfego transforme o reajuste em custo fixo.
Se sua aplicação usa Llama 3.3 70B ou DeepSeek V4 Pro 0423, revise hoje o preço por milhão de tokens e teste uma rota alternativa antes da próxima fatura.
Perguntas frequentes
Quanto subiu o preço do Llama 3.3 70B na API?
O preço listado no OpenRouter passou de US$ 0,32 para US$ 0,71 por milhão de tokens. A variação informada foi de 121,9% em 26 de agosto de 2026.
O DeepSeek V4 ficou mais caro ou mais barato?
Depende da versão. O DeepSeek V4 Pro 0423 subiu 51,9%, enquanto o V4 Flash Latest caiu 25% e o V4 Flash 0423 aparece com registros conflitantes de alta e queda.
Quais modelos ficaram mais baratos?
O Tencent Hy3 caiu 37,5%. Também houve reduções de 35% no Qwen3.5 397B A17B e de 25% no Qwen2.5 VL 72B Instruct.