API fica mais instável: preços sobem 100%, modelos baratos avançam
DeepSeek registra reajustes e recuos bruscos, enquanto Gemini 3.8 Flash e alternativas de baixo custo mudam a conta de agentes em escala. A promessa de alta de até 1100% não aparece nos preços listados.
Se você usa modelos em produção, a decisão mais urgente não é escolher o modelo com a maior nota. É descobrir se o preço usado na sua planilha ainda existe. Em um único intervalo de mudanças, o OpenRouter registra altas de 100% no Gemini 3.7 Flash em lote e no DeepSeek V4 Flash Vision Exp. Também aparecem quedas de 50% no mesmo modelo da DeepSeek e de 54,9% no Llama 3.3 70B Instruct.
A cifra de até 1100% associada à guerra de preços não é confirmada pelos números listados. A maior alta positiva registrada é de 100%. O problema, para quem escala agentes, continua sendo a instabilidade: preços diferentes para o mesmo modelo e movimentos em sentidos opostos no intervalo de um dia.
Gemini 3.8 Flash melhora sem mudar o preço cheio
O Google colocou o Gemini 3.8 Flash no OpenRouter em 2 de setembro. A tarifa é de US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída, exatamente os mesmos valores do Gemini 3.7 Flash na modalidade padrão.
A troca não é, portanto, uma redução direta na fatura. O ganho está na capacidade medida pelo Artificial Analysis: o índice de inteligência sobe de 56 no Gemini 3.7 Flash para 58,7 no 3.8 Flash. A nota de código passa de 76,121 para 76,29, enquanto a avaliação agêntica vai de 45,105 para 49,999.
Para workloads que já usam o Gemini 3.7 Flash, isso pode significar mais capacidade sem aumento nominal de preço. Para quem esperava uma API mais barata, não muda nada. O contexto continua em 1.048.576 tokens nos dois modelos.
Existe uma opção de lote. O Gemini 3.8 Flash batch custa US$ 0,375 por milhão de tokens de entrada e US$ 1,875 de saída. Mas o preço do Gemini 3.7 Flash batch aparece com uma alta de 100%, de US$ 0,938 para US$ 1,875 na saída. Se a sua economia depende de processamento assíncrono, a modalidade precisa ser monitorada separadamente da API normal.
DeepSeek mostra o risco de planejar com uma tabela fixa
A DeepSeek é o caso mais difícil de transformar em orçamento. O V4 Flash Vision Exp aparece com alta de US$ 0,66 para US$ 1,32 por milhão de tokens de saída, mas também com um recuo de US$ 1,32 para US$ 0,66 no mesmo dia.
O V4 Pro 0813 tem o mesmo tipo de ruído: uma alteração registrada como alta de 69%, de US$ 1,98 para US$ 3,346, e outra como queda de 40,8%, de US$ 3,346 para US$ 1,98. O V4 Pro 0423 também aparece subindo de US$ 1,74 para US$ 2,085, uma variação de 19,8%.
Não dá para tratar esses registros como uma trajetória limpa de alta ou queda. Para o financeiro, a consequência é prática: o custo por tarefa precisa ser recalculado após cada mudança, e não apenas no fechamento do mês. O DeepSeek V4 Flash 0423, ainda assim, permanece em uma faixa baixa, entre US$ 0,156 e US$ 0,177 por milhão de tokens de saída nas alterações listadas.
Modelos novos ampliam a faixa de escolha
A Meta lançou o Muse Spark 1.3 com preço de US$ 1,25 na entrada e US$ 4,25 na saída por milhão de tokens. O modelo tem janela de 1.048.576 tokens, nota de inteligência de 60,8, código em 76,45 e avaliação agêntica de 56,052 no Artificial Analysis.
A versão Muse Spark 1.3 Contributor custa muito menos: US$ 0,10 na entrada e US$ 0,20 na saída. Não há notas de inteligência, código ou uso agêntico associadas a essa versão nos dados disponíveis. Ela pode ser interessante para tarefas simples e de grande volume, mas não há base para tratá-la como substituta direta do Muse Spark principal.
No ranking de custo-benefício do Artificial Analysis, o Qwen3.8-Flash-Next aparece com nota 55,8 a US$ 0,23 por milhão de tokens, e o GLM-5.3-Flash marca 57,5 a US$ 0,238. O GPT-5.6 Luna aparece com nota 52,3 na configuração max e preço de US$ 0,45. Esses números indicam opções para roteamento de tarefas, mas não comprovam que o Luna tenha sido lançado no período: ele aparece no ranking, não na lista de lançamentos do dia.
Quem precisa mudar o planejamento
Se você opera agentes autônomos, pipelines de visão ou automações com muitas chamadas de saída, a prioridade é separar preço de entrada, preço de saída e modalidade batch. É na saída que a diferença pesa: Gemini 3.8 Flash cobra cinco vezes mais por milhão de tokens do que na entrada, e o Muse Spark 1.3 cobra mais de três vezes.
Se você mantém uma aplicação estável em um modelo sem alteração registrada, a notícia não muda sua fatura imediatamente. Já quem usa roteamento automático, DeepSeek ou batch deve revisar limites, alertas e fallback agora. As fontes que deram origem à pauta foram os canais Paula Bernardes, Paula Bernardes, ViktorKav e Inteligência Mil Grau.
Para escalar agentes sem surpresa na fatura, trate preços de API como variáveis operacionais e teste uma rota barata antes de trocar o modelo principal.
Perguntas frequentes
O Gemini 3.8 Flash ficou mais barato que o Gemini 3.7 Flash?
Não na modalidade padrão: ambos aparecem a US$ 0,75 por milhão de tokens de entrada e US$ 3,75 de saída no OpenRouter. O Gemini 3.8 Flash melhora a nota de inteligência de 56 para 58,7 no Artificial Analysis.
A DeepSeek aumentou ou reduziu os preços da API?
As duas coisas aparecem nos registros do OpenRouter. O V4 Flash Vision Exp tem uma alta de 100% e também um recuo de 50%, enquanto o V4 Pro 0813 aparece com alta de 69% e queda de 40,8% em alterações listadas no mesmo período.
Qual modelo barato aparece melhor colocado no custo-benefício?
O Qwen3.8-Flash-Next aparece com nota de inteligência 55,8 e preço de US$ 0,23 por milhão de tokens. O GLM-5.3-Flash marca 57,5 a US$ 0,238, enquanto o GPT-5.6 Luna max aparece com nota 52,3 a US$ 0,45.
Fontes
- Technology Is Entering an Era Where You Don't Pay to Own — You Pay to Use Paula Bernardes · vídeo
- Gemini 3.7 Flash Already Creates Systems on Its Own — But Nobody Is Talking About What Happens Next Paula Bernardes · vídeo
- DeepSeek V4 Flash Buried Any Price War (And Backtracked) ViktorKav · vídeo
- NEW GEMINI 3.7 Released, Easily Outperforms 3.6, and Google Breathes Again Against ChatGPT and Cl... Inteligência Mil Grau · vídeo