FalaVIP IA o que os modelos custam,
medido todo dia
Preços

Llama 3.1 70B sobe 80% e lidera a volatilidade de preços

O modelo da Meta passa a custar US$ 0,72 por milhão de tokens no OpenRouter. DeepSeek V4 Flash e Gemma 4 aparecem no sentido oposto, com cortes que aliviam outras faixas de custo.

Redação FalaVIP IA 3 min de leitura
80%alta do Llama 3.1 70B
US$ 0,72por milhão de tokens do Llama 3.1 70B
US$ 0,08por milhão de tokens do DeepSeek V4 Flash 0731 após o corte

Se você usa o Llama 3.1 70B em produção, a conta ficou 80% mais cara no OpenRouter. O preço do modelo da Meta passou de US$ 0,40 para US$ 0,72 por milhão de tokens, a maior oscilação percentual registrada entre as mudanças de preço de 12 de setembro.

A alta vira o principal movimento do dia porque supera, em magnitude, os cortes observados em outros modelos. O DeepSeek V4 Flash 0731 caiu 55,6%, de US$ 0,18 para US$ 0,08 por milhão. O alívio é real, mas não compensa automaticamente o impacto para quem já depende do Llama em rotas de alto volume.

O que mudou na fatura

A mudança do Llama 3.1 70B Instruct é direta: o mesmo modelo ficou mais caro no OpenRouter. Não há, nos dados de preço, indicação de uma nova versão, de aumento de contexto ou de melhora de desempenho que justifique tratar o reajuste como uma troca de produto.

Esse detalhe importa. Se a aplicação envia e recebe grandes volumes de tokens, a diferença entre US$ 0,40 e US$ 0,72 por milhão aparece na fatura sem que o código precise mudar. O reajuste vale para quem manteve esse modelo como padrão, fallback ou opção de classificação em produção.

Para quem ainda está escolhendo um modelo, o aumento também muda a comparação com alternativas abertas e de baixo custo. Mas preço menor não equivale a desempenho equivalente. A decisão precisa considerar qualidade, latência, estabilidade do provedor e o custo de trocar prompts ou validar respostas.

DeepSeek traz alívio — mas com histórico instável

O DeepSeek V4 Flash 0731 fez o movimento contrário nesta data. O preço caiu de US$ 0,18 para US$ 0,08 por milhão de tokens, uma redução de 55,6%. Para tarefas simples, alto volume e respostas curtas, essa diferença pode ser mais relevante do que a estreia de modelos caros.

A leitura exige cautela porque outros registros do DeepSeek mostram mudanças em sentidos diferentes no intervalo de dois dias. O DeepSeek V4 Pro 0813, por exemplo, aparece com alta de 81,1% em uma alteração, de US$ 1,738 para US$ 3,148, e também com cortes posteriores. A mensagem para quem paga a API é menos confortável: não basta escolher um preço hoje e esquecer o monitoramento.

O DeepSeek V4 Flash 0423 também teve redução de US$ 0,17 para US$ 0,134 em 12 de setembro. São produtos diferentes, apesar da proximidade dos nomes, portanto a economia não deve ser aplicada a uma rota sem confirmar o identificador exato usado pela aplicação.

Gemma 4 aparece como correção anterior

O Google Gemma 4 26B A4B caiu de US$ 0,34 para US$ 0,22 por milhão de tokens. O corte foi de 35,3%, mas ocorreu em 10 de setembro, não em 12 de setembro.

Essa diferença de data muda a leitura do anúncio. O Gemma 4 faz parte do alívio acumulado na janela analisada, mas não é uma correção pontual do mesmo dia do reajuste do Llama. Se você está comparando a fatura de hoje com a de dois dias atrás, o corte entra na conta; se está procurando as alterações de 12 de setembro, ele não entra.

Lançamentos baratos não anulam o reajuste

O OpenRouter também listou lançamentos recentes. O Schematron V2 Turbo chegou a US$ 0,03 por milhão de tokens de entrada e US$ 0,15 de saída, com contexto de 128000 tokens. O Schematron V2 Small ficou em US$ 0,05 de entrada e US$ 0,23 de saída, com o mesmo contexto.

Esses preços podem interessar a quem está construindo uma nova rota, mas não mudam nada para uma aplicação presa ao Llama por compatibilidade, qualidade ou validação já concluída. Também apareceram modelos gratuitos, como o Ling 3.0 Flash VL, mas a existência de uma opção sem cobrança não informa disponibilidade, limite operacional ou qualidade para uma carga de produção.

No índice do Artificial Analysis, três modelos estrearam no período. O DeepSeek V4.1 Flash (max) marcou 39,5 de inteligência por US$ 0,525 por milhão, enquanto o Agnes 3.0 Flash marcou 35,5 por US$ 0,075. O Ling-3.0-flash-VL apareceu com índice de 24,8 e preço de US$ 0.

A implicação prática é clara: revise hoje as rotas que usam o Llama 3.1 70B, teste o DeepSeek V4 Flash 0731 como alternativa de menor custo e trate qualquer troca como decisão de qualidade, não apenas de preço.

Em uma frase

Quem usa o Llama 3.1 70B precisa reavaliar a rota imediatamente, enquanto novos projetos podem testar alternativas mais baratas antes de assumir o reajuste.

Perguntas frequentes

Quanto passou a custar o Llama 3.1 70B no OpenRouter?

O preço passou de US$ 0,40 para US$ 0,72 por milhão de tokens. Isso representa uma alta de 80%.

Qual modelo ficou mais barato no dia?

O DeepSeek V4 Flash 0731 caiu de US$ 0,18 para US$ 0,08 por milhão de tokens, uma redução de 55,6%. O DeepSeek V4 Flash 0423 também caiu, para US$ 0,134.

O Gemma 4 ficou mais barato em 12 de setembro?

Não. O Gemma 4 26B A4B caiu de US$ 0,34 para US$ 0,22, mas a alteração ocorreu em 10 de setembro. Ela faz parte da janela de dois dias, não das mudanças do dia 12.

Leia também