FalaVIP IA o que os modelos custam,
medido todo dia
Preços

DeepSeek V4.1 Flash cobra US$ 0,15 na entrada e US$ 0,60 na saída

O preço favorece protótipos com alto volume de entrada, mas a saída custa quatro vezes mais. A janela de contexto chega a 1.048.576 tokens, sem notas públicas de inteligência, código ou uso agêntico.

Redação FalaVIP IA 3 min de leitura
US$ 0,15por milhão de tokens de entrada
US$ 0,60por milhão de tokens de saída
1.048.576 tokensjanela de contexto

Se você usa um modelo em produção, a conta começa aqui: o DeepSeek V4.1 Flash aparece no OpenRouter por US$ 0,15 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída. É uma combinação agressiva para testar aplicações com muito contexto, mas não significa que toda chamada ficará barata. A saída custa quatro vezes mais que a entrada, e respostas longas podem dominar a fatura.

O modelo também tem janela de contexto de 1.048.576 tokens. O preço de cache listado é de US$ 0,003 por milhão de tokens. Esses são os números que importam para quem pretende colocar o Flash atrás de um produto, de um fluxo interno ou de uma bateria de testes.

O que chegou ao catálogo

O registro do OpenRouter para o DeepSeek Flash Latest, lançado em 14 de setembro de 2026, traz US$ 0,15 na entrada, US$ 0,60 na saída e a mesma janela de 1.048.576 tokens. A ficha do DeepSeek V4.1 Flash identifica o modelo pelo nome completo, mantém esses preços e registra lançamento em 10 de setembro de 2026.

A diferença de data não altera o custo atual, mas muda a leitura do anúncio. O catálogo mostra uma entrada de uma variante “Latest” em 14 de setembro, enquanto a ficha do V4.1 aponta 10 de setembro. Portanto, é mais preciso dizer que o modelo está disponível com preço detalhado no OpenRouter do que afirmar que toda a família estreou na mesma data.

A pauta foi originada pelo vídeo “I Tested DeepSeek V4.1 Flash and Spent Just Over R$ 4”, de ViktorKav. O teste prático ajuda a ilustrar o uso econômico, mas o valor em reais não substitui o cálculo por tokens para estimar uma operação contínua.

A comparação que muda a decisão

O DeepSeek Pro Latest aparece no mesmo conjunto de lançamentos por US$ 0,579 por milhão de tokens de entrada e US$ 1,738 por milhão de tokens de saída. Sua janela também é de 1.048.576 tokens. Na prática, o Flash ocupa uma faixa de preço bem menor dentro da própria linha DeepSeek, enquanto o Pro cobra mais por cada etapa da chamada.

Isso não prova que o Flash entregue a mesma qualidade. O Artificial Analysis não registra, para o V4.1 Flash, notas de inteligência, código ou desempenho agêntico. Também não há estreia de benchmark associada ao modelo nos dados disponíveis. O preço, portanto, é verificável; a equivalência de capacidade, não.

O mercado ainda teve movimentos que tornam a etiqueta menos estável. O DeepSeek V4 Flash 0423 passou de US$ 0,095 para US$ 0,177 por milhão de tokens em uma das alterações registradas no OpenRouter. Já o DeepSeek V4 Flash Latest foi de US$ 0,106 para US$ 0,10. São nomes próximos, mas não devem ser tratados como o mesmo endpoint sem conferir o identificador usado na aplicação.

Para quem vale

O V4.1 Flash faz sentido para prototipagem econômica, classificação, extração e automações em que o volume de entrada é alto e a resposta pode ser mantida sob controle. A janela de contexto de 1.048.576 tokens também interessa a quem precisa enviar documentos extensos ou histórico amplo sem dividir tudo em várias chamadas.

O benefício diminui quando o seu produto gera respostas muito longas. Nesse cenário, os US$ 0,60 por milhão de tokens de saída passam a pesar mais que a entrada. O cache a US$ 0,003 pode ajudar em fluxos com contexto reaproveitado, mas isso depende de a arquitetura realmente repetir os mesmos trechos.

Para quem escolhe modelo por desempenho em raciocínio, programação ou agentes, o anúncio ainda não resolve a decisão. Sem notas do Artificial Analysis para essas dimensões, o preço não deve ser usado como atalho para concluir que o Flash substitui modelos mais caros.

Como testar sem errar a conta

Separe o custo de entrada do custo de saída no seu experimento. Registre quantos tokens de resposta cada tarefa produz e não avalie apenas o preço do prompt. Uma aplicação que parece barata durante uma conversa curta pode consumir mais na geração de respostas extensas.

Também vale fixar o identificador do modelo no código e comparar o V4.1 Flash com o endpoint exato que você pretende usar. As mudanças registradas no OpenRouter mostram que nomes parecidos podem ter preços diferentes, e até o mesmo modelo aparece com ajustes de preço no mesmo dia.

Para um protótipo, a escolha é defensável porque o custo de entrada é baixo e a janela é ampla. Para produção, a decisão depende de medir qualidade e tamanho das respostas — duas variáveis que os dados de preço, sozinhos, não informam.

Em uma frase

Use o DeepSeek V4.1 Flash para validar fluxos baratos e longos, mas limite a saída e faça um teste de qualidade antes de migrar tráfego de produção.

Perguntas frequentes

Quanto custa o DeepSeek V4.1 Flash na API?

No OpenRouter, o modelo custa US$ 0,15 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída. O preço de cache listado é de US$ 0,003 por milhão de tokens.

Qual é a janela de contexto do DeepSeek V4.1 Flash?

A janela de contexto é de 1.048.576 tokens. Isso permite trabalhar com entradas extensas, mas não reduz o custo das respostas geradas pelo modelo.

O DeepSeek V4.1 Flash é melhor que modelos mais caros?

Os dados disponíveis não trazem notas do Artificial Analysis para inteligência, código ou uso agêntico do V4.1 Flash. Portanto, o preço confirma uma alternativa econômica, mas não permite concluir que ele tenha desempenho superior ou equivalente.

Fontes

Leia também