DeepSeek V4.1 Flash chega com IQ 39,5, mas preços sobem
O novo modelo custa US$ 0,15 por milhão de tokens de entrada no OpenRouter, enquanto o Artificial Analysis registra US$ 0,525 na estreia da configuração max. No mesmo período, o Llama 3.1 70B ficou 80% mais caro.
Se você usa modelos em produção, o número mais importante da estreia do DeepSeek V4.1 Flash é US$ 0,15 por milhão de tokens de entrada. Esse é o preço listado no OpenRouter. A saída custa US$ 0,60 por milhão de tokens, e a janela de contexto chega a 1.048.576 tokens.
O resultado de inteligência também chama atenção: o Artificial Analysis colocou o modelo em 39,5 de IQ. Mas há uma diferença que muda a conta. A configuração identificada como “max” estreou no índice com preço de US$ 0,525 por milhão de tokens. Portanto, o preço de entrada de US$ 0,15 e o valor associado ao benchmark não descrevem necessariamente a mesma configuração.
O que realmente chegou ao mercado
O DeepSeek V4.1 Flash aparece no catálogo do OpenRouter com custo de US$ 0,15 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída. Para uma aplicação que gera muitas respostas, a saída pesa quatro vezes mais do que a entrada por milhão de tokens.
O modelo tem contexto de 1.048.576 tokens. Isso o coloca na mesma ordem de grandeza de opções como o Gemini 3.8 Flash, também listado com janela de 1.048.576 tokens, mas com preços de US$ 0,75 na entrada e US$ 3,75 na saída. A comparação é direta no custo, mas não permite concluir equivalência de qualidade: não há nota de IQ disponível para o Gemini 3.8 Flash nos dados do OpenRouter.
O Artificial Analysis registrou ainda o DeepSeek V4.1 Flash (max) com IQ 39,5. Entre as outras estreias do índice, o Ling-3.0-flash-VL ficou em 24,8 e o DeepSeek V4 Flash (Non-reasoning), em 18,9. O novo Flash, portanto, abre vantagem sobre os dois modelos que também entraram no índice no período.
A conta do ecossistema ficou menos previsível
Enquanto um modelo novo entra com preço baixo, modelos estabelecidos sofreram reajustes relevantes no OpenRouter. O Meta Llama 3.1 70B Instruct passou de US$ 0,40 para US$ 0,72 por milhão de tokens de entrada, alta de 80% em 11 de setembro.
O DeepSeek V4 Pro 0813 teve aumento de 81,1%, de US$ 1,738 para US$ 3,148 por milhão de tokens. O Qwen3 30B A3B Instruct 2507 subiu 55,4%, de US$ 0,193 para US$ 0,30. A direção não foi uniforme: o Kimi K3 caiu 22%, de US$ 15 para US$ 11,70, e o Gemma 4 26B A4B recuou 35,3%, de US$ 0,34 para US$ 0,22.
Há também movimentos dentro da própria DeepSeek. O DeepSeek V3 subiu 15,6%, de US$ 0,89 para US$ 1,029 por milhão de tokens de entrada. Já o DeepSeek V4 Flash 0423 aparece com alterações menores, incluindo uma alta de 1,8%, de US$ 0,174 para US$ 0,177.
Para quem o Flash faz diferença
O V4.1 Flash interessa principalmente a quem precisa reduzir o custo de tarefas de alto volume: classificação, extração, atendimento automatizado e fluxos que enviam muitos tokens de entrada. O preço de US$ 0,15 cria uma porta de entrada baixa, e o contexto de 1.048.576 tokens pode ajudar aplicações que trabalham com documentos extensos.
A vantagem é menor para quem depende de respostas longas. A tarifa de saída de US$ 0,60 continua sendo o principal componente do consumo quando o modelo produz muito texto. Também não há, nos dados disponíveis, notas de código ou de desempenho agêntico para medir se ele atende a tarefas de programação ou agentes autônomos.
Benchmark não é preço de produção
O Artificial Analysis coloca os modelos líderes do índice em IQ entre 51 e 53,4, com preço de US$ 20 por milhão de tokens. O V4.1 Flash, com 39,5, fica abaixo desse grupo, mas custa muito menos na entrada do OpenRouter. Essa diferença sugere um posicionamento de custo, não uma substituição automática dos modelos mais capazes.
Para quem já usa Llama 3.1 70B, Qwen3 30B ou DeepSeek V4 Pro, a alta de preço merece uma revisão imediata da fatura. Para quem ainda vai escolher um modelo econômico, o DeepSeek V4.1 Flash entra como candidato de baixo custo, mas a decisão deve separar a configuração tarifada no OpenRouter da configuração “max” avaliada no benchmark.
Na prática, faça um teste com seu tráfego real e compare separadamente tokens de entrada e saída: é aí que o US$ 0,15 de entrada pode parecer barato, enquanto o custo final depende do quanto sua aplicação faz o modelo escrever.
O DeepSeek V4.1 Flash reduz o custo de entrada, mas exige validar a configuração do benchmark e controlar a geração de saída antes de migrar uma aplicação.
Perguntas frequentes
Quanto custa o DeepSeek V4.1 Flash na API?
No OpenRouter, o modelo custa US$ 0,15 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída. A configuração “max” apareceu no Artificial Analysis com preço de US$ 0,525 por milhão de tokens.
Qual é o IQ do DeepSeek V4.1 Flash?
O Artificial Analysis registra IQ de 39,5 para o DeepSeek V4.1 Flash (max). Esse número não deve ser confundido com uma garantia de desempenho em código, agentes ou no caso de uso específico da sua aplicação.
O Llama 3.1 70B ficou mais caro?
Sim. O preço de entrada listado no OpenRouter subiu de US$ 0,40 para US$ 0,72 por milhão de tokens, uma alta de 80%.