FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

DeepSeek V4 Flash custa 138 vezes menos que Claude Opus 5 por token

Modelo sparse MoE da DeepSeek chega a US$ 0,18 por milhão de tokens de saída e vira o mais barato acima de IQ 45 no catálogo

Redação FalaVIP IA 3 min de leitura
US$ 0,18por milhão de tokens de saída
138xmais barato que Claude Opus 5
13B ativos / 284B totaisparâmetros do sparse MoE

O número que importa não é o IQ — é o preço por token

Quando você abre o catálogo hoje, o modelo mais inteligente é o Claude Opus 5, com IQ 63. O DeepSeek V4 Flash 0731 que a DeepSeek lançou agora marca 51,7. Parece uma diferença grande. Mas olha o preço de saída: US$ 0,18 por milhão de tokens contra US$ 25 do Opus 5. São 138 vezes mais barato pelo mesmo token produzido.

Inteligência × preço de saída
DeepSeek V4 Flash 0731Claude Opus 5Claude Fable 5GPT-5.6 SolMiniMax M3GPT-5.6 LunaUS$ por milhão (saída, escala log)índice de inteligência

A conta é simples e muda a conversa. Para a maioria das aplicações em produção, você não precisa do modelo mais inteligente do mercado. Precisa de um modelo bom o suficiente que não estoure o orçamento. É exatamente aí que a DeepSeek entrou hoje.

O que é o V4 Flash 0731

É um modelo sparse mixture-of-experts vindo da China: 284 bilhões de parâmetros totais, mas só 13 bilhões ficam ativos em cada inferência. A analogia é de um restaurante com 284 cozinheiros no quadro, mas só 13 vão para a cozinha quando um pedido entra. Você paga o custo de rodar um modelo pequeno, mas com o conhecimento de um modelo grande.

Ficha técnica — DeepSeek V4 Flash 0731
CampoValor
Identificadordeepseek/deepseek-v4-flash-0731
Criadordeepseek
Preço de entradaUS$ 0.065 / M tokens
Preço de saídaUS$ 0.180 / M tokens
Janela de contexto1.31M
Modalidadetext->text
Leitura de cacheUS$ 0.016 / M (75% de desconto)
Índice de inteligência (AA)51.8
Índice de código69.1
Índice agêntico48.4
Parâmetros284B (13B ativos por token)
Pesosabertos
Velocidade de saída137 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

Os números técnicos chamam atenção:

  • Contexto de 1,3 milhão de tokens — um dos maiores disponíveis
  • Velocidade de 136,65 tokens por segundo
  • Pesos abertos (open weights)
  • Foco declarado em coding, reasoning e agent workflows
  • Cache de prompt a US$ 0,016 por milhão — preço de commodity

Onde ele se encaixa no tabuleiro

O IQ 51,7 não coloca o V4 Flash no topo, mas o coloca acima da média do catálogo. Mais importante: a US$ 0,18 por milhão de tokens de saída, ele é o modelo mais barato entre todos os que ficam acima de IQ 45 no catálogo de hoje. Esse é o recorte que importa para quem paga a conta.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
DeepSeek V4 Flash 0731 (o novo)51.80.0650.181.31M
Claude Opus 563.15251M
Claude Fable 562.110501M
GPT-5.6 Sol60.92101.05M
MiniMax M345.40.31.21.05M
GPT-5.6 Luna52.30.21.21.05M
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Para tarefas de código, a história fica ainda melhor. A nota de coding é 69,06 — acima do próprio IQ geral. Se você roda geração de código, revisão automática ou agentes que escrevem software, esse é o número que vai aparecer no seu dashboard de avaliação.

Para quem isso vale a pena — e para quem não muda nada

Se você tem um produto que faz muitas chamadas de LLM por usuário — chatbots, agentes, pipelines de processamento — e a margem está apertada, o V4 Flash muda a equação. O custo de cache a US$ 0,016 por milhão é particularmente interessante para sistemas com system prompts longos reutilizados entre chamadas.

Se você precisa da resposta mais inteligente possível em tarefas de raciocínio pesado — pesquisa jurídica, análise científica complexa, geração criativa sofisticada — o Claude Opus 5 ainda lidera por 11 pontos de IQ. A diferença existe e, para esses casos, justifica o preço.

A variante batch e o que fazer com isso

Os outros modelos anunciados no mesmo dia
ModeloEntrada US$/MSaída US$/MContexto
DeepSeek V4 Flash 0731 (batc0.140.281.05M

Junto com o modelo principal, a DeepSeek lançou o V4 Flash 0731 em versão batch: US$ 0,28 por milhão de tokens de saída, contexto de 1 milhão de tokens. É mais caro que a versão síncrona, mas otimizado para processamento em lote onde latência não importa — jobs noturnos, ETL de documentos, geração massiva de conteúdo.

Se você está pagando mais de US$ 1 por milhão de tokens de saída em workload que não exige o modelo mais inteligente do mercado, vale rodar um teste A/B com o V4 Flash antes de renovar qualquer contrato. A economia por chamada é grande o suficiente para aparecer no P&L.

Em uma frase

Se sua fatura de API pesa e o caso de uso não exige o modelo mais inteligente do mercado, o V4 Flash 0731 é o novo ponto de referência de preço — rode um teste A/B antes de renovar o contrato.

Perguntas frequentes

DeepSeek V4 Flash é open source?

O modelo é distribuído com pesos abertos (open weights), o que significa que você pode baixar e rodar localmente. Os dados e o código de treino completo, porém, não são públicos — por isso o rótulo correto é open weights, não open source.

Quanto custa a versão batch?

US$ 0,28 por milhão de tokens de saída, com contexto de 1 milhão de tokens. É mais cara que a versão síncrona, mas otimizada para jobs em lote onde latência não importa.

Vale trocar do Claude Opus 5?

Depende do caso. Para workloads de alto volume com system prompts longos, a economia do V4 Flash pode mudar o P&L. Para tarefas onde o topo de inteligência é crítico, o Opus 5 ainda lidera por 11 pontos de IQ e a diferença justifica o preço.

Leia também