DeepSeek V4 Flash custa 138 vezes menos que Claude Opus 5 por token
Modelo sparse MoE da DeepSeek chega a US$ 0,18 por milhão de tokens de saída e vira o mais barato acima de IQ 45 no catálogo
O número que importa não é o IQ — é o preço por token
Quando você abre o catálogo hoje, o modelo mais inteligente é o Claude Opus 5, com IQ 63. O DeepSeek V4 Flash 0731 que a DeepSeek lançou agora marca 51,7. Parece uma diferença grande. Mas olha o preço de saída: US$ 0,18 por milhão de tokens contra US$ 25 do Opus 5. São 138 vezes mais barato pelo mesmo token produzido.
A conta é simples e muda a conversa. Para a maioria das aplicações em produção, você não precisa do modelo mais inteligente do mercado. Precisa de um modelo bom o suficiente que não estoure o orçamento. É exatamente aí que a DeepSeek entrou hoje.
O que é o V4 Flash 0731
É um modelo sparse mixture-of-experts vindo da China: 284 bilhões de parâmetros totais, mas só 13 bilhões ficam ativos em cada inferência. A analogia é de um restaurante com 284 cozinheiros no quadro, mas só 13 vão para a cozinha quando um pedido entra. Você paga o custo de rodar um modelo pequeno, mas com o conhecimento de um modelo grande.
| Campo | Valor |
|---|---|
| Identificador | deepseek/deepseek-v4-flash-0731 |
| Criador | deepseek |
| Preço de entrada | US$ 0.065 / M tokens |
| Preço de saída | US$ 0.180 / M tokens |
| Janela de contexto | 1.31M |
| Modalidade | text->text |
| Leitura de cache | US$ 0.016 / M (75% de desconto) |
| Índice de inteligência (AA) | 51.8 |
| Índice de código | 69.1 |
| Índice agêntico | 48.4 |
| Parâmetros | 284B (13B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 137 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
Os números técnicos chamam atenção:
- Contexto de 1,3 milhão de tokens — um dos maiores disponíveis
- Velocidade de 136,65 tokens por segundo
- Pesos abertos (open weights)
- Foco declarado em coding, reasoning e agent workflows
- Cache de prompt a US$ 0,016 por milhão — preço de commodity
Onde ele se encaixa no tabuleiro
O IQ 51,7 não coloca o V4 Flash no topo, mas o coloca acima da média do catálogo. Mais importante: a US$ 0,18 por milhão de tokens de saída, ele é o modelo mais barato entre todos os que ficam acima de IQ 45 no catálogo de hoje. Esse é o recorte que importa para quem paga a conta.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 (o novo) | 51.8 | 0.065 | 0.18 | 1.31M |
| Claude Opus 5 | 63.1 | 5 | 25 | 1M |
| Claude Fable 5 | 62.1 | 10 | 50 | 1M |
| GPT-5.6 Sol | 60.9 | 2 | 10 | 1.05M |
| MiniMax M3 | 45.4 | 0.3 | 1.2 | 1.05M |
| GPT-5.6 Luna | 52.3 | 0.2 | 1.2 | 1.05M |
Para tarefas de código, a história fica ainda melhor. A nota de coding é 69,06 — acima do próprio IQ geral. Se você roda geração de código, revisão automática ou agentes que escrevem software, esse é o número que vai aparecer no seu dashboard de avaliação.
Para quem isso vale a pena — e para quem não muda nada
Se você tem um produto que faz muitas chamadas de LLM por usuário — chatbots, agentes, pipelines de processamento — e a margem está apertada, o V4 Flash muda a equação. O custo de cache a US$ 0,016 por milhão é particularmente interessante para sistemas com system prompts longos reutilizados entre chamadas.
Se você precisa da resposta mais inteligente possível em tarefas de raciocínio pesado — pesquisa jurídica, análise científica complexa, geração criativa sofisticada — o Claude Opus 5 ainda lidera por 11 pontos de IQ. A diferença existe e, para esses casos, justifica o preço.
A variante batch e o que fazer com isso
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| DeepSeek V4 Flash 0731 (batc | 0.14 | 0.28 | 1.05M |
Junto com o modelo principal, a DeepSeek lançou o V4 Flash 0731 em versão batch: US$ 0,28 por milhão de tokens de saída, contexto de 1 milhão de tokens. É mais caro que a versão síncrona, mas otimizado para processamento em lote onde latência não importa — jobs noturnos, ETL de documentos, geração massiva de conteúdo.
Se você está pagando mais de US$ 1 por milhão de tokens de saída em workload que não exige o modelo mais inteligente do mercado, vale rodar um teste A/B com o V4 Flash antes de renovar qualquer contrato. A economia por chamada é grande o suficiente para aparecer no P&L.
Se sua fatura de API pesa e o caso de uso não exige o modelo mais inteligente do mercado, o V4 Flash 0731 é o novo ponto de referência de preço — rode um teste A/B antes de renovar o contrato.
Perguntas frequentes
DeepSeek V4 Flash é open source?
O modelo é distribuído com pesos abertos (open weights), o que significa que você pode baixar e rodar localmente. Os dados e o código de treino completo, porém, não são públicos — por isso o rótulo correto é open weights, não open source.
Quanto custa a versão batch?
US$ 0,28 por milhão de tokens de saída, com contexto de 1 milhão de tokens. É mais cara que a versão síncrona, mas otimizada para jobs em lote onde latência não importa.
Vale trocar do Claude Opus 5?
Depende do caso. Para workloads de alto volume com system prompts longos, a economia do V4 Flash pode mudar o P&L. Para tarefas onde o topo de inteligência é crítico, o Opus 5 ainda lidera por 11 pontos de IQ e a diferença justifica o preço.