FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

DeepSeek V3.1 cobra US$ 0,95 por milhão de saída e fica no meio do caminho

Modelo híbrido da DeepSeek tem modo thinking e contexto gigante, mas o preço o coloca numa posição estranha no catálogo de 222 modelos.

Redação FalaVIP IA 3 min de leitura
US$ 0,95por milhão de tokens de saída
671 bilhõesde parâmetros totais (37 bilhões ativos)
163.840tokens de contexto

Você está olhando o catálogo de modelos, 222 opções listadas, e se depara com o DeepSeek V3.1 cobrando US$ 0,95 por milhão de tokens de saída. Esse número não é nem barato nem caro — é esquisito. Mais caro que três modelos abertos que estão acima dele na lista. Mais barato que o topo absoluto. É o clássico "meio de mercado" que ninguém sabe bem para que serve.

A questão é: ele vale o que custa?

O que é o V3.1, na prática

O DeepSeek V3.1 é um modelo híbrido de raciocínio com 671 bilhões de parâmetros totais, mas só 37 bilhões ativos por inferência. É arquitetura MoE — mixture of experts — o mesmo formato que o Mixtral e o próprio V3 anterior usavam. Pensa num restaurante com cardápio de 671 itens: cada pedido só aciona o cozinheiro certo, não a cozinha inteira. Por isso o modelo "inteiro" é enorme, mas a conta de GPU por token fica administrável.

O ponto novo é que ele tem dois modos: thinking e non-thinking, controlados por template de prompt. Você decide quando quer que ele pare para pensar e quando quer resposta direta. O contexto é de 163.840 tokens — equivalente a um livro de cerca de 500 páginas coladas de uma vez. O corte de conhecimento é março de 2025, então ele não sabe de nada depois disso.

Ficha técnica — DeepSeek V3.1
CampoValor
Identificadordeepseek/deepseek-chat-v3.1
Criadordeepseek
Preço de entradaUS$ 0.250 / M tokens
Preço de saídaUS$ 0.950 / M tokens
Janela de contexto164k
Modalidadetext->text
Leitura de cacheUS$ 0.130 / M (48% de desconto)

Onde ele cai na tabela de preços

Comparado com o topo do catálogo hoje, o V3.1 fica numa faixa intermediária. O OpenAI o3, que lidera em inteligência medida, custa US$ 8 por milhão de saída — 8,4 vezes mais caro. Mas logo abaixo do o3 aparecem modelos abertos da própria OpenAI, como o gpt-oss-120b a US$ 0,17 e o gpt-oss-20b a US$ 0,13. O Llama 4 Maverick, da Meta, sai por US$ 0,696 — mais barato que o V3.1.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Llama 4 Scout10.30.3
Entre os 222 modelos disponíveis no catálogo nesta data.

Em resumo: você paga US$ 0,95 por milhão de saída no V3.1 e, na maioria dos casos de uso que não exigem o topo absoluto, consegue algo equivalente por menos da metade.

Para quem ele faz sentido

O V3.1 brilha em três cenários específicos. Primeiro: tarefas longas que precisam do modo thinking ativado, onde você quer que o modelo pare, planeje e revise antes de responder — geração de código com múltiplos arquivos, análise de documentos jurídicos, planejamento multi-etapa. O modo thinking é o diferencial real frente ao Llama 4 Maverick, que não tem essa opção explícita.

Segundo: workloads com contexto longo. Os 163.840 tokens permitem passar um codebase inteiro ou um relatório extenso sem truncar. Se você já estava pagando caro para fazer isso com o3, o V3.1 sai por uma fração.

Terceiro: quem precisa de flexibilidade entre resposta rápida e resposta "pensada". O mesmo endpoint serve para os dois casos, sem trocar de modelo.

Para quem ele não muda nada

Se você já está usando o gpt-oss-120b ou o gpt-oss-20b para tarefas gerais, migrar para o V3.1 só porque é "mais novo" não faz sentido — você paga entre cinco e sete vezes mais por token de saída sem ganho claro de capacidade. O catálogo não publicou índice de inteligência, coding ou agentic para o V3.1 até esta data, então não há número que sustente trocar.

Se você está no topo com o3 e o orçamento é problema, o V3.1 é uma opção razoável de downgrade pago. Mas se o orçamento não é problema e a tarefa exige o melhor raciocínio absoluto, o o3 continua sendo o o3.

Se você roda volume alto em tarefas simples — classificação, extração, sumarização curta —, o V3.1 está superdimensionado. Um modelo pequeno da Meta ou da Mistral resolve por centavos.

O que fazer com isso

A conta é simples: use o V3.1 quando precisar do modo thinking ativo ou de contexto longo, e só nesses casos. Para o resto, o catálogo tem opções mais baratas com capacidade equivalente. E antes de migrar qualquer workload, espere o catálogo publicar os índices de inteligência e coding — sem esses números, você está apostando.

Em uma frase

Use o V3.1 quando precisar do modo thinking ativo ou de contexto longo; para o resto do catálogo, há opções mais baratas com capacidade equivalente.

Perguntas frequentes

O DeepSeek V3.1 é gratuito?

Não. O catálogo lista a US$ 0,25 por milhão de tokens de entrada e US$ 0,95 por milhão de saída, sem camada gratuita publicada.

Vale a pena trocar meu modelo atual pelo V3.1?

Depende do caso. Se você usa modo thinking ou passa contexto longo, vale testar. Se já usa modelos abertos da OpenAI ou da Meta para tarefas gerais, o custo é maior sem ganho claro documentado pelo catálogo.

Como o V3.1 se compara ao Llama 4 Maverick?

O Maverick é mais barato (US$ 0,696 por milhão de saída, contra US$ 0,95 do V3.1) e não tem modo thinking explícito. O V3.1 ganha em raciocínio controlado e contexto; o Maverick ganha em preço.

Leia também