DeepSeek Harness promete 36 segundos, mas a conta ainda não fecha
O vídeo mostra uma queda de 3 minutos para 36 segundos, mas não há dados públicos suficientes para provar economia de tokens ou comparar o Harness ao Cloud Code.
Se você usa agentes de código em produção, a promessa mais chamativa do DeepSeek Harness é uma redução de 3 minutos para 36 segundos. O problema é que esse ganho de tempo, sozinho, não mostra economia de tokens — e muito menos uma redução proporcional na fatura da API.
O vídeo de ViktorKav, “DeepSeek Harness: 3 Minutes Turned Into 36 Seconds”, coloca o Harness e o Code Mode no centro da discussão. Mas os dados disponíveis não trazem uma medição independente de tempo de execução, quantidade de tokens, número de chamadas ou custo total por tarefa.
Velocidade não é sinônimo de economia
Um agente pode terminar mais rápido por vários motivos: menor espera entre chamadas, execução paralela de ferramentas, menos etapas intermediárias ou infraestrutura mais eficiente. Nenhum deles prova, por si só, que o modelo gerou menos tokens.
Para quem paga a API, essa distinção é decisiva. A fatura depende do volume de tokens de entrada e saída, do preço do modelo e, em alguns casos, do cache. Um fluxo que termina em 36 segundos pode fazer mais chamadas em paralelo e consumir mais tokens do que outro que leva 3 minutos.
Também falta uma comparação equivalente com o Cloud Code. Sem o mesmo repositório, a mesma tarefa, as mesmas ferramentas e o mesmo modelo, o tempo divulgado não permite concluir que o Harness seja mais eficiente operacionalmente.
O DeepSeek está barato, mas o preço mudou
Os preços listados no OpenRouter mostram que o DeepSeek V4 Flash aparece em alterações conflitantes no mesmo dia. Uma entrada registra alta de US$ 0,123 para US$ 0,165 por milhão de tokens de saída. Outras registram movimentos de US$ 0,16 para US$ 0,148 e de US$ 0,165 para US$ 0,16.
Essa divergência importa para qualquer cálculo de retorno. Não dá para transformar um preço isolado em custo previsível sem saber qual variante, rota ou condição de cobrança se aplica ao fluxo usado pelo agente.
O DeepSeek V4 Pro aparece com redução de US$ 2,336 para US$ 1,98 por milhão de tokens de saída. Ainda assim, ele não é automaticamente a opção mais barata: a escolha depende da quantidade de chamadas, do tamanho do contexto e da necessidade de raciocínio em cada etapa.
O que os índices conseguem dizer
O Artificial Analysis coloca o DeepSeek V4 Flash 0731, em modo de raciocínio e esforço máximo, entre as opções de melhor custo-benefício, com índice de inteligência de 51,8 e preço de US$ 0,66 por milhão de tokens. O GPT-5.6 Luna aparece acima, com índice de 52,3 e preço de US$ 0,45 por milhão.
Esses números ajudam a escolher o modelo, mas não medem o Harness. O índice não informa quanto tempo um agente leva para editar arquivos, executar testes, corrigir falhas ou repetir uma tentativa. Também não informa quantos tokens o fluxo consome até chegar ao resultado.
Para o leitor que escolhe modelo, ferramenta e orçamento, isso significa que a promessa de velocidade deve ser tratada como benchmark de execução específico, não como prova de menor custo. A diferença entre o preço por milhão de tokens e o custo por tarefa só aparece quando o consumo real é medido.
Para quem a novidade vale
O DeepSeek Harness pode interessar a equipes que já operam agentes de código e conseguem instrumentar cada etapa: tempo de ferramenta, chamadas ao modelo, tokens de entrada, tokens de saída, falhas e repetições. Nesse cenário, a velocidade pode aumentar a capacidade do sistema e reduzir o tempo de espera do usuário.
Para quem roda tarefas assíncronas e paga principalmente pelo volume de tokens, a novidade não muda nada até que exista uma medição de consumo. O mesmo vale para quem usa Cloud Code sem gargalo de execução: trocar a ferramenta apenas por causa do número de 36 segundos seria uma decisão baseada em uma variável incompleta.
A recomendação prática é separar duas métricas. Primeiro, tempo até a conclusão. Depois, custo por tarefa concluída. Se o Harness reduzir o primeiro sem aumentar o segundo, há ganho operacional. Se também reduzir tokens e chamadas, há economia. Os dados disponíveis hoje comprovam apenas a promessa de velocidade apresentada no vídeo, não esse resultado completo.
Antes de migrar agentes para o DeepSeek Harness, meça tokens e custo por tarefa junto com o tempo de execução.
Perguntas frequentes
O DeepSeek Harness realmente reduz uma tarefa de 3 minutos para 36 segundos?
Esse é o resultado afirmado no vídeo de ViktorKav. Não há, nos dados disponíveis, uma medição independente que confirme o tempo em condições comparáveis.
O DeepSeek Harness consome menos tokens que o Cloud Code?
Não é possível concluir. Não foram informados tokens de entrada, tokens de saída, número de chamadas ou custo por tarefa para uma comparação direta.
Quanto custa o DeepSeek V4 Flash?
Os preços listados no OpenRouter divergem no mesmo dia: há registros de US$ 0,123 para US$ 0,165, de US$ 0,16 para US$ 0,148 e de US$ 0,165 para US$ 0,16 por milhão de tokens de saída. A variante e a condição aplicável precisam ser confirmadas antes de calcular a fatura.
Fontes
- DeepSeek Harness: 3 Minutes Turned Into 36 Seconds ViktorKav · vídeo