A DeepSeek lançou a versão 0731 do V4-Flash, mantendo a política de preços agressiva pela qual a linha é conhecida — e acrescentando a ela um aviso pouco comum.

Os números

O V4-Flash custa $0,14 por milhão de tokens de entrada em caso de erro de cache (cache miss) e $0,28 por milhão de tokens de saída. Um acerto de cache (cache hit) reduz o custo de entrada para $0,0028 por milhão — cinquenta vezes mais barato, o que transforma a estrutura do prompt em uma decisão de custo de primeira ordem, e não em um detalhe de otimização.

O modelo maior, V4-Pro, custa $0,435 na entrada e $0,87 na saída por milhão, com acertos de cache a $0,003625. Ambos os modelos oferecem uma janela de contexto de 1M de tokens e suportam modos de raciocínio (thinking) e não raciocínio.

O aviso

A documentação de preços afirma claramente que a DeepSeek planeja aumentar os preços gerais da API em breve, com um aumento significativo previsto. É raro que fornecedores anunciem antecipadamente seus próprios aumentos de preço. Publicar isso significa que as tarifas atuais devem ser lidas como promocionais, e não estruturais.

Por que isso importa

A $0,14 por milhão de tokens de entrada, a DeepSeek é a opção credível mais barata na categoria próxima da fronteira tecnológica, superando o Luna da OpenAI, recém-reduzido para $0,20. Essa diferença vale alguma coisa — mas só enquanto durar, e o próprio fornecedor já disse que não vai durar.

A lição prática é sobre dependência (lock-in), não sobre preço. Construir um pipeline de alto volume em torno de quem for mais barato neste trimestre é razoável se os custos de troca forem próximos de zero. É caro se a integração for profunda. O desconto por acerto de cache funciona nos dois sentidos aqui: projetar prompts em torno do comportamento de cache de um fornecedor específico é exatamente o tipo de trabalho que não é transferível.

Como interpretar os preços de cache

A diferença de cinquenta vezes entre acerto e erro de cache é o número mais aplicável aqui. Isso significa que o formato de um prompt — o que permanece constante entre chamadas e o que varia — determina o custo mais do que a escolha do modelo. Sistemas que colocam um grande preâmbulo estável no início e variam apenas a parte final conseguem a maior parte de seus tokens de entrada a $0,0028 por milhão.

Isso representa dinheiro real em grande volume, e também é uma forma sutil de dependência (lock-in): prompts projetados em torno do comportamento de cache de um fornecedor não se transferem de forma limpa para outro.

O que planejar

Trate os preços atuais da DeepSeek como temporários, porque o próprio fornecedor disse que são. Se uma carga de trabalho estiver sendo dimensionada com base nessas tarifas, simule o que acontece com o preço duas ou três vezes maior antes de se comprometer. Um pipeline que só funciona a $0,14 por milhão é um pipeline com um cronômetro correndo contra ele.