DeepSeek a publié V4-Flash version 0731, conservant la tarification agressive qui caractérise cette gamme — tout en y associant un avertissement inhabituel.

Les chiffres

V4-Flash coûte 0,14 $ par million de tokens en entrée en cas de cache miss et 0,28 $ par million de tokens en sortie. Un cache hit fait tomber le coût d'entrée à 0,0028 $ par million — cinquante fois moins cher, ce qui fait de la structure des prompts une décision de coût de premier ordre plutôt qu'un simple détail d'optimisation.

Le modèle plus important V4-Pro est à 0,435 $ en entrée et 0,87 $ en sortie par million, avec des cache hits à 0,003625 $. Les deux modèles offrent une fenêtre de contexte de 1M tokens et prennent en charge les modes réflexion et non-réflexion.

L'avertissement

La documentation tarifaire indique clairement que DeepSeek prévoit d'augmenter globalement les prix de son API dans un futur proche, avec une hausse importante attendue. Les fournisseurs annoncent rarement à l'avance leurs propres hausses de prix. Le fait de le publier signifie que les tarifs actuels doivent être considérés comme promotionnels plutôt que structurels.

Pourquoi cela compte

À 0,14 $ par million en entrée, DeepSeek est l'option crédible la moins chère dans la catégorie proche de la pointe technologique, se plaçant sous Luna d'OpenAI, récemment réduit à 0,20 $. Cet écart a de la valeur — mais seulement tant qu'il dure, et le fournisseur a annoncé qu'il ne durerait pas.

La leçon pratique porte sur la dépendance plutôt que sur le prix. Construire un pipeline à fort volume autour du fournisseur le moins cher ce trimestre est raisonnable si les coûts de changement sont proches de zéro. C'est coûteux si l'intégration est profonde. La remise sur cache hit joue dans les deux sens ici : concevoir des prompts autour du comportement de cache d'un fournisseur particulier est précisément le genre de travail qui ne se transpose pas ailleurs.

Comment lire la tarification du cache

L'écart de cinquante fois entre cache hit et cache miss est le chiffre le plus exploitable ici. Il signifie que la forme d'un prompt — ce qui reste constant d'un appel à l'autre et ce qui varie — pèse davantage sur le coût que le choix du modèle. Les systèmes qui placent d'abord un long préambule stable et ne font varier que la fin obtiennent la majorité de leurs tokens d'entrée à 0,0028 $ par million.

C'est de l'argent réel à volume élevé, et c'est aussi une forme subtile de dépendance : des prompts conçus autour du comportement de cache d'un fournisseur ne se transposent pas facilement chez un autre.

Ce qu'il faut anticiper

Considérez la tarification actuelle de DeepSeek comme temporaire, puisque le fournisseur l'a lui-même annoncé. Si une charge de travail est calibrée sur ces tarifs, modélisez ce qui se passerait à deux ou trois fois le prix avant de vous engager. Un pipeline qui ne fonctionne qu'à 0,14 $ par million est un pipeline avec un compte à rebours.