DeepSeek הוציאה את V4-Flash גרסה 0731, ושומרת על התמחור התוקפני שהקו הזה מוכר בו — ומצרפת לו אזהרה יוצאת דופן.

המספרים

V4-Flash עולה 0.14$ למיליון טוקני קלט בפגיעה מוחמצת במטמון (cache miss) ו-0.28$ למיליון טוקני פלט. פגיעה במטמון (cache hit) מורידה את עלות הקלט ל-0.0028$ למיליון — זול פי חמישים, מה שהופך את מבנה הפרומפט להחלטת עלות מסדר ראשון ולא לפרט אופטימיזציה.

הדגם הגדול יותר, V4-Pro, עומד על 0.435$ לקלט ו-0.87$ לפלט למיליון, עם פגיעות מטמון ב-0.003625$. שני הדגמים מציעים חלון קונטקסט של 1M טוקנים ותומכים במצבי חשיבה ולא-חשיבה.

האזהרה

תיעוד התמחור קובע במפורש כי DeepSeek מתכננת להעלות את תמחור ה-API הכללי בעתיד הקרוב, עם עלייה משמעותית צפויה. ספקים לעיתים רחוקות מכריזים מראש על העלאות המחירים שלהם עצמם. פרסום הדבר משמעו שיש לקרוא את התעריפים הנוכחיים כתעריפי מבצע ולא כתעריפים מבניים.

למה זה חשוב

ב-0.14$ למיליון טוקני קלט, DeepSeek היא האפשרות האמינה הזולה ביותר בשכבה הקרובה לחוד החזית, ומוזילה מתחת ל-Luna המוזלת טרייה של OpenAI ב-0.20$. הפער הזה שווה משהו — אבל רק כל עוד הוא נמשך, והספק הודיע שהוא לא יימשך.

הלקח המעשי נוגע ליציאה מנעילה (lock-in) יותר מאשר למחיר. בניית צנרת (pipeline) בנפח גבוה סביב מי שהכי זול ברבעון הנוכחי בסדר אם עלויות המעבר קרובות לאפס. זה יקר אם האינטגרציה עמוקה. הנחת פגיעת המטמון פועלת בשני הכיוונים כאן: תכנון פרומפטים סביב התנהגות המטמון של ספק אחד הוא בדיוק סוג העבודה שלא עוברת לספק אחר.

איך לקרוא את תמחור המטמון

הפער של פי חמישים בין פגיעה במטמון לפגיעה מוחמצת הוא המספר המעשי ביותר כאן. הוא מלמד שצורת הפרומפט — מה נשאר קבוע בין קריאות ומה משתנה — קובעת את העלות יותר מבחירת הדגם. מערכות ששמות פתיח יציב וגדול בראש ומשנות רק את הזנב מקבלות את רוב טוקני הקלט שלהן ב-0.0028$ למיליון.

זה כסף אמיתי בנפח גבוה, וזו גם צורה עדינה של נעילה: פרומפטים שהונדסו סביב התנהגות המטמון של ספק אחד לא עוברים בצורה חלקה לספק אחר.

למה להתכונן

יש להתייחס לתמחור הנוכחי של DeepSeek כזמני, מכיוון שהספק אמר שהוא כזה. אם עומס עבודה מתוכנן בהתבסס על התעריפים האלה, יש למדל מה קורה במחיר כפול או משולש לפני ההתחייבות. צנרת שעובדת רק ב-0.14$ למיליון היא צנרת עם שעון עצר.