OpenAI הורידה את מחיר GPT-5.6 Luna, המודל הבסיסי במשפחת GPT-5.6, ל-0.20$ למיליון טוקנים בכניסה ו-1.20$ למיליון טוקנים ביציאה. Luna הושק במחיר של 1$ למיליון טוקנים בכניסה — הנתון החדש מהווה קיצוץ של 80% בצד הכניסה.

מה השתנה

מבנה המחירים של שלושת המודלים כעת הוא כך: Luna ב-0.20$ / 1.20$, Terra ב-2$ / 12$ ו-Sol ב-5$ / 30$ למיליון טוקנים. רק Luna השתנה; Terra ו-Sol נותרו ללא שינוי.

עיבוד באצווה (Batch) מתבצע במחצית מהתעריף הרגיל בכל שלושת המודלים, ובקשות עם הקשר ארוך (long-context) מחויבות בכפול בקירוב מהתעריף להקשר קצר — כך שהמחיר האפקטיבי תלוי במידה רבה באופן שבו בנוי העומס, לא רק באיזה מודל נבחר.

המיקום בשוק

Luna במחיר של 0.20$ בכניסה נמצא באותה קטגוריה עם DeepSeek V4-Flash ב-0.14$ ועם רמת Flash-Lite של Google. לפני שנים עשר חודשים, האפשרות הזולה ביותר שנחשבה קרובה לחוד החזית עלתה כמה דולרים למיליון טוקנים בכניסה. הרצפה זזה בסדר גודל, והתנועה הזו הייתה המהירה ביותר ברביע האחרון.

למה זה חשוב

לכל שימוש בנפח גבוה — סיווג, חילוץ מידע, ניתוב, סיכום ראשוני — חשבון המודל מפסיק להיות המגבלה במחירים האלה. זה משנה אילו מוצרים משתלם לבנות: תהליכי עבודה שלא היו כלכליים במחיר של 1$ למיליון כניסות הופכים לכדאיים ב-0.20$.

מנגד, המחיר לבדו כבר לא מבדיל בין השחקנים בשכבה הזולה. כשארבעה ספקים נמצאים במרחק של כמה סנטים זה מזה, ההחלטה עוברת לזמן תגובה, טיפול בהקשר, מהימנות בקריאה לכלים (tool-calling) ואופן ההתנהגות של הספק כשהוא יצטרך להעלות מחירים בעתיד.

מה לעקוב אחריו בהמשך

קיצוץ בגודל הזה מסמן בדרך כלל קיבולת (capacity) ולא נדיבות. עלות ההסקה (inference) פוחתת כאשר לספק יש חומרה פנויה וערימת הגשה (serving stack) יעילה, והמחירים עוקבים בהתאם. השאלה לכל מי שמתכנן תקציב סביב הנתונים האלה היא אם הרצפה תישאר יציבה — DeepSeek כבר הודיעה בפומבי שהמחירים שלה עצמה עומדים לעלות בחזרה.

הצעד המעשי הוא להתייחס לשכבה הזולה כניתנת להחלפה. יש לשמור על פרומפטים ניידים, להימנע מהתבססות על תכונות ספציפיות לספק בנתיבי הנפח הגבוה ביותר, ולבצע השוואת ביצועים (benchmark) מחדש כל רבעון. במחירים האלה, החלטת המעבר צריכה להיות מונחית על ידי איכות במבחן ההערכה הפרטי שלך, ולא על ידי טבלת מחירי מחירון שמשתנה כל כמה שבועות.