גוגל העבירה את gemini-3.8-flash לזמינות כללית. בניגוד לגרסאות Flash הקודמות, שמוצבו סביב מהירות ומחיר, הגרסה הזו מכוונת להנדסת תוכנה ארוכת-טווח, סוכנים אוטונומיים וזרימות עבודה ארגוניות מורכבות.

מה השתנה

המיצוב הזה הוא החדשות. Flash תמיד היה השכבה הזולה והמהירה שקוראים לה אלפי פעמים בתוך מערכת. גוגל כעת משווקת אותו בדיוק עבור העומס שבעבר דרש את דגם הדגל: סוכנים שפועלים לאורך זמן רב וצריכים לעקוב אחרי מה שהם עשו.

יום קודם לכן, ב-1 בספטמבר, הושקה הבנת וידאו אגנטית בכל דגמי ה-Flash. גוגל מדווחת שהיא משתמשת בעד 88% פחות טוקנים עבור תוכן ארוך בהשוואה לעיבוד סטטי פריים אחר פריים.

למה מספר הטוקנים חשוב

במשימות סוכנים ארוכות-טווח, החשבון נקבע לפי כמות הטוקנים שהמודל צורך בהחלטה מה לעשות, לא לפי המחיר הרשמי למיליון. הפחתה של 88% בקלט וידאו משנה אילו עומסי וידאו הופכים בכלל למשתלמים כלכלית — הקלטה מלאה שעלתה דולרים לניתוח עולה כעת סנטים.

זה גם מסביר את המיצוב מחדש. אם השכבה הזולה יכולה לשמר הקשר ביעילות לאורך ריצות ארוכות, הסיבה לפנות לדגם דגל עבור עבודה אגנטית נחלשת.

הדפוס הרחב יותר

גוגל השיקה זאת יומיים אחרי Fable 5.1 של Anthropic ויום לפני ש-OpenAI הכריזה על GPT-6 Astra. אבל בעוד ששני האחרים התחרו על יכולת חזית, גוגל התחרתה על עלות ליחידת עבודה. אלה הימורים שונים על מה השוק יקנה הבא.

מה לעשות בנידון

אם יש לכם עומסי סוכנים המחוברים כרגע לדגם דגל בשל טיפול בהקשר, כדאי לבחון זאת מחדש. ההשוואה המעניינת אינה ציוני בנצ'מארק אלא סך הטוקנים הנצרכים למשימה שהושלמה — שם דגם בשכבת Flash שמתחרה על יעילות מנצח או לא מנצח.

כדאי לזכור שגוגל הוציאה משימוש (deprecated) את פרמטרי הדגימה temperature, top_p ו-top_k בדגמי ה-Flash האחרונים שלה. קוד שעובר ל-3.8 לא אמור להעביר אותם.