גוגל הוציאה שתי משפחות מודלים משלב ה-preview באותו שבוע, ושתיהן מיועדות למדיה ולא לטקסט.

Gemini Omni Flash

gemini-omni-1.1-flash הגיע לזמינות כללית ב-27 באוגוסט עם שלוש יכולות חדשות: הרחבת וידאו, אינטרפולציה בין תמונות, ושליטה ברזולוציה עד 4K. נקודת הקצה של גרסת ה-preview שהוא מחליף מתוכננת להיסגר ב-30 בספטמבר 2026, כך שמי שעדיין קורא לה מקבל תאריך יעד ברור.

השליטה ברזולוציה עד 4K היא החדשה המעשית העיקרית. וידאו מיוצר שאינו עולה על רזולוציית שידור הוא בגדר הדגמה; וידאו שמגיע ל-4K הוא משהו שצוות הפקה יכול להשתמש בו בפועל בלי שלב הגדלת רזולוציה.

המרת דיבור לטקסט

יום קודם לכן, ב-26 באוגוסט, הגיעו לזמינות כללית גם gemini-3.5-transcribe וגם gemini-3.5-transcribe-live. הם תומכים ביותר מ-85 שפות עם זיהוי דוברים (diarization) וחותמות זמן ברמת המילה.

שני המאפיינים האחרונים הם אלה שמפרידים בין צעצוע תמלול למוצר תמלול של ממש. זיהוי הדוברים אומר לך מי דיבר; חותמות הזמן ברמת המילה מאפשרות לבנות מעליהן חיפוש, כתוביות ועריכה. הגרסה החיה (live) מיועדת לשימוש בזמן אמת, שבו האילוץ הוא זמן השהיה (latency) ולא הדיוק.

למה זה חשוב

המרת דיבור לטקסט עם זיהוי דוברים ביותר מ-85 שפות, הזמינה כ-API כללי, מפעילה לחץ ישיר על שוק התמלול העצמאי. כלים בקטגוריה הזו התחרו היסטורית בדיוק על שני המאפיינים האלה.

אותו הדבר תקף גם ליצירת וידאו. כל יכולת שעוברת מספק מתמחה אל תוך API כללי-מטרה של גוגל, OpenAI או Anthropic מצמצמת את מה שנשאר לספק המתמחה למכור — בדרך כלל תהליכי עבודה, אינטגרציות ותמיכה, ולא את המודל עצמו.

מה כדאי לבדוק

מי שמשתמש בנקודת הקצה של Omni Flash בגרסת ה-preview צריך לעבור לפני 30 בספטמבר. ומי שמשלם עבור שירות תמלול, כדאי לבדוק תמחור של אותה עבודה דרך ה-API — התשובה לא בהכרח תתמוך במעבר, אבל הפער קטן יותר משהיה.