Google вивела дві родини моделей зі статусу preview протягом одного тижня, обидві орієнтовані на медіа, а не на текст.
Gemini Omni Flash
gemini-omni-1.1-flash досягла загальної доступності 27 серпня з трьома новими можливостями: розширення відео, інтерполяція між зображеннями та керування роздільною здатністю аж до 4K. Preview-ендпоінт, який вона замінює, має припинити роботу 30 вересня 2026 року, тож усі, хто ще звертається до нього, мають чітку дату переходу.
Керування роздільною здатністю аж до 4K — практично головна новина. Згенероване відео, яке не досягає навіть мовної якості, — це демонстрація; відео, що досягає 4K, — це те, що продакшн-команда може реально використовувати без етапу апскейлінгу.
Перетворення мовлення на текст
Днем раніше, 26 серпня, gemini-3.5-transcribe та gemini-3.5-transcribe-live обидві досягли статусу GA. Вони підтримують понад 85 мов із розпізнаванням мовців (diarization) та мітками часу на рівні слів.
Саме ці дві останні функції відрізняють транскрипцію-іграшку від транскрипції-продукту. Diarization показує, хто говорив; мітки часу на рівні слів дозволяють будувати на цій основі пошук, субтитри та монтаж. Варіант live охоплює використання в реальному часі, де обмеженням є затримка, а не точність.
Чому це важливо
Перетворення мовлення на текст із diarization для понад 85 мов, доступне як загальний API, чинить прямий тиск на самостійний ринок транскрипції. Інструменти цієї категорії історично конкурували саме за цими двома функціями.
Те саме стосується генерації відео. Кожна можливість, яка переходить від спеціалізованого постачальника до універсального API від Google, OpenAI чи Anthropic, звужує те, що спеціаліст може ще продавати — зазвичай це робочі процеси, інтеграції та підтримка, а не сама базова модель.
Що варто перевірити
Якщо ви використовуєте preview-ендпоінт Omni Flash, перейдіть на новий до 30 вересня. А якщо ви платите за сервіс транскрипції, варто оцінити вартість того самого завдання через API — відповідь може не на користь переходу, але розрив уже менший, ніж раніше.