Gemini Omni 1.1 Flash: обзор новой модели Google

27 августа Google выкатила Gemini Omni 1.1 Flash — обновление своей мультимодальной модели для видео. Название сбивает с толку: это не чат-бот и не текстовая модель уровня GPT. Это генератор и редактор видео, который заодно понимает текст, картинки и звук — а на выходе выдаёт готовый ролик со звуковой дорожкой.
Разбираемся, что поменялось и зачем это вообще нужно.
С чего всё началось
Первая Omni Flash дебютировала на I/O в мае 2026-го. Тогда Google не называла её текст-ту-видео генератором в чистом виде — упор был на универсальность: модель одинаково брала на вход текст, картинку, аудио, видео и собирала из этого ролик.
Версия 1.1 — это тот же принцип, только с прицелом на контроль. Раньше не хватало ровно того, что теперь добавили: продолжения сцен, задания начального и конечного кадра, апскейла до 4K и дешёвых черновиков для тестов.
Доступ — через Google AI Studio, Gemini Enterprise Agent Platform и API (модель называется gemini-omni-1.1-flash). Продолжение сцен заодно доехало и до самого приложения Gemini, правда только для платных подписок — Plus, Pro и Ultra.
Что изменилось
Продолжение сцен работает иначе. Раньше модель цеплялась только за последнюю секунду ролика, и из-за этого при склейке всё «плыло» — свет менялся, лицо героя чуть-чуть искажалось. Сейчас модель смотрит на 10 секунд назад, а не на одну — и персонаж, свет и логика сцены держатся куда стабильнее. Продолжать можно кусками по 10 секунд, и так до 40 секунд суммарно.
Тут стоит сразу закрыть вопрос: это не значит, что модель одним махом рендерит 40-секундный ролик. Каждый кусок — от 3 до 10 секунд при 24 fps, а 40 секунд получается уже после склейки нескольких таких кусков.
Стартовый и финальный кадр можно задать самому. Загружаете два изображения — начало и конец — модель сама придумывает, как камера движется между ними. Полезно, когда важна конкретная композиция, а не то, что модель нафантазирует сама.
Видео-референсы. До 3 секунд чужого видео можно подсунуть модели как образец — она подхватит движение или внешность персонажа и перенесет в свою генерацию.
Черновой режим в 360p. Быстрая и дешёвая генерация для проверки идеи — примерно на 60% быстрее 720p и втрое дешевле. Логика простая: сначала прогоняете набросок в низком качестве, а деньги тратите уже на финальную версию.
Апскейл до 4K. Готовое видео можно поднять до 1080p или 4K — но это именно апскейл, не нативная генерация в этом разрешении. В документации API это прямо прописано, так что маркетинговые заголовки про «4K из коробки» слегка лукавят.
Работа со звуком
Главная фишка Omni — принцип «any-to-any»: модель берёт на вход любую комбинацию текста, картинки, аудио, видео — и за один проход выдаёт видео вместе со звуком, без отдельных этапов генерации и последующей сборки. У многих других моделей звук и видео — это два разных процесса, которые потом надо сводить руками. Здесь так не приходится.
Плюс к этому — редактирование через диалог: правите результат текстовыми командами, не запуская генерацию заново и не теряя контекст.
Скорость и позиционирование
Вся линейка Flash изначально заточена под скорость и невысокую стоимость при частых запросах — это инструмент для продакшна, а не для разовых экспериментов. Сам релиз 1.1 успел провести время в Google Cloud и pre-GA окружении с задержками, которые в компании объяснили дополнительными проверками безопасности и стабильности API.
Кому это надо
Если коротко: Omni 1.1 Flash — рабочий инструмент для тех, кто делает видео регулярно и хочет контролировать процесс, а не просто получать случайный ролик по промпту. Возможность продолжать сцены, задавать кадры и быстро тестировать черновики в дешёвом режиме закрывает как раз те задачи, которые раньше требовали ручной склейки нескольких генераций.
Главное — не путать заявленные максимумы с реальной механикой: 40 секунд — это сумма нескольких кусков, а не один long-take, а 4K — это апскейл, а не честная генерация в этом разрешении. С этой поправкой модель выглядит логичным и практичным шагом вперёд, а не просто ещё одной цифрой в номере версии.