Google Omni позволяет оживлять фото с пониманием контекста
Google DeepMind представил модель Gemini Omni Flash, которая является первой в новом семействе Omni. Часть её функций пока доступна в превью, а API появился в конце июня 2026 года. Google уже заменил Veo 3.1 на Omni, поэтому при генерации видео в Gemini пользователи работают с новой моделью.
«Первое, что меня зацепило, когда я разбирался, как оживить фото, — «any-to-any« трансформер: модель принимает текст, изображения, аудио и видео, обрабатывает все через языковую модель с пониманием мира и только потом генерирует видео», — сообщает «Код Дурова».
Модель понимает содержимое фото семантически, а не просто анимирует пиксели. Она знает, что кот является живым существом с определёнными паттернами движения, а ткань и волосы подчиняются гравитации.
Доступ к Gemini в России без дополнительных инструментов затруднён. Для обхода ограничений можно использовать российские агрегаторы, например SpeShu.AI, который предлагает оплату в рублях и не требует иностранной карты. Там же доступны аналоговые модели SpeShu Claude, SpeShu Gemini, SpeShu ChatGPT, которые работают без дополнительных инструментов и оплачиваются картами российских банков.
Максимальная длина клипа в Omni составляет 10 секунд, но Google обещает увеличить её в будущих обновлениях. Аудио генерируется нативно за один проход, а редактировать результат можно в разговорном формате, описывая изменения в чате.
Среди недостатков отмечаются проблемы с консистентностью при многошаговых правках, ухудшение качества в сложных сценах с быстрым движением нескольких объектов и трудности с точным рендерингом текста.
Gemini Omni Flash также доступен бесплатно внутри YouTube Shorts и приложения YouTube Create, что является самым доступным способом использования Omni, хотя и только для контента, публикуемого на YouTube.
Отдельной подписки на Omni не существует; модель включена в тарифы Google AI Plus, Pro и Ultra без дополнительной платы. Тариф AI Plus стоит $4,99 в месяц, AI Pro — $19,99 в месяц, а AI Ultra — $99,99 в месяц. На бесплатном тарифе видео через Omni в приложении Gemini недоступно, бесплатный путь остаётся только через YouTube.
Разговорное редактирование позволяет вносить изменения в видео, описывая их в чате, что отличается от стандартного процесса в других инструментах, где каждая новая попытка генерации начинается с нуля.
Модель принимает запросы в свободной форме через обычный чат. В первый запрос рекомендуется включать описание желаемого движения, атмосферу и указание на то, что должно остаться неизменным. В последующих запросах хорошо работают точечные корректировки, усиление или ослабление эффектов, а также добавление звука или изменение характера движения.
Существует запрет на синхронизацию губ статичного фото реального человека с аудиодорожкой, что является ограничением безопасности. Редактирование голоса также ограничено.
Omni выигрывает в семантическом понимании сцены и итеративном редактировании, но уступает некоторым конкурентам в фотореалистичной физике движения в сложных сценах. Главным отличием Omni является понимание контекста сцены через языковую модель до начала генерации движения.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.