Infinitalk позволяет создавать видео с говорящим персонажем длиной до 10 минут
Нейросеть Infinitalk использует одно фото и аудиодорожку для создания видео с говорящим персонажем длиной до 10 минут. В получившемся видео синхронизируются губы, мимика и движения тела. Об этом сообщает «Код Дурова».
«Большинство нейросетей для озвучки видео ограничиваются роликами на 5–15 секунд. Infinitalk устроен иначе: на вход подаются всего одно фото и аудиодорожка, а на выходе получается говорящий персонаж длиной до 10 минут — с синхронизированными губами, мимикой и движениями тела», — сообщает «Код Дурова».
Официальные сайты Infinitalk не блокируются разработчиками и открываются напрямую у большинства российских провайдеров. Однако карты, выпущенные в РФ, не подходят для оплаты.
Для доступа к Infinitalk без VPN и оплаты рублями можно использовать сервис SpeShu.AI. Этот сервис также предлагает аналоги других популярных моделей, которые работают без VPN, принимают российские банковские карты и обходятся дешевле.
В основе технологии Infinitalk лежат несколько решений. Sparse-frame video dubbing позволяет модели обрабатывать видео, опираясь на разреженный набор опорных кадров, что предотвращает накопление ошибок консистентности на длинных роликах. Синхронизация губ основана на анализе пар «фонема — визема», что обеспечивает более точный результат. Full-body motion synchronization синхронизирует с ритмом речи не только губы, но также голову, торс и жесты рук. Identity preservation обеспечивает неизменность лица, прически и одежды персонажа на протяжении всего ролика.
Infinitalk предлагает режимы Image-to-Video, Video-to-Video, Multi-person для нескольких говорящих персонажей одновременно, встроенный Text-to-Speech и поддержку любых языков, включая русский. Также есть отдельный режим для пения.
Среди ограничений — зависимость качества от исходной фотографии: размытые снимки, нестандартные ракурсы и жесткий боковой свет ухудшают итоговое видео. Сложные позы и жесты рук могут давать артефакты. При генерации с несколькими аватарами одновременно возрастает вычислительная нагрузка и время обработки.
Ключевое преимущество Infinitalk — сочетание длительности ролика до 600 секунд, синхронизации всего тела и поддержки нескольких персонажей одновременно. Для сравнения, у HeyGen максимальная длительность вдвое меньше, синхронизация тела реализована частично, и возможен только один персонаж в кадре. У Runway синхронизация тела хорошая, но также один персонаж на видео. У D-ID, Kling Video и Hedra длительность ролика не превышает минуты, а синхронизация тела и работа с несколькими героями в кадре отсутствуют.
Для начала работы с Infinitalk необходимо загрузить четкий портрет анфас в формате JPG, PNG или WEBP при хорошем освещении, добавить чистую аудиозапись в MP3 или WAV, либо ввести текст во встроенный TTS. Затем выбрать разрешение: 480p генерируется быстрее, а 720p и 1080p дают более качественную картинку. Готовое видео можно скачать в формате MP4 или получить по ссылке. Разработчикам доступен API через SpeShu.AI.
Для фотографии рекомендуется выбирать портрет анфас с равномерным освещением, разрешением от 512×512 пикселей, нейтральным выражением лица и без сильного сжатия. Для аудио важны отсутствие фоновых шумов, естественный темп речи, качество не ниже 44,1 кГц и небольшая пауза в начале и в конце записи. Infinitalk можно использовать в связке с ElevenLabs: сначала голос генерируется в ElevenLabs, а затем синхронизируется с аватаром в Infinitalk.
Infinitalk применяется в бизнесе для создания персонализированных видеообращений, видеокурсов и локализованных версий роликов на разных языках. Полностью бесплатного тарифа у Infinitalk нет, но приобретенные кредиты не сгорают. Сайты infinitetalk.net и infinitetalk.com открываются напрямую, без VPN. Технология поддерживает русский язык. Максимальная длина видео составляет 600 секунд, или 10 минут.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.