AI-аватара в прямом эфире: новый сервис Vidu S1

Китайская компания ShengShu Technology представила Vidu S1 — модель, которая генерирует непрерывное видео с цифровым персонажем и позволяет управлять его действиями голосом. Пользователь может загрузить фотографию человека, животного или нарисованного героя, выбрать голос и начать видеозвонок с созданным аватаром.

Главное изменение связано со скоростью работы. Большинство генераторов видео сначала получают текстовую команду, затем несколько минут создают готовый ролик. Vidu S1 формирует изображение во время разговора и меняет поведение персонажа после новой голосовой команды.

Пользователь может попросить аватара помахать рукой, показать жест, улыбнуться, надеть очки или изменить позу. Система должна продолжить видеопоток без остановки и встроить действие в уже идущую сцену.

От готового ролика к прямому эфиру

Обычная генеративная видеомодель работает пакетно. Пользователь задаёт описание сцены и ждёт, пока система последовательно обработает весь ролик. Изменить действие в середине генерации обычно нельзя.

Vidu S1 работает как потоковая модель. Она создаёт следующие фрагменты видео на основе уже показанных кадров, изображения персонажа и новых голосовых инструкций.

В результате AI-видео становится интерактивным. Пользователь не только заказывает результат, но и управляет происходящим во время генерации.

Это позволяет создавать виртуальных ведущих, игровых персонажей, консультантов, AI-инфлюенсеров и цифровых собеседников, которые реагируют на человека в реальном времени.

Как создаётся персонаж

Для запуска пользователь загружает исходное изображение. Это может быть фотография реального человека, рисунок, изображение животного или вымышленного героя.

Затем выбирается готовый синтетический голос или записывается образец для голосового клонирования. После этого персонаж появляется в интерфейсе видеозвонка.

Фотография задаёт внешность, голосовая модель — звучание речи, а Vidu S1 генерирует движение лица, губ, головы и тела.

Система использует речь не только как аудиодорожку. Голосовые инструкции управляют будущими действиями персонажа. Фраза пользователя становится командой для следующих кадров.

Почему непрерывное видео остаётся сложной задачей

Генеративные модели часто теряют устойчивость на длинных роликах. Лицо постепенно меняется, детали одежды исчезают, фон искажается, а движения становятся менее естественными. Причина в «эффекте бабочки» — накопленых ошибках. Каждый новый фрагмент строится на предыдущих кадрах. Даже небольшое отклонение может усиливаться, пока персонаж не перестанет быть похожим на исходное изображение.

Авторы Vidu S1 заявляют, что модель может поддерживать видеопоток неограниченной продолжительности без быстрого визуального распада. В препринте показаны тестовые сессии длительностью до 90 минут. При этом формулировка «неограниченная продолжительность» скорее означает архитектурную возможность продолжать поток, а не гарантию идеального качества при любом сценарии.

Что такое TurboDiffusion и TurboServe

Vidu S1 построен на технологиях TurboDiffusion и TurboServe.

Диффузионные видеомодели обычно создают изображение через несколько этапов очистки случайного шума. Чем больше этапов, тем выше нагрузка на вычислительное оборудование.

TurboDiffusion сокращает количество необходимых вычислений, чтобы кадры можно было получать достаточно быстро для живого разговора.

TurboServe управляет запуском модели и распределяет вычислительные ресурсы. Его задача — поддерживать стабильный поток и одновременно обслуживать пользователей без слишком высокой стоимости.

По данным авторов оригинальной статьи (данный текст перевод), Vidu S1 способен генерировать видео с разрешением 540p и скоростью до 42 кадров в секунду на обычных потребительских видеокартах. Публичный интерфейс заявляет режим 25 кадров в секунду.

Где это можно использовать

  • Первый сценарий — цифровые ведущие. Такой персонаж может проводить прямой эфир, отвечать зрителям и выполнять команды без заранее записанного ролика.
  • Второй — игры. Персонаж может менять выражение лица и действия в зависимости от поведения игрока, а не воспроизводить ограниченный набор готовых анимаций.
  • Третий — виртуальные консультанты. Вместо неподвижного чат-бота пользователь получает говорящего персонажа, который реагирует на вопросы и поддерживает визуальный контакт.
  • Четвёртый — цифровые двойники. Из одной фотографии и записи голоса можно создать интерактивное представление конкретного человека.

Риски для лица и голоса

Простота создания персонажа делает особенно важным вопрос согласия. Фотографию и запись голоса можно использовать для создания убедительного аватара другого человека.

На странице Vidu указано, что перед загрузкой пользователь проходит проверку аккаунта. Однако доступные материалы не позволяют полностью оценить, как сервис проверяет права на изображение и голос.

Возможность управлять аватаром в реальном времени расширяет применение deepfake-технологий. Синтетический персонаж может участвовать в видеозвонке, отвечать на вопросы и выполнять команды, что делает обнаружение подделки сложнее. Платформам понадобятся проверка согласия, маркировка AI-видео и технические способы определить происхождение видеопотока.

Источники: Vidu, препринт Vidu S1: A Real-Time Interactive Video Generation Model, Tsinghua University, ShengShu Technology.