Проблема «генерации и ожидания»
Современные системы создания дипфейков и анимации людей, такие как Wan2.2 Animate, работают по принципу «запусти и жди». Чтобы получить качественное видео с движениями всего тела, пользователю приходится тратить время на обработку данных. Это делает невозможным использование подобных технологий в прямых эфирах или интерактивных стримах.
Существующие решения для видео в реальном времени, например Deep-Live-Cam, справляются только с мимикой и синхронизацией губ. Они не способны передать сложные движения тела, такие как танец, сохраняя при этом высокое разрешение и стабильность картинки.
Новый подход к генерации видео
Разработчики из Гонконга, Alibaba и Liblib AI предложили решение, которое превращает офлайн-модель в инструмент для потокового вещания. Система LiveAnimate работает со скоростью около 20 кадров в секунду, что позволяет имитировать движения человека в реальном времени.
В отличие от классических методов, которые обрабатывают всю последовательность кадров целиком, LiveAnimate генерирует видео небольшими сегментами по мере развития действия. Это позволяет системе работать непрерывно, не дожидаясь завершения обработки всего ролика.
Память для сохранения внешности
Одной из главных проблем ИИ-анимации является «дребезжание» — когда внешность персонажа меняется от кадра к кадру. Чтобы этого избежать, разработчики внедрили систему памяти. Система сохраняет ключевые позы и детали внешности из предыдущих блоков видео и использует их как ориентир для новых кадров.
Для управления этой памятью используется специальный механизм: система хранит несколько репрезентативных поз и сравнивает текущее движение с ними. Это позволяет модели «вспоминать», как выглядел человек в похожем положении, сохраняя его идентичность на протяжении долгого времени без потери качества.
Технические особенности и возможности
Для работы системы требуется значительная вычислительная мощность — две видеокарты NVIDIA H100 с общим объемом памяти 160 ГБ. Несмотря на это, LiveAnimate демонстрирует стабильное качество и узнаваемость персонажа на протяжении долгого времени, в то время как другие системы начинают искажать образ уже через несколько секунд.
Технология способна обрабатывать не только танцевальные движения, но и более сдержанную анимацию, например, жестикуляцию и движения головы во время интервью. Это открывает возможности для создания интерактивных цифровых аватаров в различных сценариях — от уличных прогулок до офисных сцен.
Что это значит
Разработка LiveAnimate устанавливает новый стандарт для интерактивной анимации человека, позволяя совместить высокое качество генерации с минимальной задержкой, необходимой для работы в реальном времени.
