Пользователи ГигаЧата c сегодняшнего дня могут создавать видео с речью, музыкой и звуками окружения. Это стало возможным благодаря новой модели Kandinsky 6.0 Video, которая генерирует ролики с синхронным звуком. Об этом «ВЕДам» рассказали в пресс-службе Сбера.
Модель состоит из двух модулей — для видео и звука. Звуковой модуль обучили более чем на 20 млн видео со звуком. Команда отбирала ролики только с чистым звуком, а также видео, где говорящие сняты крупным планом — для точной синхронизации речи и мимики.

Изображение сгенерировано нейросетью
Чтобы получить ролик с озвучкой, достаточно описать сцену текстом или загрузить первый кадр и добавить описание звукового ряда. Максимальная длительность видео со звуком — пять секунд, со временем разработчики планируют ее увеличить.
Модель одновременно «видит» и «слышит» то, что генерирует, поэтому диалоги, эффекты и музыка синхронизированы с картинкой, а губы героя двигаются вместе с речью. Если звук не нужен, можно попросить нейросеть создать видео без него. Когда модель не знает, как выглядит объект из запроса, она ищет референсы и генерирует точный результат, утверждают разработчики.





