ГигаЧат теперь можно использовать для генерации видео со звуком

Пользователи ГигаЧата c сегодняшнего дня могут создавать видео с речью, музыкой и звуками окружения. Это стало возможным благодаря новой модели Kandinsky 6.0 Video, которая генерирует ролики с синхронным звуком. Об этом «ВЕДам» рассказали в пресс-службе Сбера.

Модель состоит из двух модулей — для видео и звука. Звуковой модуль обучили более чем на 20 млн видео со звуком. Команда отбирала ролики только с чистым звуком, а также видео, где говорящие сняты крупным планом — для точной синхронизации речи и мимики.

Изображение сгенерировано нейросетью

Изображение сгенерировано нейросетью

Чтобы получить ролик с озвучкой, достаточно описать сцену текстом или загрузить первый кадр и добавить описание звукового ряда. Максимальная длительность видео со звуком — пять секунд, со временем разработчики планируют ее увеличить.

Модель одновременно «видит» и «слышит» то, что генерирует, поэтому диалоги, эффекты и музыка синхронизированы с картинкой, а губы героя двигаются вместе с речью. Если звук не нужен, можно попросить нейросеть создать видео без него. Когда модель не знает, как выглядит объект из запроса, она ищет референсы и генерирует точный результат, утверждают разработчики.

Конец новости

#Деньги

Почти все россияне считают важным умение обращаться с деньгами

Почти все россияне считают важным умение обращаться с деньгами

#Тренды

Что читают про вампиров: топ-5 книг сентября 2026 года

Что читают про вампиров: топ-5 книг сентября 2026 года

#ИИ

ИИ усложнил старт карьеры для почти половины молодых россиян

ИИ усложнил старт карьеры для почти половины молодых россиян

#ИИ

Каждый второй россиянин ест в одиночестве ежедневно

Каждый второй россиянин ест в одиночестве ежедневно

#ИИ

Зарубежные нейросети тратят больше токенов на русский текст, чем на английский

Зарубежные нейросети тратят больше токенов на русский текст, чем на английский

#Жизнь

Ученые и компании поборются за премию в сфере ИИ

Ученые и компании поборются за премию в сфере ИИ