Сбер представил нейросеть Kandinsky Video — первую в России генеративную модель для создания полноценных видеороликов по текстовому описанию. Нейросеть может создавать компактные 8-секундные видеоролики с частотой 30 кадров в секунду. Об этом в ходе международной конференции AI Journey рассказал первый заместитель Председателя Правления Сбербанка Александр Ведяхин.
Архитектура Kandinsky Video состоит из двух ключевых блоков. Первый отвечает за создание ключевых кадров, из которых складывается структура сюжета видео. Второй занимается генерацией интерполяционных кадров, которые позволяют достичь плавности движений в финальном видео. В основе двух блоков лежит новая модель синтеза изображений по текстовым описаниям Kandinsky 3.0.
Формат сгенерированного видео представляет собой непрерывную сцену с движением как объекта, так и фона. Именно это отличает видеоролики, синтезированные моделью Kandinsky Video, от анимационных видеороликов, в которых динамика достигается за счёт моделирования пролёта камеры относительно статичной сцены. Нейросеть создаёт видеоролики с разрешением 512 х 512 пикселей и различным соотношением сторон. Модель обучена на датасете из более чем 300 тыс. пар «текст — видео». Генерация одного видео занимает до трёх минут.
«Недавно мы обучили Kandinsky создавать анимационные видео по текстовому описанию, а уже сегодня представляем модель совершенно другого уровня — первую в России модель по генерации полноценных видеороликов по тексту. Это важный вклад в развитие российских генеративных нейросетей. У пользователей появится ещё больше возможностей для креатива и реализации своих творческих задумок любой направленности. Люди смогут создавать уникальные видеоролики абсолютно бесплатно. Наша модель, как и большинство других в линейке Сбера, будет доступна в open source. Мы верим, что искусственный интеллект сможет открыть перед людьми новые супервозможности и создать инструменты, которыми они будут пользоваться для решения своих задач», - рассказал первый заместитель Председателя Правления Сбербанка Александр Ведяхин.
Ранее у активных пользователей Kandinsky 2.2 в тестовом режиме появилась возможность создания анимационных видеороликов. По одному запросу можно создать видео длиной в четыре секунды с выбранным эффектом анимации, с частотой 24 кадра в секунду и разрешением 640 х 640 пикселей. Пользователи нейросети Kandinsky 3.0 также могут создавать видеоролики по текстовому описанию в режиме анимации.
Оценить возможности нейросети Kandinsky Video можно на платформе fusionbrain.ai и в Telegram-боте, где есть возможность оставить заявку на доступ.
Нейросеть разработали и обучили исследователи Sber AI при партнёрской поддержке учёных из Института искусственного интеллекта AIRI на объединённом датасете Sber AI и компании SberDevices. В апреле 2023 года сервис на базе нейросети Kandinsky 2.1, стал самым быстрорастущим в мире. Он набрал один миллион уникальных пользователей всего за четыре дня после выхода.
Реклама. ПАО СБЕРБАНК. ИНН 7707083893