МТС остается лидером по числу коммерческих внедрений сетей Private LTE/5G
17:05
Судебные приставы вернули муниципалитету самовольно занятые земли в Якутске
17:00
Яндекс Книги проведет литературный квиз на фестивале "ЛиТР" во Владивостоке
16:45
Китайские авто меняют рынок Владивостока — за логистикой перестраивается система платежей
16:40
Пользователи ГигаЧата теперь могут создавать видео со звуком
16:25
Ко Дню народного единства военнослужащие из Якутии получат продуктовые наборы 
16:00
Якутия полностью обеспечена собственными семенами зерновых
15:30
Предложения по развитию Дальнего Востока представила в Совфеде губернатор ЕАО Мария Костюк
15:00
В Якутске стартовали гастроли Донецкого молодежного театра
14:40
Выездные сессии форума "Литературные мосты: навстречу друг другу" пройдут в Чанчуне (КНР) 12-13 октября
14:25
Прокуратура добилась выплаты добровольцам отряда "БАРС" в Якутии
14:20
Жители Верхоянского района Якутии получили выплаты после паводка
13:50
Агентная экономика изменит взаимодействие людей с государственными сервисами
13:45
Итоги сентября: ажиотажный спрос на "Семейную ипотеку" и рекордные выдачи базовых программ
13:40
Посольство США рекомендовало американцам покинуть Россию на фоне ситуации в Приангарье
13:30

Пользователи ГигаЧата теперь могут создавать видео со звуком

С нейросетью Сбера Kandinsky 6.0 Video любой может создавать видео со звуком — специальные навыки не нужны
Пользователи ГигаЧата теперь могут создавать видео со звуком Предоставлено банком
Пользователи ГигаЧата теперь могут создавать видео со звуком
Фото: Предоставлено банком
Нашли опечатку?
Ctrl+Enter

Пользователи ГигаЧата (12+) могут создавать видео с речью, музыкой и звуками окружения — в Full HD-качестве и полностью бесплатно. Это стало возможно благодаря новой модели Kandinsky 6.0 Video (12+), которая генерирует ролики с синхронным звуком. Чтобы получить готовый ролик с озвучкой, достаточно описать сцену текстом или загрузить первый кадр и добавить описание звукового ряда. Максимальная длительность ролика со звуком — пять секунд, со временем разработчики планируют её увеличить. Кроме того, модель стала лучше передавать физику реального мира: движения людей, животных и техники в роликах выглядят естественнее и правдоподобнее. Kandinsky стал первой российской нейросетью, способной создавать видео с синхронным звуком, сообщает пресс-служба Сбера.

"Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона. Любой человек получает возможность снимать более выразительные личные видео. А для профессионального контента это означает более быстрое и выгодное производство. Модель Kandinsky 6.0 Video мы отдаём разработчикам бесплатно и без ограничений — строить на ней свои сервисы может каждый", — сказал старший вице-президент, руководитель блока "Развитие генеративного ИИ" Сбербанка Антон Фролов.

Возможности модели

Kandinsky 6.0 Video — мультимодальная модель, которая одновременно "видит" и "слышит" то, что генерирует. Поэтому диалоги, эффекты и фоновая музыка синхронизированы с картинкой, а губы героя движутся вместе с речью. Если звук не нужен, можно попросить нейросеть создать видео без него. Когда модель не знает, как выглядит объект из запроса, например, новый персонаж поп-культуры, она ищет референсы и генерирует точный результат. Так можно создавать даже те объекты, которые появились уже после обучения модели.

Kandinsky создаёт натуральный звук в широком диапазоне: от разговора и цифровых эффектов до шагов, шума ветра или звука проезжающей машины. В одном ролике можно разыграть диалог, добавить музыку — от "испанской гитары" до "саундтрека к погоне", "лоу-фая для сонного вечера" или любой другой. Модель создает чистый и детализированный звук, без "шипения" и потери качества: в 44 кГц, стандартном качестве большинства стриминговых сервисов.

Эти возможности пригодятся для самых разных задач: с их помощью можно оживить семейную фотографию, записать видеооткрытку с речью или музыкой для близкого человека, снять ASMR-ролик с шелестом бумаги, потрескиванием дров или скрипом снега, или оживить старый мем или кадр из фильма.

Разработчикам новая модель доступна в опенсорсе под лицензией MIT — её можно бесплатно интегрировать в собственные продукты. Модель также будет доступна в популярных инструментах для запуска и интеграции нейросетей, например, FAL (18+), Diffusers (18+), FastVideo (18+), ComfyUI (18+), SGLang (18+) и vLLM-omni (18+). Разработчикам не нужно писать интеграцию с нуля: Kandinsky 6.0 Video можно подключить прямо в существующий продукт.

Качество видео

Kandinsky 6.0 Video создаёт ролики в разрешении до Full HD. В ГигаЧате пользователи смогут выбрать нужное качество прямо в окне ввода перед отправкой запроса: SD для более быстрой генерации, HD или Full HD для более чёткой и детализированной картинки. Kandinsky 6.0 Video точнее передаёт физику реального мира. Движения людей, животных и предметов в роликах выглядят естественнее, а сцены целиком — правдоподобнее. Это особенно заметно в динамичных роликах с быстрым движением или сменой ракурса.

Обновление будет полезно всем, кто создаёт видео — в профессиональных и личных проектах:

● Авторам контента для соцсетей: создать короткий ролик с озвученной репликой персонажа или фоновым звуком без микрофона, актёров и монтажа звука.

● Малому бизнесу: сделать голосовой рекламный ролик о товаре или услуге без съёмочной группы.

● Маркетологам и SMM-специалистам: собрать тестовый ролик с диалогом и фирменной атмосферой — звуком окружения и музыкальной подложкой — для соцсетей и мессенджеров.

● Преподавателям: оживить архивное фото или портрет исторической личности с озвученной репликой — для урока истории или литературы.

● Дизайнерам: собрать черновой ролик со звуком для питча или демонстрации идеи.

Как обучали модель

Kandinsky 6.0 Video состоит из двух связанных модулей, которые отвечают за создание видео и звука. Звуковой модуль обучен более чем на 20 млн разнообразных видео со звуком. Для обучения команда отбирала ролики только с чистым, качественным звуком, а также видео с говорящими людьми крупным планом для более точной синхронизации речи и мимики.

В Kandinsky 6.0 Video Pro (18+) качество генерации значительно выросло в общем визуальном качестве, следовании промпту и движении камеры. Новая модель лучше Kandinsky 5.0 (12+) в среднем в 71% случаев по всем критериям, также уверенно обходит открытую LTX 2.5 (12+). Кроме того, в задаче оживления изображения превосходит и ведущую закрытую модель Veo 3.1 Fast (12+) — по визуальному качеству, соответствию исходному изображению и движению камеры.

Пользователи ГигаЧата теперь могут создавать видео со звуком

Пользователи ГигаЧата теперь могут создавать видео со звуком. Фото: Предоставлено банком

Реклама. Рекламодатель — ПАО "Сбербанк" (ОГРН 1027700132195. Юридический адрес: Москва, ул. Вавилова, 19).

190699
55
74
Опрос: Бурый медведь: как найти баланс между безопасностью людей и сохранением природы?