
Сбер выпустил нейросеть Kandinsky 6.0 Video, которая умеет генерировать короткие видео со звуком.
Она может создавать речь, музыку и окружающие шумы. Kandinsky стала первой российской ИИ-моделью, умеющей делать ролики с синхронным звучанием, рассказали Т—Ж в пресс-службе компании.
Kandinsky 6.0 Video доступна бесплатно в «Гигачате». Достаточно текстом описать сцену или загрузить первый кадр, а затем дать характеристику нужного звука.
Звук генерируется вместе с картинкой, а не отдельно. Kandinsky 6.0 Video — мультимодальная модель, она одновременно «видит» и «слышит» то, что создает. Поэтому диалоги, эффекты и музыка синхронизированы с изображением, а губы героя двигаются в такт речи. Качество звука — 44 кГц.
Ролики только короткие — до пяти секунд. Это максимальная длительность видео со звуком, но со временем разработчики обещают ее увеличить. Доступные разрешения — SD, HD или Full HD.
Модель стала точнее передавать физику реального мира. Движения людей, животных и предметов выглядят естественнее. Заметнее всего это в динамичных видео, говорят в Сбере. В случае если модель не знает, как выглядит объект из запроса, она ищет референсы и достраивает результат.
У Kandinsky 6.0 Video есть две версии: Lite на 3 млрд параметров и Pro на 29 млрд. Pro выдает картинку лучше, но генерирует заметно дольше: на видеокарте RTX 4090 процесс в SD у Lite занимает около 437 секунд, у Pro — 936. Какая именно версия работает в «Гигачате», не уточняется. Переключения между ними нет.
Нейросеть обучали более чем на 20 млн видео со звуком. По данным Сбера, версия Kandinsky 6.0 Video Pro в 71% случаев обходит прошлую Kandinsky 5.0 и опережает открытую модель LTX-2.5. А в задаче оживления изображения она даже лучше закрытой Veo 3.1 Fast от Google.
Для разработчиков модель выложили в опенсорс. Kandinsky 6.0 Video доступна под лицензией MIT — нейросеть можно бесплатно и без ограничений внедрять в свои продукты.
Мы постим кружочки, красивые карточки и новости о технологиях и поп-культуре в нашем телеграм-канале. Подписывайтесь, там классно: @t_technocult





















