Как я генерировал песни в нейросетях, чтобы попасть в чарты

Эксперимент читателя
Обсудить
Как я генерировал песни в нейросетях, чтобы попасть в чарты
Аватар автора

Николай Гичко

записал с ИИ пару бэнгеров

Страница автора

ИИ-треки сейчас звучат повсюду и даже попадают в музыкальные чарты.

На первый взгляд кажется, что повторить это просто. Я подумал, что тоже так смогу, и решил сгенерировать пару песен, достойных хит-парадов.

Я подошел к эксперименту системно. Мне было важно не просто рассказать, как сочинять ИИ-треки, но и поделиться своими секретами по созданию нейромузыки, а также предостеречь читателей от частых ошибок.

Рассказываю, получилось ли у меня стать ИИ-композитором.

Выбор нейросетей

Я не профессионал в сфере музыки, но считаю себя знатоком работы с искусственным интеллектом. Применяю его всегда: когда делаю дизайн будущего дома, пишу рабочие электронные письма или составляю отчеты.

Для эксперимента я взял три сервиса — Suno, Luvi и Udio. У каждого интуитивно понятный интерфейс и возможность бесплатного тестирования. Нейросети позволяют создавать песни со своим текстом, генерировать треки по описанию.

Suno. Очень популярный сервис для генерации музыки с вокалом — понимает русский язык, позволяет задавать структуру песни и быстро выдает результат.

На бесплатном тарифе дают 50 кредитов в день — их хватает примерно на десять композиций. Даже если бы я захотел, купить дополнительные кредиты у меня бы не получилось: сервис не принимает оплату из России.

Udio. Нейронка дает большой контроль над звуком: можно регулировать чистоту инструментов, силу следования промпту и даже точное время появления слов. Генерация одного трека стоит два кредита, бесплатно дают десять в день. Как и Suno, сервис не принимает российские карты.

Luvi. Специализируется на русском языке, ставит правильные ударения в словах и добавляет естественные интонации. Первые две песни с двумя вариантами аранжировок можно создать бесплатно. Мне этого количества не хватило, поэтому я купил самый дешевый пакет кредитов за 790 ₽.

Обычно о сервисах для создания песен рассказывают на примере простого сценария: мол, вводишь пару слов про стиль и настроение — и получаешь готовый трек.

Этого хватит для первого знакомства с платформами, но настоящий хит так не напишешь. Даже если отдельные фрагменты звучат хорошо, вместе они могут не складываться в единую композицию. Чтобы получить нужный результат, потребуется подготовка.

Работа с текстом песни

Одна из главных «болячек» в генерации треков — это текст. У меня ни разу не получилось добиться хорошего результата: то рифма хромала, то появлялись неподходящие слова, то терялась мысль. В одной из моих первых генераций Suno выдала припев, где рифмовались «облака» и «потолка», а смысл пропал уже к третьей строчке.

Для себя я нашел простой выход — готовить текст заранее, дорабатывать его вручную и только потом загружать в нейронку.

Написать слова для трека можно в генераторе песен, многие сервисы позволяют это сделать. Другой вариант — использовать текстовые нейросети вроде ChatGPT или Deepseek.

Следующий этап — доработка текста. Важно проследить за смыслом, убрать лишние слова или заменить их на подходящие и отредактировать строчки.

При первой генерации нейросеть выдала мне такой текст:

«Танцуй до утра»

Куплет 1:
Зажглись лампы в ночной тиши,
Я слышу ритм внутри себя.
Сотри все границы с души,
Здесь только музыка и я.

Твой взгляд искрится очень ярко,
Как свет далеких городов.
И знаю, будет ночь жарка,
Я для тебя на все готов!

Припев:
В ритме ночи кружимся мы весело с тобой,
Свет стирает границы теней.
Мы летим над шумной толпой,
Нет пути назад, нет преград, нет цепей.

Может показаться, что в тексте нет ошибок, но если присмотреться, найдется несколько недочетов. Я заменил «лампы» на «огни», изменил словосочетание «ночь жарка» и сократил первую строчку припева.

Я постарался, чтобы текст был простым, ритмичным и с повторяющимся припевом — ровно то, что обычно звучит в клубах и на радио.

Переделанный и итоговый вариант текста, на основе которого я буду создавать треки:

«Танцуй до утра»

Куплет 1:
Зажглись огни в ночной тиши,
Я слышу ритм внутри себя.
Сотри все границы с души,
Здесь только музыка и я.

Твой взгляд искрится очень ярко,
Как свет далеких городов.
И знаю, будет ночью жарко,
Я для тебя на все готов!

Припев:
В ритме ночи кружим с тобой,
Свет стирает границы теней.
Мы летим над шумной толпой,
Нет пути назад, нет преград, нет цепей.

Создание промпта для музыки

Еще один важный шаг до начала работы с нейросетями — это составление промпта и описание стиля.

В ИИ-сервисах для генерации музыки есть встроенные шаблоны. Я протестировал многие из них — они отлично работают и позволяют создавать стильные и гармоничные треки. Можно воспользоваться ими, но результат иногда не подходит для конкретной задачи.

Собственный промпт поможет добиться нужной атмосферы, тональности и ритма.

Хороший запрос для музыкального генератора должен включать целый набор параметров: темп, тональность, голос, инструменты, структуру песни и даже пожелания по динамике. Без такого уровня детализации результат становится лотереей.

Для теста я выбрал два жанра: энергичный поп-трек и инструментальная композиция для фонового звучания.

Промпт для энергичного поп-трека

Энергичный поп-трек в темпе 120 ударов в минуту. Тональность — соль минор. Мужской вокал, яркий, с уверенной подачей, без излишней обработки. Инструменты: синтезаторный бас, электронные ударные с плотным бочком и хэтом, ритмическая гитара с овердрайвом, синтезаторные пады на припеве, короткое соло на синтезаторе в бридже. Не добавлять акустических инструментов, не замедлять темп, не делать пауз длиннее 2 секунд.

Промпт для инструментальной композиции для фонового звучания

Инструментальная фоновая композиция. Спокойная, камерная, без резких изменений. Темп медленный. Фортепиано и струнные — основные инструменты, синтезатор с мягким падом добавляет воздушность. Без ударных, без вокала. Настроение — уютное, слегка меланхоличное, подходящее для работы или чтения. Длительность — около 3 минут.

Мои критерии оценивания результата

Я старался не судить о сервисах субъективно, поэтому выделил объективные критерии.

Качество звука. Важно, чтобы трек не был слишком «нейросетевым»: голос не должен звучать роботизированно, инструменты — слишком гладко, а переходы — неестественно.

Качество исполнения. Нужно, чтобы слова песни были отчетливо слышны, а ударения стояли на своих местах.

Структура композиции. Нейросеть должна понимать логику песни: где куплет, припев, бридж или инструментальный проигрыш.

Интерфейс сервиса Luvi
Интерфейс сервиса Luvi

Связность стиля. Важно, чтобы настроение, инструменты и характер вокала не менялись по ходу трека.

Практичность. Отдельно смотрел, можно ли использовать генерацию как референс для дальнейшей работы.

Я покажу не только хорошие результаты, но и неудачные треки, чтобы не сложилось впечатление, будто нейросети делают все правильно и с первого раза. Это совсем не так.

Как нейросети сгенерировали песни по одному и тому же промпту

Для теста я взял слова песни «Танцуй до утра» — моего поп-хита для дискотек. Промпт тоже дал одинаковый — «для энергичного поп-трека».

Suno. Сервис сделал насыщенный и драматичный трек — с богатыми интонациями и яркими эмоциями.

Нейросеть сгенерировала еще один трек для сравнения.

В обеих версиях вокал звучит эмоционально, слышно много инструментов, а динамика трека меняется от куплета к припеву.

Но при этом Suno допустила ошибку в тексте: в одном слове ударение попало не на тот слог: «границы́». Это распространенная проблема при работе с русским языком в зарубежных сервисах.

Luvi. Сервис выдал два варианта — обе песни показались мне похожими. Вот одна из них.

Вокал звучит уверенно, ударения правильные, интонации естественные. Инструменты хорошо сбалансированы, а текст воспринимается без усилий. Трек близок к «живому» исполнению.

При этом аранжировка получилась весьма простой — без дополнительных деталей, которые могли бы сделать трек интереснее. Еще мне не понравилось, что трек звучит несовременно — будто ему не хватает актуальных битов и ярких хуков. Хотя на волне популярности дискотек девяностых и нулевых песня наверняка найдет своего слушателя.

Чтобы получить более драйвовое и актуальное звучание, я попробовал сгенерировать трек в другом стиле — progressive house. Промпт и описание стиля нашел в шаблонах сервиса.

Вариант звучит интереснее, но заметна «иишность», особенно на высоких и громких нотах. На тихих и средних вокал звучит вполне естественно — мягко, с правильными интонациями и ударениями. Но как только трек становится громче, голос будто уплощается.

Udio. Этому треку хочется подпевать, но сделать это вряд ли получится. Нейросеть с русским языком справилась плохо.

Появился акцент, а в конце песни слова вообще смазались. Кроме того, нейросеть создала песню в виде дуэта: добавился женский вокал, хотя такой задачи в промпте не было.

Эксперименты с генерацией трека без слов

Я решил оценить, как сервисы генерируют только музыку — без слов. Для этого использовал мой «промпт для инструментальной композиции для фонового звучания».

Suno. Получилась нежный и камерный трек. Немного скучный по звучанию, хотя это только мое мнение.

Luvi. ИИ-сервис сгенерировал плавную лирическую мелодию — без неожиданных переходов и внезапных обрывов. Она хорошо бы подошла для романтического видео.

Udio. Результат получился минорным, более грустным, чем предыдущие варианты, но вполне мелодичным.

Второй вариант трека не соответствовал запросу. Темп увеличился, и композиция из спокойной превратилась в быструю.

Ошибки нейросетей при работе с музыкой

Не все генерации получались удачными. Чаще всего нейросети ошибались там, где музыка зависит не только от стиля, но и от языка, проставленных ударений в тексте, структуры и баланса инструментов.

Нейросеть путает ударения и произношение. Ошибка чаще всего встречалась в Suno и Udio. Сервисы могли правильно прочитать текст, но сделать ударение не на тот слог. Udio спела песню с акцентом, а некоторые слова было сложно разобрать.

Интерфейс сервиса Suno
Интерфейс сервиса Suno

Голос звучал роботизированно. Иногда нейросеть не могла сделать естественный вокал: голос был слишком ровным, без эмоций и нюансов — это сразу выдавало ИИ-происхождение трека. Особенно это заметно на громких и высоких нотах.

Нейросеть добавляла детали, которых не было в промпте. Иногда ИИ-сервисы могут импровизировать — изменять темп и добавлять инструменты.

Что у нейросетей получается лучше всего

После тестов стало понятно, что сделать полноценный хит с помощью нейросетей у меня вряд ли получится. До профессиональных песен нам с ИИ еще далеко. Возможно, в руках композитора такие сервисы смогли бы выдать более качественный результат.

Нейросети уже помогают услышать разные направления, сравнить стили и понять, какие решения стоит развивать дальше.

Создавать простые композиции для друзей, праздников или поздравлений. Пожалуй, это самый удачный сценарий использования музыкальных нейросетей, который я проверил на практике.

Suno справилась с задачей за две минуты и придумала сразу несколько вариантов поздравления для мамы. Мне кажется, все они звучат немного драматично и не совсем подходят для праздника.

Затем я попробовал сделать музыкальное поздравление в Luvi. Сервис выдал понятный, естественный вокал с правильными ударениями, а шаблонные стили — акустическая баллада, поп или легкий рок — хорошо подошли для таких задач.

Трек звучит искренне, хотя и без сложных музыкальных ходов. Но для поздравления сложность и не нужна — важнее настроение. Самый приятный отклик, который я получил после такого подарка, — «Это было очень здорово! Мне раньше никогда не посвящали песни!». Еще сервис позволяет отправить песню в виде электронной открытки.

Udio на русском языке с текстом поздравления справилась хуже: появился акцент, и слова местами смазывались.

Главный плюс сценария — скорость и простота. Не нужно быть композитором, чтобы порадовать близких. Достаточно ввести текст и выбрать стиль, а нейросеть сделает остальное.

Делать фоновые треки без слов для видео и соцсетей. Тут нейросети показали себя с лучшей стороны. Инструментальные композиции получались ровными, атмосферными и не отвлекали внимание от основного контента. Это идеальный вариант для подкастов, обзоров, коротких роликов, презентаций и фонового сопровождения на сайте.

Главное преимущество — отсутствие текста. Нет риска, что нейросеть ошибется в ударениях, исказит слова или сделает неверный акцент.

Еще один плюс — возможность задать нужную длительность: от 15 секунд до трех минут. В Suno и Luvi это регулируется через структуру промпта, в Udio — через настройки времени. Правда, бесплатные версии ограничивают длительность, но для небольших проектов этого достаточно.

Генерировать черновики для профессиональных треков. Сценарий будет полезен для тех, кто работает с музыкой серьезно. Нейросеть не заменяет композитора, но становится отличным помощником на этапе идеи.

Вместо того чтобы сидеть за инструментом и подбирать аккорды часами, можно за пару минут получить несколько вариантов аранжировки, услышать, как звучит мелодия в разных стилях, и выбрать направление для дальнейшей работы.

В Suno черновики получились насыщенными — хорошая основа для доработки. В Luvi песни были самыми «чистыми» с точки зрения вокала и текста. В Udio треки отличались качеством звука — их можно было брать за основу для финальной версии, особенно на английском языке.

Интерфейс сервиса Udio
Интерфейс сервиса Udio

Главное здесь — скорость. Музыканту не нужно тратить дни на поиск подходящего звучания. Можно сгенерировать 10—20 вариантов за один вечер, выбрать парочку наиболее удачных и уже с ними идти в студию или к аранжировщику.

Важно помнить: даже самый удачный трек, созданный нейросетью, требует доработки. Сервис дает идею и настроение, но финальное качество — это всегда ручная работа.

Экспериментировать и работать с нестандартными жанрами. Нейросети способны смешивать жанры и создавать нечто необычное. Например, я экспериментировал с «инди-роком с восточными мотивами» — результат был сыроватым, но идея четко прослеживалась.

Это полезно, когда вы ищете новое звучание, но не знаете, как его описать. Даже если трек не становится финальным, он может вдохновить на новые идеи.

Помогать преодолевать творческий кризис. Выделю пункт отдельно. Нейросеть работает как генератор случайных идей.

Вы загружаете текст, выбираете случайный стиль и слушаете, что получилось. Иногда результат удивляет — появляется ритмический рисунок, который вы не рассматривали раньше.

Однажды в Suno я сгенерировал трек в стиле, который обычно не слушаю, и услышал интересную последовательность, которую потом использовал в другой композиции.

Что делать с ИИ-песнями — вопрос авторских прав

Главные вопросы после генерации трека — можно ли его использовать и кому он принадлежит. Короткий ответ — ИИ-песней можно свободно распоряжаться в некоммерческих целях.

Если же вы планируете использовать трек для заработка, стоит изучить пользовательское соглашение сервиса, в котором он был сгенерирован:

  1. Suno открывает коммерческое использование только на платных тарифах.
  2. Luvi разрешает использовать созданные треки в личных некоммерческих целях.
  3. Udio требует указывать источник в бесплатных аккаунтах.

Все платформы строго запрещают клонировать голоса известных артистов и загружать чужие тексты.

Бесплатные генерации подходят для некоммерческого использования — поздравлений, личных видео и рабочих черновиков. Для коммерческих задач стоит подключить платный тариф и сохранять все материалы по созданию трека — от промптов до финальной версии.

Если планируется выходить на стриминги или использовать ИИ-песню в рекламе, лучше заранее проконсультироваться с юристом.

Итоги — стоит ли использовать нейросети для музыки

После тестов я понял, что не стоит ждать от нейросети готового трека. Она полезна на более раннем этапе — когда точного решения еще нет, но уже хочется понять, в каком направлении двигаться дальше.

Иногда генерация сразу дает удачную идею — мелодию припева, сочетание голоса и фортепиано, динамику куплета или ритм бриджа. Иногда, наоборот, помогает быстро отбросить лишнее. По звучанию сразу слышно, что перегруженная аранжировка мешает вокалу, а неправильное ударение ломает смысл текста.

После генерации все равно начинается обычная музыкальная работа.

Даже удачный трек нужно проверять по структуре: совпадает ли куплет с припевом, логичен ли бридж. Кроме того, красивая генерация может показать удачное сочетание голоса и струнных, но не объяснит, как свести это в студии.

Считаю, что с задачей создать хит при помощи нейросетей я не справился. Но искусственный интеллект развивается, а я набираюсь опыта. Так что, возможно, мои генерации еще попадут на верхние строчки хит-парадов.

Мы постим кружочки, красивые карточки и новости о технологиях и поп-культуре в нашем телеграм-канале. Подписывайтесь, там классно: @t_technocult

РедакцияГенерировали музыку в нейросетях? Поделитесь опытом:
    Вот что еще мы писали по этой теме
    Сообщество