Проект Google Magenta, который реализуется компактной, но высокоэффективной группой исследователей искусственного интеллекта в рамках масштабных вычислительных систем, представил музыкантам инновационный инструментарий для создания музыкальных произведений — NSynth. Данный проект является частью подразделения Google Brain — ключевой лаборатории компании по разработке технологий ИИ. В структуре этой организации специалисты исследуют пределы возможностей нейронных сетей и иных методов машинного обучения. Нейронные сети, представляющие собой сложные математические системы для решения задач и анализа массивов данных, в последние годы стали основополагающей технологией в области распознавания объектов и лиц на изображениях, а также в сфере автоматического перевода текстов между языками.
Теперь команда Magneta переворачивает эту идею с ног на голову, используя нейронные сети как способ обучения машин новым видам музыки и других искусств. На первом этапе NSynth работает с большой базой данных звуков. Джесси Энгель (Jesse Engle), один из сотрудников Magneta, и его команда собрали широкий диапазон нот примерно из тысячи разных инструментов, от скрипки до балафона, а затем предоставили свои наработки нейронной сети.
В отличие от традиционного синтезатора, который генерирует звук из осцилляторов и таблиц сэмплов, NSynth использует глубокую нейронную сеть для генерации звуков на уровне отдельных образцов. Инструмент предоставляет музыкантам интуитивный контроль тембра, динамики, а также возможность изучать и исследовать новые звуки, которые трудно или невозможно извлечь из обычного синтезатора.
Анализируя ноты, нейронная сеть изучила звуковые характеристики каждого инструмента, а затем создала математический «вектор» для каждого из них. Используя эти векторы, машина может имитировать звучание каждого инструмента, например, органа Хаммонда или клавикорда, и при этом может сочетать звуки этих двух инструментов.
Это не похоже на игру двух инструментов одновременно: машина и ее программное обеспечение не наслаивают звуки клавикорда на орган Хаммонда. Они производят совершенно новые звуки, используя математические характеристики нот, которые появляются из двух инструментов. Исследователи могут повторить это со всеми остальными инструментами, создавая бесчисленное количество новых звуков из тех, что у нас уже есть, благодаря искусственному интеллекту.
NSynth позволяет исследователям явно факторизировать генерацию музыки в ноты другие музыкальные качества. Они могли бы и далее факторизировать эти качества, но для простоты этого не сделали и получили следующее:

Целью является модель P (audio | note), известная как тембр, и предполагается, что P (note) получается из высокого уровня «языковой модели» музыки, такой как последовательность нейронов в рекурентной нейронной сети (RNN). И хотя разработчики признают, что схема не является идеальной, факторизация основана на том, как работают инструменты, и на удивление эффективна. Действительно, многие современные музыкальные произведения реализуют такую факторизацию, используя MIDI для последовательности нот и программные синтезаторы для тембра.
В создании инструмента команда Google использовала разработку своего автономного подразделения DeepMind — WaveNet. Эта система представляет собой авторегрессионную сеть расширенных сверток, которая моделирует звук по одному образцу за один раз, подобно нелинейному бесконечному импульсному фильтру.
Поскольку контекст этого фильтра в настоящее время органичен несколькими тысячами выборок (около половины секунды), долгосрочная структура требует направляющего внешнего сигнала. В своей работе команда Magneta устранила необходимость в обработке внешних сигналов с помощью автокодировщика, основанного на WaveNet.

Критик Марк Вейденбаум (Marc Weidenbaum) отмечает, что подход не очень далек от того, что делали оркестровые дирижеры на протяжении веков: смешение инструментов не является чем-то новым. Но он считает, что технология Google может дать вторую жизнь многовековой практике и подтолкнуть ее в новом направлении развития. «В искусстве это может принести некоторые интересные вещи, и поскольку это Google, люди последуют за ней», — говорит Вейденбаум.
Джесси Энгель продемонстрировал работу машины: «играл» на инструменте, который находится между клавикордом и органом Хаммонда. Затем он перетаскивал ползунок на экране своего ноутбука. И если в первом случае можно было услышать только 15% от клавикорда, то теперь он был ближе к 75%. Затем Энгель перетаскивал ползунок туда-обратно так быстро, как только мог, «перемешивая» звуки двух совершенно разных инструментов.
В дополнение к слайдеру NSynth, который демонстрировал Энгель, команда также создала двумерный интерфейс, который позволяет одновременно исследовать звуковое пространство между четырьмя различными инструментами. Исследователи намерены продолжить работу над этой идеей, исследуя границы художественного творчества. Например, вторая нейронная сеть могла бы изучить новые способы имитации и комбинирования звуков со всех этих инструментов — ИИ мог бы работать в тандеме с еще одним ИИ.
В Google Magneta также создала новую площадку для исследователей ИИ и других компьютерных специалистов. Уже опубликована исследовательская работа, описывающая алгоритмы NSynth, и каждый может загрузить и использовать свою базу данных звуков. Дуглас Эк (Douglas Eck), курирующий команду Magneta, надеется, что исследователи смогут создать гораздо более широкий набор инструментов для любых артистов, не только для музыкантов.
Для любознательных
В России и в мире есть несколько заметных проектов, где искусственный интеллект действительно научился имитировать и комбинировать звуки музыкальных инструментов. Вот основные имена и инициативы — с акцентом на то, как именно ИИ работает со звуком.
🔹 В России
- Сколтех (Skoltech)
Учёные из Сколтеха совместно с немецкими коллегами разработали ИИ, способный «дирижировать» воспроизведением классической музыки с помощью голоса, жестов и мимики.- Система анализирует ноты и предсказывает, как играть: темп, громкость, длительность нот.
- Пользователь может, например, с помощью движений руки «замедлить» оркестр или «усилить» струнные — всё в реальном времени.
- Используется GPT-3 для распознавания инструкций и другие модели для анализа эмоций.
- Есть мобильное приложение для управления музыкой онлайн.
- Яндекс (проекты Алексея Тихонова и Ивана Ямщикова)
Эти разработчики создали нейросеть, которая сначала писала стихи в стиле Егора Летова, а затем — музыку в стиле Александра Скрябина.- Нейросеть генерирует оригинальные композиции, имитируя стиль композитора.
- Музыку исполнил настоящий камерный ансамбль, включая терменвокс — это показывает, насколько качественной может быть ИИ-музыка.
- Проект стал частью альбома «Нейронная оборона».
- Mubert
Российский стартап, специализирующийся на генерации электронной музыки в реальном времени.- ИИ создаёт бесконечные треки под заданный жанр (техно, лоу-фай, амбиент и др.).
- Может вставлять вокальные фразы, имитируя живого исполнителя.
- Используется как фон для стримов, подкастов, медитаций.
🔹 В мире
- Google Brain — проект Magenta
Это один из самых известных ИИ-проектов в музыке.- NSynth (Neural Synthesizer) — ключевая разработка. Он обучается на звуках реальных инструментов и умеет создавать новые гибридные тембры. Например, скрестить звук пианино и виолончели.
- Magenta.js — библиотека, позволяющая создавать музыку прямо в браузере с помощью ИИ.
- Всё открытое, доступно для разработчиков и музыкантов.
- Aiva Technologies (Люксембург)
- Aiva — первый в мире ИИ, которому присвоен статус официального композитора.
- Обучен на тысячах классических произведений (Бах, Бетховен, Шостакович).
- Пишет музыку для фильмов, рекламы, видеоигр.
- Его треки звучат как настоящие симфонические композиции.
- Jukedeck (Великобритания, поглощён TikTok)
- Создавал саундтреки под видео.
- Пользователь выбирает жанр, настроение, длительность — и ИИ генерирует трек.
- Использовался Coca-Cola, Google и другими крупными компаниями.
- Amper Music (США)
- Основан музыкантами, а не программистами — поэтому звучит очень «по-человечески».
- Позволяет создавать музыку с выбором инструментов, темпа, структуры.
- Широко применяется в медиа и образовании.
- Sony CSL — Flow Machines
- ИИ обучен на базе данных из десятков тысяч песен.
- Может писать музыку в стиле The Beatles, Баха или Майлза Дэйвиса.
- Один из треков, «Daddy’s Car», звучит как настоящая песня The Beatles.
🔹 Что умеет такой ИИ?
- Имитировать инструменты: распознаёт и воспроизводит тембр скрипки, фортепиано, саксофона и др.
- Смешивать звуки: создаёт новые, ранее не существовавшие тембры.
- Генерировать музыку в реальном времени: например, Mubert или Magenta.
- Реагировать на жесты и голос: как в проекте Сколтеха.
- Сочинять в стиле конкретных композиторов: Aiva, Flow Machines.
Автор: Анастасия Краснянская @krasandm
Источник: https://habr.com/

