Stability AI решила вернуться в большую игру через музыку. Компания привлекла $76 млн от Sony Music Group, Universal Music Group, Warner Music Group и Electronic Arts. Общий объём привлечённых средств достиг $232 млн. В корейском AIPOST это называют превращением бывшего проблемного стартапа в нового игрока музыкального AI.

На этом фоне вышел Stable Audio 3.0 — семейство из четырёх моделей для музыки и звуковых эффектов. Главная цифра — 380 секунд, или 6 минут 20 секунд. Меня больше цепляет другая часть релиза: лицензированные обучающие данные, открытые веса и понятное разделение между локальным запуском, API и enterprise-доступом.

«Мы признаём, что прежний подход с несанкционированным использованием не привёл к хорошему результату. Теперь хотим менять музыкальную индустрию, соблюдая правила», — заявили руководители Stability AI.

Почему Stable Audio 3.0 начинается с лицензий

Вокруг генеративной музыки давно идёт неприятная возня. Модель может звучать отлично, а потом возникает вопрос: на каких треках её учили и можно ли использовать результат в рекламе, ролике клиента или коммерческой игре.

По данным корейского материала и официальным объяснениям Stability AI, Stable Audio 3.0 обучали на лицензированной и Creative Commons-музыке. Sony, Universal и Warner вложились в раунд и предоставили свои каталоги для обучения по официальным соглашениям.

Это не закрывает все юридические вопросы вокруг сгенерированного трека. Зато компания заранее разбирается с происхождением обучающих данных, вместо того чтобы ждать первого иска.

В совет директоров также вошли режиссёр Джеймс Кэмерон, сооснователь Napster Шон Паркер и сооснователь Coatue Томас Лафонт. Паркер в интервью The Information описал новую стратегию проще: на этот раз компания играет по правилам.

«Пока другие технологические компании гонятся за бесцельным универсальным AI, Stability AI создаёт специализированные инструменты, которых хотят реальные артисты и правообладатели», — объяснил Томас Лафонт.

Что умеют четыре модели Stable Audio 3.0

Stable Audio 3.0 — это семейство из четырёх моделей. У каждой свои задачи и требования к железу.

• Small SFX — лёгкая модель для звуковых эффектов. Подходит для мобильных устройств и обычных ноутбуков. • Small, или Small-Music — компактная генерация музыки. Обе малые модели могут работать на CPU, без отдельной видеокарты. • Medium — основной вариант для длинных инструментальных треков. Максимальная длина — 380 секунд, а пиковое потребление памяти оценивается примерно в 6,52 ГБ VRAM. • Large — флагман для студий и платформ с высокими требованиями к громкости и задержке. Открытых весов нет: доступ идёт через API или enterprise-лицензию.