Главный козырь Stable Audio 3.0 — лицензии крупных лейблов
Stability AI привлекла $76 млн от Sony, Universal, Warner и EA, а затем выпустила Stable Audio 3.0. Три модели можно запускать локально, а Medium генерирует инструментальные треки до 6 минут 20 секунд.
·5 мин чтения·SAMI
Stability AI решила вернуться в большую игру через музыку. Компания привлекла $76 млн от Sony Music Group, Universal Music Group, Warner Music Group и Electronic Arts. Общий объём привлечённых средств достиг $232 млн. В корейском AIPOST это называют превращением бывшего проблемного стартапа в нового игрока музыкального AI.
На этом фоне вышел Stable Audio 3.0 — семейство из четырёх моделей для музыки и звуковых эффектов. Главная цифра — 380 секунд, или 6 минут 20 секунд. Меня больше цепляет другая часть релиза: лицензированные обучающие данные, открытые веса и понятное разделение между локальным запуском, API и enterprise-доступом.
«Мы признаём, что прежний подход с несанкционированным использованием не привёл к хорошему результату. Теперь хотим менять музыкальную индустрию, соблюдая правила», — заявили руководители Stability AI.
Почему Stable Audio 3.0 начинается с лицензий
Вокруг генеративной музыки давно идёт неприятная возня. Модель может звучать отлично, а потом возникает вопрос: на каких треках её учили и можно ли использовать результат в рекламе, ролике клиента или коммерческой игре.
По данным корейского материала и официальным объяснениям Stability AI, Stable Audio 3.0 обучали на лицензированной и Creative Commons-музыке. Sony, Universal и Warner вложились в раунд и предоставили свои каталоги для обучения по официальным соглашениям.
Это не закрывает все юридические вопросы вокруг сгенерированного трека. Зато компания заранее разбирается с происхождением обучающих данных, вместо того чтобы ждать первого иска.
В совет директоров также вошли режиссёр Джеймс Кэмерон, сооснователь Napster Шон Паркер и сооснователь Coatue Томас Лафонт. Паркер в интервью The Information описал новую стратегию проще: на этот раз компания играет по правилам.
«Пока другие технологические компании гонятся за бесцельным универсальным AI, Stability AI создаёт специализированные инструменты, которых хотят реальные артисты и правообладатели», — объяснил Томас Лафонт.
Что умеют четыре модели Stable Audio 3.0
Stable Audio 3.0 — это семейство из четырёх моделей. У каждой свои задачи и требования к железу.
• Small SFX — лёгкая модель для звуковых эффектов. Подходит для мобильных устройств и обычных ноутбуков.
• Small, или Small-Music — компактная генерация музыки. Обе малые модели могут работать на CPU, без отдельной видеокарты.
• Medium — основной вариант для длинных инструментальных треков. Максимальная длина — 380 секунд, а пиковое потребление памяти оценивается примерно в 6,52 ГБ VRAM.
• Large — флагман для студий и платформ с высокими требованиями к громкости и задержке. Открытых весов нет: доступ идёт через API или enterprise-лицензию.
Новости и фишки про искусственный интеллект
Разбираю их в Telegram-канале: что вышло, как работает и стоит ли вашего времени.
Разница с прошлым поколением заметная. В материалах о Stable Audio 3.0 потолок Stable Audio 2.5 оценивается примерно в 190 секунд. Теперь можно получить почти полноценный инструментальный кусок для сцены, без короткой циклической подложки.
Архитектуру компания описывает как новую систему с semantic-acoustic autoencoder. Если убрать исследовательский туман, модель старается удерживать музыкальную структуру и качество самого звука. Для монтажёра это важнее красивого названия: трек должен не рассыпаться через минуту.
Как применить Stable Audio 3.0 в видеопроизводстве
Для креатора Stable Audio 3.0 выглядит отдельным инструментом в пайплайне. Suno и Udio сильнее, когда нужен законченный трек с вокалом. Stable Audio 3.0 рассчитан на инструментальную музыку, атмосферу и SFX.
Я бы разложил работу так:
1. Для коротких эффектов берите Small SFX. Это звук пролета камеры, удар, шорох ткани, механический щелчок или атмосферный слой.
2. Для фоновой музыки на ноутбуке начинайте со Small-Music. Он рассчитан на офлайн-запуск и не требует GPU.
3. Если нужен длинный трек под ролик, используйте Medium. 6 минут 20 секунд хватает для рекламного видео, короткого документального фрагмента или заставки без циклической склейки.
4. Подгоняйте готовый материал через extension и audio inpainting. Inpainting — это перегенерация выбранного участка, а не всего файла целиком.
5. Если проект живёт в ComfyUI, можно собирать генерацию рядом с визуальным пайплайном. Поддержка Stable Audio 3.0 появилась в ComfyUI в день релиза.
Пример запроса можно держать максимально прикладным: «instrumental cinematic tension, low strings, restrained percussion, slow pulse, no vocals, space for dialogue, gradual build, dark but not horror, 92 BPM». Сначала задаём функцию музыки в сцене. Потом жанр, инструменты и темп. Запрос «красивая музыка» часто даёт приятный, но бесполезный результат.
Отдельный сценарий — записать собственную мелодию голосом или набить ритм битбоксом. Такую функцию обещают добавить позже. По словам Шона Паркера, пользователь сможет направлять генерацию напевом или ритмом, а система будет переводить это в инструментальную сессию.
Где Stable Audio 3.0 ломается
Главное ограничение простое: вокала нет. Модель не рассчитана на полноценную песню с текстом и певцом. Для K-pop-демо, поп-припева или трека с вокальной партией придётся смотреть в сторону Suno или Udio.
Второе ограничение связано с длиной. Максимум 380 секунд относится к Medium. Small и Small SFX нужны для более лёгких задач, Large не скачивается как открытая модель.
Третье — лицензии. Small SFX, Small и Medium опубликованы на Hugging Face под Stability AI Community License. Коммерческое использование разрешено компаниям с годовой выручкой до $1 млн, включая распространение продукта или сервиса через API. При этом нужно соблюдать условия лицензии и атрибуцию.
Для компаний с выручкой выше $1 млн предусмотрен enterprise-вариант. Он может включать юридическое возмещение, indemnification, то есть договорное покрытие части рисков со стороны Stability AI. Такая защита относится к Enterprise, а не к обычному локальному запуску с Community License.
Цены за API в доступных материалах не опубликованы, поэтому придумывать тарифы не буду. Открытые модели можно запускать локально бесплатно, но придётся потратиться на железо, время настройки и поддержку окружения.
Локально или через API — что выбрать креатору
Если вы делаете ролики сами и не строите музыкальный сервис, начинать логичнее с Small или Medium локально. Small работает на CPU. Medium требует около 6,5 ГБ VRAM и поэтому помещается на одной потребительской видеокарте среднего уровня.
Локальный запуск даёт контроль над исходниками и не отправляет аудио на внешний сервер. Минус понятный: придётся поставить зависимости, скачать веса, разобраться с ComfyUI или другим интерфейсом и принять скорость своей машины.
API удобнее, если генерация встроена в ваш продукт. Официальный пример Stability AI показывает, что Medium может вернуть 380 секунд аудио за 1,31 секунды на H200. Это ориентир серверного сценария, а не обещание такой же скорости на домашней видеокарте.
Для стартапа с музыкальным редактором или видеосервисом важен ещё один пункт: лицензия допускает распространение генерации через приложение или hosted API при соблюдении условий. Крупному бизнесу уже нужно отдельно обсуждать enterprise-договор и юридическое покрытие.
Что это меняет для русскоязычных креаторов
Раньше AI-музыку часто выбирали по одному критерию: хорошо ли она звучит. Теперь в рабочем продакшне появляется второй фильтр — можно ли доказать происхождение инструмента и условия коммерческого использования.
Stable Audio 3.0 интересен связкой: длинные инструментальные треки, локальные открытые веса, обработка отдельных фрагментов и лицензированное обучение. Получается конкретный слой для видео, игр, рекламы и саунд-дизайна.
Обещание «нулевого риска» я бы не переносил в договор с клиентом без проверки. Нужно смотреть актуальную Community License, сохранять версию модели и фиксировать использованный режим — локальный, API или Enterprise. Юридическая чистота обучающих данных не отменяет остальных вопросов к конкретному проекту.
Шесть минут — приятная цифра. Для бизнеса важнее другое: кто отвечает за права, где лежит модель и можно ли встроить её в реальный монтажный процесс.
Начинаю смотреть на Stable Audio 3.0 как на рабочий генератор подложек и эффектов, рассчитанный на визуальные задачи. Сервисы с вокалом остаются в другой категории. Для креаторов это даже удобно: меньше обещаний сделать хит, больше контроля над тем, что нужно кадру.