Sopro V2 Turbo 2610 получил промежуточное обновление после отзывов пользователей. Главный фокус — клонированные голоса: разработчик уменьшил шероховатость и срывы на тех примерах, где прошлая версия звучала грязно или разваливалась. Качество стало ровнее, хотя модель пока не идеальна.

Архитектура и скорость не изменились. Внутри всё те же 120M параметров, а первый звук на процессоре ноутбука появляется примерно через 300 мс. По заявлению автора, генерация идёт примерно в пять раз быстрее реального времени. Тут интересен и настоящий стриминг — аудио можно получать по мере генерации, а не ждать весь файл целиком.

Сейчас Sopro поддерживает английский, европейский португальский, французский и немецкий. Другие языки планируют добавить позже, как и дополнительные настройки управления сгенерированным голосом. Модель распространяется под Apache-2.0, поэтому её можно запускать локально и встраивать в свои проекты.

Ограничения тоже на месте. Sopro всё ещё хуже справляется с очень высокими и мультяшными голосами, шумными референсами и необычными голосами, которых не было в обучающих данных. Для локального запуска разработчик предлагает команду `uvx --from sopro soprotts serve`; есть также браузерное демо для десктопа и Space на Hugging Face. Думаю, для тех, кому нужен F5-TTS-подобный сценарий, но без тяжёлой модели и с работой на CPU, версия выглядит прям интересно.

Главное

  • - Клонирование голосов стало чище: меньше шероховатости и срывов на проблемных образцах
  • - 120M параметров и около 300 мс до первого звука на CPU ноутбука
  • - Генерация примерно в 5 раз быстрее реального времени, есть настоящий стриминг
  • - Поддерживаются английский, европейский португальский, французский и немецкий
  • - Apache-2.0, локальный запуск через `uvx --from sopro soprotts serve`
  • - Высокие, мультяшные, шумные и необычные голоса всё ещё могут звучать плохо

Источник: Reddit: AI-видео и картинки