Японский автор на note.com собрал конвейер для подкаста. Почти вся техническая возня спрятана внутри одного приложения: Irodori-TTS локально озвучивает реплики, HeyGen API делает липсинк по блокам, а на выходе получается видео с двумя говорящими персонажами.
Связка закрывает знакомую проблему диалоговых роликов. Мужская и женская речь сразу попадают на разные дорожки, поэтому автору не приходится потом выковыривать голоса из общего аудиофайла. Для формата с двумя AI-аватарами это заметно экономит время.
Irodori-TTS и HeyGen API работают с отдельными репликами
Автор давно хотел делать подкастовые видео с Эрикой и Kenny. Когда две роли записаны одним аудиофайлом, перед липсинком приходится разделять мужской и женский голос. Каждый выпуск быстро превращается в ручной монтаж.
Irodori-TTS привлёк автора локальной японской TTS-моделью. Синтез речи идёт на собственном компьютере. По его впечатлению, японская речь звучит очень естественно. Оценка субъективная, но именно она подтолкнула к эксперименту.
Первый сюрприз — ограничение. За один запуск модель генерирует примерно до 30 секунд аудио. Десятиминутный сценарий целиком в неё не отправить.
Диалог удобно собирать короткими блоками. Kenny говорит, затем отвечает Эрика, потом снова Kenny. Обычно одна реплика укладывается в 20–30 секунд.
«Сначала я подумал, что для длинных видео модель не подойдёт. Но если собирать выпуск из отдельных реплик, ограничение в 30 секунд перестаёт быть проблемой» — автор исходного материала.
Для каждого блока создаются две синхронные дорожки. В мужской остаётся голос Kenny, а реплики Эрики заменяются тишиной. В женской дорожке происходит обратное. Длина и тайминг файлов совпадают, поэтому разводить голоса на следующем этапе уже не нужно.
Затем каждую дорожку отправляют в HeyGen для генерации видео с движением губ. Готовые блоки склеивают и размещают двух персонажей на общем фоне. Автор отдельно отмечает: в начале ролика Эрика и Kenny заметно расходятся по липсинку, зато к финалу синхронизация выглядит гораздо лучше.
Что важно знать о локальном японском TTS
По материалам японских обзоров, Irodori-TTS опубликован Aratako под MIT-лицензией. Синтез идёт локально: после настройки текст и аудио не обязаны уходить на внешний сервер, а число генераций не зависит от тарифа облачного сервиса.
