Японский автор на note.com собрал конвейер для подкаста. Почти вся техническая возня спрятана внутри одного приложения: Irodori-TTS локально озвучивает реплики, HeyGen API делает липсинк по блокам, а на выходе получается видео с двумя говорящими персонажами.

Связка закрывает знакомую проблему диалоговых роликов. Мужская и женская речь сразу попадают на разные дорожки, поэтому автору не приходится потом выковыривать голоса из общего аудиофайла. Для формата с двумя AI-аватарами это заметно экономит время.

Обложка подкаста с двумя ведущими в наушниках и микрофонами; надпись связывает выпуск с Irodori-TTS, HeyGen API и автоматическим липсинком.Источник: note.com

Irodori-TTS и HeyGen API работают с отдельными репликами

Автор давно хотел делать подкастовые видео с Эрикой и Kenny. Когда две роли записаны одним аудиофайлом, перед липсинком приходится разделять мужской и женский голос. Каждый выпуск быстро превращается в ручной монтаж.

Irodori-TTS привлёк автора локальной японской TTS-моделью. Синтез речи идёт на собственном компьютере. По его впечатлению, японская речь звучит очень естественно. Оценка субъективная, но именно она подтолкнула к эксперименту.

Первый сюрприз — ограничение. За один запуск модель генерирует примерно до 30 секунд аудио. Десятиминутный сценарий целиком в неё не отправить.

Диалог удобно собирать короткими блоками. Kenny говорит, затем отвечает Эрика, потом снова Kenny. Обычно одна реплика укладывается в 20–30 секунд.

«Сначала я подумал, что для длинных видео модель не подойдёт. Но если собирать выпуск из отдельных реплик, ограничение в 30 секунд перестаёт быть проблемой» — автор исходного материала.

Для каждого блока создаются две синхронные дорожки. В мужской остаётся голос Kenny, а реплики Эрики заменяются тишиной. В женской дорожке происходит обратное. Длина и тайминг файлов совпадают, поэтому разводить голоса на следующем этапе уже не нужно.

Затем каждую дорожку отправляют в HeyGen для генерации видео с движением губ. Готовые блоки склеивают и размещают двух персонажей на общем фоне. Автор отдельно отмечает: в начале ролика Эрика и Kenny заметно расходятся по липсинку, зато к финалу синхронизация выглядит гораздо лучше.

Что важно знать о локальном японском TTS

По материалам японских обзоров, Irodori-TTS опубликован Aratako под MIT-лицензией. Синтез идёт локально: после настройки текст и аудио не обязаны уходить на внешний сервер, а число генераций не зависит от тарифа облачного сервиса.