Похоже, Hunyuan Prism наконец ВЫШЕЛ официально. Раньше модель обсуждали с подозрением: некоторые считали её фейком, а демонстрационные видео связывали со StableAvatar. Теперь у Tencent появились публичные репозитории с кодом и весами.
Проект называется Prism: Dynamic Sparse Attention for Native 2K Joint Video-Audio Generation Model Training. Уже по названию понятно главное: авторы используют динамическое разреженное внимание и обучают модель сразу на видео и звуке. Заявленный режим — нативное разрешение 2K.
Код опубликован в официальном GitHub-репозитории Tencent-Hunyuan/Prism. Он указывает на ту же модель в Hugging Face — FrancisRing/Prism. А ролики, которые раньше приписывали StableAvatar, теперь ведут на примеры Prism вместе с промптами. Это как раз тот нежданчик, после которого старые споры получили нормальное подтверждение.
Пока в открытом материале нет данных о требованиях к железу, способе запуска или лицензии. Но для создателей видео уже есть что проверить: Prism претендует на генерацию изображения и звука в одном пайплайне, причём сразу в 2K. Думаю, дальше начнут появляться реальные тесты, а не только красивые демо.
Главное
- Tencent опубликовала код Hunyuan Prism в официальном GitHub-репозитории
- Веса модели доступны на Hugging Face в репозитории FrancisRing/Prism
- Prism совместно генерирует видео и звук в нативном 2K
- В основе — Dynamic Sparse Attention, динамическое разреженное внимание
- Опубликованные ролики и промпты теперь указаны как примеры Prism, а не StableAvatar
- Требования к запуску и лицензия в исходном материале не раскрыты
ИсточникReddit: AI-видео и картинки

