Похоже, Hunyuan Prism наконец ВЫШЕЛ официально. Раньше модель обсуждали с подозрением: некоторые считали её фейком, а демонстрационные видео связывали со StableAvatar. Теперь у Tencent появились публичные репозитории с кодом и весами.

Проект называется Prism: Dynamic Sparse Attention for Native 2K Joint Video-Audio Generation Model Training. Уже по названию понятно главное: авторы используют динамическое разреженное внимание и обучают модель сразу на видео и звуке. Заявленный режим — нативное разрешение 2K.

Код опубликован в официальном GitHub-репозитории Tencent-Hunyuan/Prism. Он указывает на ту же модель в Hugging Face — FrancisRing/Prism. А ролики, которые раньше приписывали StableAvatar, теперь ведут на примеры Prism вместе с промптами. Это как раз тот нежданчик, после которого старые споры получили нормальное подтверждение.

Пока в открытом материале нет данных о требованиях к железу, способе запуска или лицензии. Но для создателей видео уже есть что проверить: Prism претендует на генерацию изображения и звука в одном пайплайне, причём сразу в 2K. Думаю, дальше начнут появляться реальные тесты, а не только красивые демо.

Главное

  • Tencent опубликовала код Hunyuan Prism в официальном GitHub-репозитории
  • Веса модели доступны на Hugging Face в репозитории FrancisRing/Prism
  • Prism совместно генерирует видео и звук в нативном 2K
  • В основе — Dynamic Sparse Attention, динамическое разреженное внимание
  • Опубликованные ролики и промпты теперь указаны как примеры Prism, а не StableAvatar
  • Требования к запуску и лицензия в исходном материале не раскрыты
Видео: cdn-uploads.huggingface.co · русские субтитры — перевод SAMI

ИсточникReddit: AI-видео и картинки