В японском дайджесте за 5 октября сразу несколько новостей, которые хочется поставить в очередь на тесты. Fizgig 7 обучает свои LoRA и полноценные модели на доступных видеокартах, Prism открывает путь к видео со звуком в разрешении до 2K, а HyperFrames Studio сажает человека и AI-агента за одну таймлайн-дорожку.
Остальные пункты тоже пригодятся: Kandinsky 6.0 Lite генерирует короткие ролики с аудио, Qwen Image 2.1 получил несколько стилистических LoRA, а ComfyUI оброс инструментами для MiniMax H3, inpainting и контроля очереди. Ниже — то, что реально может поменять рабочий процесс креатора.
AI-видео и LoRA: что даёт Fizgig 7
Fizgig 7 — бесплатный open source-инструмент для обучения и настройки моделей генерации изображений и видео. Всё делается через графический интерфейс: можно собрать LoRA, сравнить результаты, изучить готовый адаптер, поправить параметры и подключить итог в ComfyUI.
Главное обновление — Anima и SDXL. Сейчас рабочая среда поддерживает шесть моделей: Flux 2 Klein 9B, Krea 2, MiniMax H3, Qwen Image 2.1, SDXL и Anima. Для каждой доступен полный fine-tuning, то есть дообучение самой модели, а не отдельного небольшого файла.
По данным ComfyUI Wiki, Anima и SDXL можно обучать от 8 ГБ VRAM. Для остальных моделей ориентир начинается с 12–16 ГБ. На видеокарте побольше модель можно обучать целиком за один проход, а не частями. Авторы сообщили об ускорении примерно в 2,6 раза в своих тестах.
У SDXL есть ещё один практичный момент. Fizgig принимает любой однофайловый SDXL-чекпоинт, а Juggernaut XL v9 выбран загрузкой по умолчанию. Рядом предлагается Illustrious XL. Можно тренировать LoRA, LoKR, slider LoRA и делать fine-tuning. Поддерживаются сторонние SDXL LoRA, включая kohya-файлы, LoCon, Lightning и LCM.
После обучения всей модели адаптер можно извлечь отдельным файлом. Для команды это удобно: тяжёлый результат не нужно таскать целиком, достаточно передать LoRA и подключить её в ComfyUI.
Сценарий для креатора простой: собрать датасет персонажа или визуального стиля, прогнать несколько настроек, выбрать устойчивую версию и использовать её в обычном пайплайне. Модели больше не придётся каждый раз объяснять, какой у вас герой, логотип или цветокор.
Есть и задел на будущее. В проекте опубликована система драйверов и инструкция для добавления новых или старых моделей. Поддержка теперь может появляться силами сообщества: кто-то добавит собственный драйвер, а fine-tuning подключат позже.
Prism и 2K-видео со звуком без грубой силы
Prism — открытый фреймворк Tencent Hunyuan, Fudan University и Zhejiang University. Он предназначен для обучения моделей, которые одновременно генерируют видео и аудио. В preview-версии заявлена работа с 720p, 1080p и 2K.
Проблема здесь в размере картинки и количестве данных. Видеомодель обрабатывает множество фрагментов каждого кадра, а звук добавляет ещё один поток. Если сравнивать каждый фрагмент со всеми остальными, вычисления быстро становятся слишком дорогими.
Prism использует динамическое разреженное Attention. Проще говоря, модель старается тратить вычисления там, где меняется сцена или где звук связан с конкретным объектом. Тихий фон и повторяющиеся области получают меньше внимания.
В техническом описании говорится примерно о 2,5-кратном ускорении обучения относительно обычного Attention и улучшении качества генерации. Это пока заявление авторов, а не независимый бенчмарк. Но направление интересное: нативный 2K со звуком становится задачей оптимизации, а не соревнованием «у кого больше видеопамяти».
Для небольших рекламных сцен, музыкальных перебивок и атмосферных шотов это уже можно пробовать. В сериальном производстве пока важнее стабильность персонажа, движения и звука на длинной дистанции. С этим ещё придётся повозиться.
HyperFrames Studio: агент собирает, человек правит
HyperFrames Studio от HeyGen закрывает другую боль. AI-агент может собрать видео по описанию, но человек часто получает результат по схеме «попросил — подождал — снова попросил». Здесь агент и пользователь работают в одном проекте и видят одну таймлайн-дорожку.
Официальная формулировка HyperFrames звучит так: «Describe it, your agent builds, then you both work on the same timeline». В переводе: опишите ролик, агент соберёт его, а потом вы вместе продолжите работу на одной таймлайн-дорожке.
Объект можно обвести прямо в превью или оставить комментарий на нужном кадре. Агент получает конкретную область и момент, а не абстрактное «сделай лучше». Текст, цвет, шрифт и изображения меняются кликом. Готовый проект можно снова вызвать промптом и продолжить с того же места.
Внутри не закрытый бинарный файл, а HTML, CSS, медиафайлы и анимации с перемоткой. Локальный рендер выдаёт детерминированный MP4. Проект можно отслеживать через Git, продолжать из CLI или передавать другому агенту.
Для креатора это компромисс между шаблоном и генерацией. Агент быстро собирает черновик, человек отвечает за ритм, композицию и финальные правки. Если ролики у вас повторяются по структуре, такой подход может оказаться удобнее бесконечной пересборки монтажа в чате.
Что ещё забрать в локальный пайплайн
Kandinsky 6.0 Lite 5s Diffusers — облегчённая модель примерно на 3 млрд параметров. Она делает около пяти секунд видео из текста или референсной картинки и сразу добавляет звук. В официальном примере используются 864×480, 24 fps и 50 шагов. Картинку можно взять первым кадром, а затем попросить модель продолжить движение. Отдельный super-resolution-модуль поднимает результат до 1920×1080.
Для MiniMax H3 появился Veda-MiniMax-H3. Это вспомогательная модель, которая старается заранее определить около 10% важных связей Attention и не считать остальные 90%. В сравнении на RTX 4090 авторы показали примерно 2,8-кратное ускорение одного шага при генерации 14,4-секундного ролика. Работает вместе с H3, Turbo и стилевыми LoRA.
В ComfyUI появился отдельный MiniMax H3 Studio: генерация из текста, стартового и финального кадров, картинок, видео и аудио. Куски можно переставлять, пересобирать и объединять в ролик до 60 секунд. Встроенный редактор умеет обрезку, текстовые и графические слои, цвет, громкость и переходы.
Для Qwen Image 2.1 японский авторский дайджест отдельно отмечает три LoRA. QwenImage2.1-2anime переводит фото в аниме-стилистику: trigger word — 2anime, сила 1, 8 шагов и CFG 1. Homebrew-Qwen-Image-2.1-Y2K имитирует ранние цифровые камеры: вспышка, приглушённые цвета и мягкая детализация, trigger — y2kphoto, в примерах 40 шагов. Casual Phone Photo Style LoRA даёт вид обычного снимка на смартфон, trigger — lbxstyle, стартовая сила 0,8.
Ещё один полезный костыль — Fast inpaint with cropping. Он вырезает из изображения область ремонта, обрабатывает её и возвращает на прежнее место. Для лица, рук, одежды и мелких объектов это снижает время и расход VRAM. Версия для FLUX.2 Klein работает примерно с 512×512, вариант для Qwen Image 2.1 — с 768×768 и 25 шагами.
fibo-scene-analyzer от BRIA AI пригодится перед генерацией. Модель анализирует изображение и возвращает структурированное описание, RGB-цвета, bounding boxes, позу человека, маски и OCR в JSON. Её можно использовать, чтобы разобрать референс на сцену, объекты и координаты, а потом передать эти данные на следующий этап пайплайна.
Как применить это креатору уже сейчас
Я бы шёл не от названий, а от задачи.
1. Нужен стабильный персонаж или фирменный стиль — ставьте Fizgig 7 и начинайте с LoRA для SDXL, Anima или Qwen Image 2.1. Сначала проверьте маленький датасет, потом переходите к fine-tuning. Готовый адаптер переносите в ComfyUI.
2. Нужен короткий ролик со звуком — тестируйте Kandinsky 6.0 Lite 5s Diffusers. Если есть мощная карта и желание разбираться глубже, смотрите в сторону Prism и MiniMax H3. Сразу сравнивайте картинку с синхронизацией действия и звука.
3. Нужны десятки вариаций рекламного ролика — попробуйте HyperFrames Studio. Пусть агент соберёт структуру, а вы правьте таймлайн, отдельные кадры и текст. Храните проект в Git: так проще найти версию, которая съела удачную сцену.
4. Нужна локальная ретушь — не гоняйте всю картинку через модель. Используйте Fast inpaint with cropping, а для анализа референса подключайте fibo-scene-analyzer.
Есть важный подвох. Почти все цифры ускорения в этом наборе — заявления разработчиков или отдельные пользовательские тесты. 2,5 раза у Prism, 2,8 раза у Veda и 2,6 раза у Fizgig нельзя складывать в одну магическую формулу. Железо, разрешение, sampler, шаги и конкретный workflow меняют результат.
Кстати, в том же японском списке есть QuantUI-rs для квантования safetensors в INT8, FP8, MXFP8, NVFP4 и GGUF, ComfyQueueBar для управления очередью ComfyUI из меню macOS, а также ComfyUI-Qwen-Watermark для поиска и локального удаления логотипов, надписей, мозаики и стикеров через Qwen3-VL, SAM и Qwen Image 2.1.
Схемы для ComfyUI и AI-видео собираю в Workflow
Источники
Fizgig v7: Anima, SDXL and Fine-Tuning for Every Model
Tencent Hunyuan open-sources Prism
Understanding Prism: Dynamic Sparse Attention for Joint Video-Audio Generation
HeyGen's HyperFrames adds a shared timeline for AI-made video
Источникnote.com
