Японский автор проверил MiniMax H3 на задаче, где модели быстро начинают сыпаться: нужно взять движение из готового видео и перенести его на другого персонажа. В тестах были быстрый танец, две игрушки, пять человек и дальний план с очень активной сценой.

По этим примерам H3 дал картинку приятнее, чем SCAIL2, и выдержал быстрые движения. Полной стабильности всё равно нет. Перекрывающиеся люди ломают обе модели, а маленькие лица быстро теряют детали.

MiniMax H3 и SCAIL2: что сравнивали

Автор вернулся к MiniMax H3 после первого полного MV. Копирование движения он откладывал из-за железа и отсутствия удобной LoRA для ускорения. Теперь собрал конфигурацию в Paperspace и снова взялся за задачу.

После перехода на CUDA 13.0+, INT8-веса и Docker-образ от shiba*2 генерация клипа 1152×768 длиной 6–7 секунд сократилась примерно с 10 минут до 8. Это результат конкретного сетапа, а не обещание для любой видеокарты.

В окружении автора были Paperspace Pro с доступом к GPU, RTX A4000 на 16 ГБ VRAM и 45 ГБ RAM. Для H3 использовались INT8-чекпойнты, Q2_K-энкодер qwen3vl-32B-MiniMax-H3 и turbo-LoRA. Вместе со стандартным VAE они занимают больше 35 ГБ.

4-step LoRA автор отложил: качество показалось слабым. Ref2VA Fast-варианты тоже пока не вошли в рабочий пайплайн. Напоминаю: это сетап одного японского креатора, а не универсальная инструкция по оптимизации.

Что показали тесты копирования движения

Первый момент — быстрый исходник сам по себе не мешает генерации. В одном клипе руки при остановке кадра заметно гуляют, зато в движении артефакты прячутся внутри motion blur. Персонаж сохраняет узнаваемый вид исходной картинки.

В сцене с двумя плюшевыми персонажами SCAIL2 генерировал 448×768, а H3 — 512×768. Обе модели ошибались, когда персонажи пересекались. Японский автор предполагает, что H3 можно дополнительно направить текстом, но эффект ещё нужно проверять.

На сцене с пятью людьми разница заметнее. По наблюдению автора, SCAIL2 копирует движение покадрово и точнее держится за референс. H3 начинает с референсной картинки, а потом подстраивает её под движение видео. Из-за этого у H3 больше свободы и больше шансов на дрейф.

В этом тесте SCAIL2 работал в 768×448, H3 — в 928×512. Лица у обеих моделей размазались. Скорость автор не сравнивал: максимальные размеры генерации различаются.

Самый тяжёлый пример — быстрый полный рост, снятый издалека. На 960×640 шум появляется уже на лице, руках и корпусе. Для практической работы стоит приблизить исходный референс или замедлить его перед подачей в модель.

Как применить MiniMax H3 Ref2VA в своей сцене

Для motion copy логично начать с чекпойнта Ref2VA. В официальном описании H3 этот режим поддерживает до трёх видеоклипов, до девяти изображений и до трёх аудиоклипов — всего не больше 12 файлов. Японский тест проверял перенос движения из видео, поэтому весь набор входов автор не разбирал.