В коротком мультфильме трое братьев спускаются по склону. Уже на раскадровке ИИ путал их рост: старший мог оказаться ниже младшего. Помогла таблица с точными значениями — 140, 123 и 105 см, которую прикладывали к каждому кадру с персонажами.

Кадр анимации «下り坂»: трое детей идут по улице на закате, как в короткой истории, созданной с помощью MiniMax.Источник: note.com

Дети снова и снова выходили четырёхголовыми, так что пропорции исправляли программно, а потом чистили шею. При анимации герои бодро шагали на месте: автор задал одинаковые первый и последний кадры, и модель послушно замкнула движение. В другом эпизоде руки не замирали, а менялись местами — зрителю казалось, что махание прервалось.

Ошибки продолжились в сценах на склоне. Старший шёл задом наперёд из-за неверно определённого наклона, а в сцене с перспективой то превращался в крошечного человечка у стены, то бежал над головой младшего. Авторы измерили точку схода по сетке и переставили героя. На монтаже добавили проверку стыков: если разница между концом одного кадра и началом следующего слишком велика, сборка останавливается. Иначе брат успевал телепортироваться за 0,1 секунды.

В итоге собрали 17 версий. Музыка, написанная руководителем FUTAMI, неожиданно совпала с кадрами: слова о беге, повороте и контровом свете легли на сцену с братом на склоне. Для утреннего окна автор синтезировал чириканье воробьёв из коротких звуков частотой 3–5 кГц и звуки далёкой машины. Думаю, главный вывод для продолжения — заранее обучить LoRA на персонажах: это может помочь удержать их лица и внешний вид. Но одних изображений с позой стоя мало, нужны разные положения, а обучение займёт GPU.

Главное

  • Таблица роста помогла удержать разницу между братьями: 140, 123 и 105 см.
  • Сцены и стыки приходилось проверять вручную и программно — иначе появлялись подмена рук и телепортация.
  • Музыкальные строки совпали с действиями в кадре; звуки птиц синтезировали, когда готовых материалов не было.
  • Для продолжения автор планирует обучить LoRA на персонажах, но для этого нужны изображения в разных позах и свободный GPU.

Источникnote #動画生成AI