Обычный image-to-video сам выбирает движение кадра. В InSpatio-World 1.5 вы задаёте маршрут камеры численно, а модель достраивает пространство за краем исходного фото. Японский автор погонял её на RTX 4090. Заодно выяснил, сколько занимает рендер и сколько памяти уходит на запуск.

«Камера, которая сделала снимок, начинает двигаться вперёд» — так автор описывает результат. Он загрузил две свои фотографии, менял траектории и добавил примеры из комплекта модели. Всего получилось 12 роликов. Это подробный опыт одного пользователя на конкретной видеокарте.

Видео: inspatio.github.io

Как камера выходит за границы фото

Модель рассчитана на съёмочные задачи: наезд, боковой проезд, облёт объекта. Автор задаёт координаты движения камеры и получает управляемый маршрут. Такой подход пригодится для превиза, аниматика или движения по статичному фону.

Кадр с футуристичным садом и водоёмом из материала об InSpatio-World 1.5.Источник: inspatio.com

В японском тесте камера проходит мимо книги и кружки. Часть корешка и боковая поверхность кружки в исходном кадре не видны, зато появляются в поздних кадрах. Фото не содержит этих деталей: модель правдоподобно придумывает их по ходу движения.

Работа проходит в два этапа. Сначала модель оценивает глубину и проецирует пиксели исходника в новую позицию камеры. На изображении остаются пустые области — поверхности, которых раньше не было видно. Затем видеомодель получает проекцию и маску пропусков, перерисовывает кадры и заполняет пустоты.

Официальная страница проекта описывает работу с одиночным изображением, набором кадров, панорамой и видео. В локальном запуске, согласно японскому разбору, доступны одиночное фото, четыре изображения и видео. Возможности браузерной демонстрации и локального скрипта здесь различаются.

Что показал тест на RTX 4090

Автор проверял ролики одного формата: 141 кадр при 15 кадрах в секунду, примерно 9,4 секунды видео. Генерация занимала от 38 до 39,5 секунды. Время почти не менялось: ни при переходе от одного фото к четырём, ни при смене траектории.

Компьютер обрабатывал ролик примерно в четыре раза дольше его длительности. Для 9,4 секунды видео рендер шёл около 39 секунд. В названии статьи на arXiv модель представлена как real-time 4D simulator, но в локальном тесте на RTX 4090 скорость до реального воспроизведения не дотягивала. Здесь стоит разделять идею модели и скорость конкретной конфигурации.

PyTorch резервировал до 8,44 ГБ VRAM. Общая загрузка видеокарты поднималась примерно до 23,3 ГБ, хотя около 14 ГБ в тот момент занимали другие процессы. Для владельцев RTX 4090 это хороший знак: сама модель не забрала всю память. По одному такому замеру нельзя заключить, что она запустится на любой карте с 8 ГБ без компромиссов.

Два запуска с одинаковым seed дали MP4-файлы с одинаковым SHA256. Выход совпал побитно. Это удобно для сравнений: меняете одну настройку — например, маршрут камеры — и смотрите, что именно изменилось.

Как использовать модель и что проверить перед запуском

Я бы начал с кадра, где глубина читается сразу: есть передний план, фон и понятные границы предметов. На коротком наезде или небольшом боковом проезде модели проще сохранить сцену. Чем дальше камера уходит за объект, тем больше новых пикселей ей приходится придумывать.

Сначала выберите ключевой кадр и решите, что должен увидеть зритель. Потом задайте траекторию и проверьте умеренный проезд. Если геометрия держится, движение можно усилить. В продуктовых кадрах отдельно проверьте логотипы, надписи и форму товара: модель сама достраивает невидимые поверхности.

Японский автор запускал проект на Windows через venv — отдельное окружение Python. Официальный путь через conda он не использовал. Во время запуска возникла ошибка, связанная именно с Windows. В предоставленном материале её решение не описано, поэтому обещать простую установку не буду. В стороннем обзоре AICrier среди требований репозитория указаны Python 3.10, CUDA 12.6, веса Depth Anything 3 и заданные пользователем траектории для видео. Перед установкой сверьте версии с текущей документацией.

В тесте дополнительные загрузки заняли 30,003 ГБ. Основной чекпойнт на Hugging Face — один файл размером 5,68 ГБ. Учитывайте и веса, и зависимости с моделями глубины: локальный эксперимент займёт место на диске и время на настройку.

Открытый код и лицензии весов

Здесь легко пропустить важный нюанс. Код опубликован под Apache-2.0, и базовая Wan2.1-T2V-1.3B тоже использует Apache-2.0. Для оценки глубины нужна Depth Anything 3 с весами CC BY-NC 4.0, которая ограничивает коммерческое использование. У весов InSpatio-World 1.5 на Hugging Face, по проверке автора, на тот момент лицензия не была указана. Карточка модели оставалась пустой.

Автор заменил модель глубины на аналог с Apache-2.0 и проверил, что такой вариант запускается. Название альтернативы в материале не приведено — подставлять его догадкой не буду. Перед коммерческим запуском нужно проверить лицензии всех компонентов и прояснить условия для весов InSpatio-World. Одного открытого репозитория для этого недостаточно.

Официальная страница проекта заявляет первое место среди методов реального времени в WorldScore-Dynamic. Это утверждение авторов проекта. В описанном локальном тесте ролик рендерился заметно дольше, чем шёл бы при воспроизведении. Для творческой работы сейчас важнее возможность задать движение камеры и проверить его на своём кадре.

Короче, InSpatio-World 1.5 подходит для управляемого превиза: задаёте маршрут и смотрите, как модель продолжает сцену. Начните с короткого проезда, оцените дорисованные поверхности, а перед коммерческим использованием проверьте лицензии всех компонентов.

Мои тесты моделей и видео — в разделе работ

Источники

InSpatio-World 1.5 — Beyond the Frame, Into the World

InSpatio-World 1.5 Brings Scene Roaming

Источникnote.com