Локальная генерация видео избавляет от оплаты за каждый дубль. Но за GPU, электричество, настройку и неудачные прогоны всё равно платите вы. В японском обзоре от 5 октября 2026 года сравнили локальные модели, API, сервисы и аренду видеокарт. Мне понравилась сама идея сравнения: считать цену ролика, который можно отдать клиенту, а не одного нажатия кнопки.

«Качество не определяется одним лишь выбором — локальный запуск или облако». Автор японского обзора о генерации видео, перевод с японского.
Интерфейс локальной видеогенерации с узлами настройки и предпросмотром пятиминутного ролика с городским пейзажем.Источник: cdn.runcomfy.net

Генерация видео локально или в облаке: что сравнивать

В облаке проще начать: мощный компьютер заранее собирать не нужно. Обычно вы платите за секунды видео, кредиты или подписку. Часто там уже есть инструменты для звука и редактирования. Но есть лимиты, очереди и зависимость от условий сервиса. Повторные попытки тоже стоят денег.

Локальная модель даёт больше контроля. Можно выбирать веса, LoRA, квантование и шаги генерации. Квантование уменьшает размер модели, чтобы она поместилась в доступную память; иногда это влияет на качество или скорость. Если подходящая GPU у вас уже есть, каждый новый ролик может обходиться недорого. Только «модель бесплатная» значит, что её можно скачать на определённых условиях. Железо, электричество и время на настройку в эту цену не входят.

Есть и средний вариант — арендовать GPU и запускать на ней локальную модель. Покупать видеокарту не придётся, выбор моделей остаётся за вами. Зато нужно настроить окружение, скачать веса и хранить файлы. Платить придётся и за время работы, пока система загружается.

MiniMax H3 и другие модели: цены с контекстом

В обзоре для MiniMax H3 указаны $0,08 за секунду видео в 768p и $0,13 за секунду в 2K. Для H3-Max — $0,05 за секунду в 480p. По этой арифметике пять секунд H3 в 768p стоят $0,40, в 2K — $0,65, а пять секунд H3-Max в 480p — $0,25. Это расчёт по длительности готового видео. Полная цена заказа может быть выше: оплата входных материалов и другие расходы зависят от условий сервиса.

Пять секунд за $0,25 звучат заманчиво, пока не посчитаешь дубли. Если из четырёх роликов в монтаж годится один, цена удачного варианта при тех же расценках вырастет примерно в четыре раза. «Четыре попытки на один результат» в обзоре — условный пример для сравнения, не универсальная статистика.

Цены на LTX-2.5 в разных сравнениях расходятся. Перед расчётом бюджета проверьте актуальный прайс и выбранный режим модели. Веса LTX-2.5 опубликованы на Hugging Face, а условия коммерческого использования зависят от лицензии и масштаба бизнеса. В README сказано, что компании с годовой выручкой менее $10 млн могут использовать модель в коммерческих целях без оплаты. Для клиентской работы всё равно стоит прочитать сам текст лицензии.

С подписками и кредитами та же история. Сто кредитов в одном сервисе не равны ста кредитам в другом. Смотрите, какая модель выбрана, сколько секунд и в каком разрешении она создаёт, за что именно берут деньги и сгорают ли остатки в конце месяца. Японский автор напоминает: бесплатная регистрация ещё не означает, что каждый месяц вам будут давать бесплатные генерации.

Сколько стоит локальная генерация видео на практике

В одном из примеров японского обзора аренда RTX 4090 стоит $0,74 в час. Автор считает: если за час с учётом подготовки сделать десять роликов, на вычисления уйдёт по $0,074 на ролик. При условном курсе ¥150 за доллар это около ¥11. Десять роликов за час — расчётный сценарий, а не измеренный результат. Запуск GPU, загрузка моделей, хранение и неудачные прогоны добавят расходы.

Для собственного компьютера автор приводит ещё один пример. Если вся система в среднем потребляет 0,5 кВт, а электричество стоит ¥31 за кВт·ч, час работы обойдётся примерно в ¥15,5. Это расчёт по заданным условиям, не замер конкретной видеокарты или модели.

Покупку компьютера тоже нужно распределить по сроку использования. При бюджете ¥300 000 и условных трёх годах эксплуатации оборудование обойдётся примерно в ¥8 333 в месяц — без обслуживания и возможной перепродажи. При ста генерациях в месяц это около ¥83 на одну, при тысяче — около ¥8,3. Чем чаще вы генерируете, тем сильнее снижается цена одной попытки. Если задачи редкие, новая GPU может просто лечь в смету тяжёлым кирпичом.

В обзоре есть пример расчёта окупаемости: облачная попытка за ¥75, локальное электричество за ¥4 и компьютер за ¥300 000. Если считать, что качество и доля удачных генераций одинаковы, окупаемость наступит примерно после 4 225 попыток. Это не готовый совет покупать карту. Подставьте свои цены и посчитайте, сколько дублей уходит на один ролик, который можно использовать.

Какие локальные модели смотреть и где быть осторожнее

Для первого сравнения автор предлагает Wan 2.2 TI2V-5B на GPU с 24 ГБ памяти. Среди кандидатов для генерации звука вместе с видео названы MiniMax H3 и LTX-2.5. Для длинных проб на видеокарте с небольшим объёмом памяти в обзоре выделен FramePack. Там же сказано, что FramePack может запускаться с 6 ГБ VRAM на картах RTX 30, 40 и 50 серий. Это данные обзора, а не обещание комфортной скорости на любой сборке.

Количество гигабайт само по себе не подсказывает, насколько хорошо модель сохранит лицо, движение или физику сцены. Одну и ту же модель можно запускать с разным квантованием, разрешением и числом шагов. Поэтому тест на полной версии весов может не повториться на локальной сборке.

Что проверить перед выбором облака или своей GPU

Я бы начал с короткого теста на своём материале. Возьмите одинаковое задание и сравните результат вместе с затратами по всей цепочке:

• Зафиксируйте длительность, разрешение, входные изображения и требования к звуку. • Сделайте несколько генераций в облаке и локально, если у вас есть подходящая GPU. • Запишите время, расходы и число дублей, которые пришлось выбросить. • Разделите стоимость всех генераций на количество роликов, которые пойдут в монтаж. • Для клиентской работы проверьте коммерческую лицензию модели и условия сервиса.

Так вы сравните свою задачу: например, узнаете, сколько стоит получить восемь секунд видео с нужным персонажем и синхронным звуком. Для разовой работы облако часто проще. Если предстоит много итераций, уже имеющееся железо может обойтись дешевле. Покупать GPU я бы стал после собственных замеров — когда станет понятно, сколько дублей на ней удаётся обработать и сколько из них годится в монтаж.

Примеры AI-видео и тесты моделей — в моих работах

Источники

M Plan overview — MiniMax API Docs

LTX-2.5 README — Hugging Face

Источникnote.com