Японский автор запустил MiniMax H3 на RTX 3060 Ti с 8 ГБ видеопамяти. На выходе получил ролик 1280×704 примерно на 10 секунд. Генерация заняла 25 минут 17 секунд. Скорость так себе, зато сама планка по железу стала ниже: для такого запуска флагманская видеокарта не нужна.
Самое интересное началось вокруг памяти. RTX 3060 Ti нагрузку выдержала, а Windows, браузер и рабочие приложения начали вылетать, пока модель занимала RAM. GPU терпел. Рабочий компьютер — уже не очень.
MiniMax H3 на RTX 3060 Ti упирается в RAM
Тест провёл японский автор Ито Тайга. Он запускает локальные модели на исследовательском компьютере. До MiniMax H3 уже проверял Qwen-Image-2.1 и Wan 2.2.
Для нового теста Ито выбрал FreeVideo. Это инструмент команды FlashML: он работает как плагин для ComfyUI и как отдельный Windows-лаунчер.
Автор вынес FreeVideo в отдельное окружение. Смешивать эксперимент с рабочей установкой ComfyUI не хотелось — один сломанный воркфлоу легко превращает тест в лишнюю возню.
На компьютере было 16 ГБ RAM. Все 16 ГБ модели не достаются: часть памяти нужна операционной системе, браузеру, ChatGPT, Teams и другим программам.
Во время загрузки модель остановилась примерно на 87%. После повторного запуска одна только подготовка заняла около 1 часа 52 минут. Позже автор написал в X: «Днём экспериментировать нельзя! RAM занята, запускаешь Teams — и уже падает другой процесс».
FreeVideo резервирует 2 GiB под системные нужды. В первом запуске свободной памяти не хватило, поэтому Quick Test не прошёл. После закрытия лишних приложений автор освободил примерно 7,4 ГБ RAM — и повторная попытка завершилась успешно.
Как FreeVideo запускает H3 на слабом железе
MiniMax H3 при этом никуда не уменьшился. FreeVideo использует 8-шаговую версию VDN-H3 с FP8-исполнением. VDN-H3 переработали под более экономную схему внимания. Это отдельный вариант модели, а не исходный плотный H3.
По данным ComfyUI Wiki, FreeVideo запускает подготовленный FP8-релиз vdn-minimax-h3-edge. В нём 50 трансформерных блоков. При старте адаптивный планировщик оценивает свободную VRAM, доступную RAM и attention-ядра, затем распределяет блоки:
