Автор Aikimi Forge Neo добавил в программу Iris-3B и сравнил обычную версию с INT8 и W4A8 на RTX 3090. Для изображения 832×1280 пик выделения CUDA-памяти составил 19,10 GiB у обычной модели, 10,89 GiB у INT8 и 9,71 GiB у W4A8. По умолчанию автор оставил INT8: памяти нужно заметно меньше, а результат в примерах ближе к обычной модели.
Тест провёл японский автор Aikimi. Это замеры на одной видеокарте, не проверка разных конфигураций. Но цифры уже дают ориентир: INT8 выглядит разумным первым выбором, а W4A8 пригодится, когда памяти совсем впритык.
Iris-3B на RTX 3090: что дают INT8 и W4A8
Iris-3B — модель генерации изображений от Sperid Labs. Она работает в пиксельном пространстве и обходится без VAE: строит изображение напрямую, без генерации в сжатом представлении и последующего декодирования. В Aikimi Forge Neo к генерации добавили оценку относительной глубины, восстановление изображений и увеличение разрешения в четыре раза.
В тесте на 1024×1024 обычная версия заняла 18,90 GiB, INT8 — 10,68 GiB, W4A8 — 9,50 GiB. На фотореалистичном изображении один запуск занял 244,0, 244,1 и 213,8 секунды соответственно. На акварельном — 252,1, 254,5 и 225,2 секунды. Это одиночные замеры, а не гарантия такой скорости: автор предупреждает, что на время могли повлиять загрузка и другие процессы.
Версии сравнивали на одинаковых промптах и Seed: 100 Steps, CFG 3, без Negative Prompt. В обычной и INT8-версиях сцены и композиции чаще оставались близкими, хотя отличались детали лица, одежды и зонта. W4A8 сохранял основную сцену, но в примерах сильнее менялись выражения лиц, расположение деталей и композиция. Автор также заметил больше зернистости.
В аниме-примере с девушкой и сакурой все версии сохранили общий стиль и фон. Модель обрезала ступни, хотя в промпте был указан полный рост. Руки в кадре закрыты — качество генерации кистей по этому примеру не оценить. В другой сцене персонаж получился в стиле 2D-аниме, а дождливый Токио — фотореалистичным. Стили разделились, но у зонта и пальцев остались недочёты, как и в совмещении персонажа с фоном.
По этим примерам INT8 ближе к обычной версии. У W4A8 сильнее заметны отличия в деталях и зернистости. Это наблюдения автора по его тестам, а не универсальная оценка качества.
W4A8 экономит память, но меняет детали
В этой реализации INT8 не ускоряет вычисления за счёт целочисленной арифметики. Веса Linear-слоёв хранятся в 8 бит с масштабом для каждой строки, а перед вычислениями возвращаются к BF16. Задача — уменьшить расход памяти. По данным автора, объём весов модели генерации сократился примерно с 11,95 до 3,23 GB.
W4A8 использует упакованные 4-битные веса и динамические 8-битные активации в поддерживаемых Linear-слоях. Для него нужны совместимые CUDA-ядра; целевые видеокарты — NVIDIA Ampere и новее. При этом в 4 бита перевели не всю модель: часть слоёв и параметров оставили в исходной точности. W4A8 также сжимает текстовый decoder Qwen. Суммарный размер весов для генерации и текста у автора составил около 4,79 GB.
Если важны стабильные лица, мелкие детали одежды и чистая фактура, я бы начал с INT8. Когда памяти всё равно не хватает, стоит погонять W4A8 на своих промптах: посмотреть на зерно, руки, текстуры и композицию. Один и тот же Seed не гарантирует одинаковый результат при смене точности.
Глубина и восстановление: что показывают тесты
В Aikimi Forge Neo сгенерированное изображение можно отправить на оценку глубины или восстановление. Для глубины автор взял обычное изображение 1024×1024. Массивы глубины у INT8 и W4A8 оказались похожи на результат обычной версии: корреляция составила около 0,9999 и 0,9988 соответственно. Это сравнение выходов моделей между собой, а не проверка точности расстояний. Оценка относительная — расстояние в метрах модель не выдаёт.
Для теста восстановления автор увеличивал маленькие JPEG-изображения: с 256×256 до 1024×1024 и с 384×256 до 1536×1024. Все версии сохраняли общую структуру, но мелкие детали модель дорисовывает заново. Поэтому восстановленный текст на книге или черты лица нельзя считать копией исходника. Пик памяти для глубины и восстановления составил около 15,0–15,1 GiB у обычной версии, 6,8–6,9 GiB у INT8 и 5,61–5,70 GiB у W4A8.
Есть нюанс с цифрами VRAM. Речь о памяти, выделенной CUDA allocator PyTorch, а не обо всём потреблении видеокарты. Для W4A8 автор отдельно следил за показаниями платы: максимум составил 13,08 GiB в тестах 1024×1024 и 13,86 GiB в вертикальных тестах. Показания снимали раз в 250 мс, поэтому короткий пик мог остаться незамеченным.
Как запустить Iris-3B и где заканчиваются выводы
Тест проходил на Windows с RTX 3090 на 24 GB VRAM, Python 3.13.14 и PyTorch 2.13.0+cu130. В части сравнений автор ограничил allocator до 12 GiB. Это не значит, что Iris-3B точно запустится на любой карте с 12 или 16 GB: такие видеокарты не тестировали. Обычную вертикальную генерацию проверяли при полном доступном объёме памяти.
В Aikimi Forge Neo на экране Iris сначала выбирают задачу и модель, затем при необходимости нажимают «Подготовить модель». Для запуска разных вариантов автор приводит команды: aikimi-iris-setup.bat --precision normal --task generate — обычная генерация; aikimi-iris-setup.bat --precision int8 --task all — три задачи на INT8; aikimi-iris-setup.bat --precision w4a8 --task all — W4A8 и текстовая модель. Автор также закрепляет проверенные версии кода и весов, сверяет размер файлов и SHA-256.
В исследовании Sperid Labs пиксельный подход Iris-3B не дал значимого преимущества перед латентной FLUX.2 Klein в тестах глубины и восстановления. Там изучали саму модель, а не реализацию Aikimi. Это полезный контекст: отсутствие VAE само по себе не гарантирует особых возможностей. Практическая ценность Forge Neo здесь в другом — можно выбрать точность и использовать дополнительные инструменты в локальном интерфейсе.
Для старта я бы выбрал INT8, а W4A8 оставил на случай нехватки памяти. И проверял бы не только, помещается ли модель в VRAM, но и сколько деталей потом приходится спасать в редакторе.
Источники
Iris-3B: Going Beyond the Latent with Pixel-Space Diffusion Training, Conversion and Fine-Tuning
Iris-3B: Open 3B Image Model With No VAE (Apache 2.0)
Источникnote.com
