W4A8 уложил генерацию вертикальных изображений в 9,71 GiB пиковой памяти CUDA на RTX 3090. Но за экономию платят деталями: в примерах менялись лица и композиция, а на картинках становилось больше зернистости. Поэтому автор сравнения оставил INT8 вариантом по умолчанию — выглядит разумно, если качество важнее минимального расхода памяти.
Iris-3B добавили в Aikimi Forge Neo. Модель работает с изображениями напрямую, без VAE, и умеет не только генерировать: доступны относительная оценка глубины и восстановление с увеличением до 4×. Для теста использовали RTX 3090 с 24 ГБ, одинаковые промпты и Seed; генерация шла на 100 Steps и CFG 3. Версии сравнивали на изображениях 1024×1024 и 832×1280.
В вертикальном тесте обычная версия заняла 19,10 GiB, INT8 — 10,89 GiB, W4A8 — 9,71 GiB. На двух примерах W4A8 генерировала быстрее: 245,6 и 244,1 секунды против 281,2 и 306,5 у INT8. Но каждое условие запускали один раз, так что это не обещание скорости. И речь о памяти, которую зарезервировал CUDA allocator, а не о полном расходе видеокарты.
INT8 хранит веса Linear-слоёв в 8 битах и в основном экономит память; это не отдельное ускорение на целочисленных вычислениях. W4A8 сжимает часть весов до 4 бит и использует 8-битные активации, но некоторые слои остаются в исходной точности. Автор проверил также глубину и увеличение: структуры в целом сохранялись, однако восстановленные детали не возвращают настоящую информацию об оригинале. И заявлять, что всё это гарантированно запустится на любой карте с 16 ГБ, по этим тестам нельзя.
Источникnote #画像生成AI

