В картинке, которая должна была быть пиксель-артом, нашлось 88 735 уникальных цветов. Автор японской заметки дважды отвергал генерации как «слишком низкого уровня», но подсчёт показал: дело было не во вкусе — картинки не соблюдали базовые правила жанра. Для тех, кто делает ассеты, это разница между «поправьте стиль» и «смените способ генерации».

Автор сравнил два результата: в августовском было 199 733 цвета, в сентябрьском — 88 735. Цифра уменьшилась почти вдвое, но качество по сути не изменилось. Настоящий пиксель-арт обычно строится на фиксированной сетке и ограниченной палитре — примерно 16–64 цвета. Обычные диффузионные модели создают изображения высокого разрешения, которые лишь выглядят пиксельными: одни «пиксели» могут быть шириной 6 px, соседние — 7 px. Промптом такую сетку не заставить держаться, заключает автор.

Вместо этого есть коммерческие модели, заточенные под пиксель-арт: они выдают изображения заданного размера от 16×16 до 384×384, позволяют выбрать ракурс и передать свою палитру. Автор заметки сначала собирается проверить бесплатную обработку уже готовых картинок — выровнять сетку и сократить палитру до 64 цветов. Если результат не устроит, тогда платить за специализированную модель. Думаю, порядок разумный: сначала понять, можно ли спасти то, что уже сгенерировано.

Но главный промах оказался не только в цветах. Референс, похоже, был с видом сверху, а генерация — изометрической, под углом. Автор планирует заранее составить чек-лист: число цветов и попадание в сетку проверять скриптом, ракурс и сочетаемость стилей — глазами. Короче, «что-то не то» лучше как можно раньше разложить на конкретные критерии. Иначе модель будет снова исправлять не ту проблему.

Источникnote #画像生成AI