Нероли постепенно получил 16 изображений без текста: «доброе утро», «спасибо», грусть, сонливость, радость, злость, удивление и другие позы. Каждую сцену автор делал отдельно, сверяясь с исходной картинкой и спецификацией персонажа.
Проверка оказалась отдельным этапом. В маске должен оставаться тот же узор, украшение — крепиться сбоку именно к маске, красная кисточка не менять длину, а колокольчик и хвост никуда не исчезать. Заодно нужно следить, чтобы кот внезапно не стал худее или не получил морду другой кошки.
По одной картинке многие ошибки не бросаются в глаза: ну милый кот и милый. Но когда поставить 16 изображений рядом, расхождения сразу видны. Поэтому генерация не считается готовой — подозрительный результат отправляется на переделку, а человек проверяет весь набор поштучно. Короче, автоматизация превратилась в кошачью ОТК, зато на выходе появляется переиспользуемый набор исходников для стикеров, постов и товаров, а не 16 случайных котов.
Такой подход занимает больше времени сейчас, зато дальше не приходится каждый раз собирать Нероли с нуля. Референс и спецификация удерживают базовый образ, а ручная проверка не даёт мелким ошибкам расползтись по серии. Думаю, для персонажей это куда практичнее, чем доверять одной удачной генерации.
Главное
- - 16 поз одного кота собраны как единая серия, а не как отдельные случайные картинки
- - Основа пайплайна — исходный референс и спецификация персонажа
- - Проверяются маска, украшение, красная кисточка, колокольчик, хвост и форма тела
- - Картинки нужно ставить рядом: так лучше всего видны различия в лице и пропорциях
- - Финальная ручная проверка превращает набор в пригодные для повторного использования исходники
- - Готовые позы можно применять в стикерах, постах и товарах
Источникnote #画像生成AI

