Нейросеть может отлично нарисовать шерсть, воду и выражение морды. А потом странно расставить персонажей по кадру. Японский автор на Zenn объясняет этот разрыв: дело не в качестве отдельных деталей, а в том, как модель собирает их в целую сцену.
Для визуального продакшна это важная разница. Удачный одиночный кадр ещё не говорит, что модели можно поручить сцену для комикса, серии или анимации. Там нужно учитывать позы, расстояние между героями, направление взгляда и правки отдельных деталей.
Почему ИИ рисует красиво, но ломает композицию
Автор Zenn описывает знакомый контраст: животные, вода и фон могут быть нарисованы почти на уровне профессиональной иллюстрации, а сцена всё равно выглядит как набор объектов. По отдельности элементы убедительные. Вместе — не всегда.
Модель может хорошо отрисовать лицо, одежду или фон, но запутаться в том, как они должны соотноситься. Например, один персонаж стоит ближе к камере, второй поворачивается к нему, а между ними остаётся место для движения. Красивые детали сами по себе такую композицию не складывают.
На референсах этот разрыв заметен особенно хорошо. Художник может взять внешность персонажа с дизайн-листа, а позу — с манекена, и объединить их. Генератор иногда цепляется за позу, уже показанную на листе персонажа, и хуже выполняет отдельное указание. Чем сильнее новая поза отличается от референса, тем сложнее получить точный результат.
С несколькими героями возни больше. Поставить их рядом обычно проще, чем задать объятие с поворотом корпуса или движение в разные стороны. Модель может снова возвращаться к более привычной расстановке.
Код можно разбить на функции, а изображение — сложнее
В программировании отдельная часть задачи часто полезна сама по себе. Если функция принимает нужные данные и возвращает правильный результат, её можно встроить в проект. Разработчик задаёт общую структуру и проверяет отдельные задачи тестами. Тесты не гарантируют идеальный код, но помогают найти многие ошибки.
У изображения другой критерий. Собака, кот и фон могут быть нарисованы хорошо по отдельности, а иллюстрация всё равно не сложится. Нужно согласовать масштаб, перспективу, свет и позы, а ещё направить взгляд зрителя. Здесь многое зависит от того, как части работают вместе.
Код часто можно поправить в одном месте и проверить результат. С изображением всё капризнее: попросили изменить руку персонажа — генератор заодно задел лицо, одежду или фон. Создать объект отдельно и точечно отредактировать его в готовой сцене — разные задачи.
Автор связывает трудности и с оценкой результата. В шахматах есть победа и поражение, а для иллюстрации нет такого простого сигнала качества. Совпала ли поза? Сохранились ли черты персонажа? Это проверить можно. Автоматически оценить, удачна ли композиция и подходит ли постановка задаче, гораздо труднее.
Автор отдельно оговаривает: по открытым данным нельзя уверенно судить об объёмах инвестиций и устройстве обучения. Его объяснение — гипотеза о том, почему профессиональные сценарии сложнее автоматизировать. Это не доказанный закон развития рынка.
Что умеет Gemini и где нужна проверка
В справке Google по Gemini описаны генерация с несколькими референсами, сохранение внешности персонажа между изображениями и частичное редактирование. Для серий визуалов и повторяющихся героев это пригодится. Но наличие этих функций не гарантирует точную генерацию любой сложной позы или композиции.
Частичную правку проверяйте по всему кадру. В официальной справке есть предупреждение: Gemini может изменить изображение за пределами выбранной области. После замены детали сравните её с соседними зонами — лицом, одеждой и фоном. Удачную версию лучше сохранить до следующей итерации.
Google также указывает, что доступность функций зависит от страны, языка и версии приложения. Для генерации нужно войти в Gemini; возрастные требования для генерации и редактирования различаются. В справке сказано: изображения можно скачать в разрешении 1K без Google AI-плана и в 2K с таким планом. Подписчики Google AI могут использовать Nano Banana Pro для повторной генерации с большим количеством деталей.
Важна точность, а не только красота
Японский автор пишет о том, насколько точно модель выполняет задачу: удерживает заданную позу, сохраняет героя, меняет нужную часть и оставляет остальное на месте. Думаю, для профессиональной работы это сейчас важнее, чем ещё одна красивая картинка.
Модели уже пригодятся там, где важны скорость и визуальная база: для отдельных кадров, фонов и вариантов обложки. А со сложным взаимодействием персонажей пока лучше оставить в пайплайне композитинг и ручную проверку. Красивый генерат ещё нужно суметь поставить в монтаж.
Примеры моих AI-фото и видео — в работах
Источники
Gemini アプリで画像を生成、編集する - パソコン - Gemini アプリ ヘルプ
Источникzenn.dev
