Сцена простая на словах: школьная крыша, одна скамейка, девушка кормит соседа омлетом с палочек. Но модели должны одновременно показать правильный жест, направление взгляда и естественную посадку двух людей. Особенно непросто, когда камера — глаза мужчины, а в кадре видны только его рука и колено.

Аниме-девушка на соседнем месте скамейки протягивает собеседнику тамагояки, как в сцене для сравнения nanobanana2 и Tsubaki3.Источник: note.com

nanobanana2 обычно понимала, кто кого кормит: девушка протягивала кусочек к камере, и мужчина не пытался забрать его рукой. А вот ноги и колени могли смотреть в разные стороны, будто герои сидят не рядом. Иногда удачный вариант получался, но приходилось перебирать генерации.

У Tsubaki3 ошибки были и в расположении тел, и в самой роли персонажей. В примерах с Юкиноситой Юки мужчина кормил девушку вместо того, чтобы она протягивала еду ему; в вариантах с Ироха она держала палочки, но кусочек порой оказывался у её собственного рта. Встречались и странные стыки ног с обувью.

Автор подробно задавал ракурс, положение руки и колена мужчины, а также требовал, чтобы девушка сидела рядом, сохраняя направление бёдер и коленей, но поворачивая к нему верх тела. Рука на колене нужна не для красоты: она помогает не превратить кормление в передачу еды. Думаю, формулировка «колени направлены вперёд, к краю скамейки» может сработать понятнее, чем «в сторону дальнего плана», но это пока только идея для следующего теста. Итог этого сравнения: nanobanana2 лучше передавала смысл сцены, а Tsubaki3 требовала точнее прописывать роли. Удачные кадры получались у обеих, но считать эту композицию стабильной пока рано.

Главное

  • В nanobanana2 жест кормления чаще считывался верно, но направление ног могло ломаться.
  • В примерах с Юкиноситой Юки Tsubaki3 иногда меняла роли: девушка оказывалась той, кого кормят.
  • В вариантах с Ироха палочки были у неё, но кусочек не всегда явно тянулся к собеседнику.
  • Для Tsubaki3 автор отдельно фиксировал положение руки мужчины, чтобы он не пытался взять еду.
  • Сравнение показывает трудность конкретной сцены, а не общую оценку возможностей моделей. У обеих были удачные генерации.

Источникnote #画像生成AI