Я действительно ушёл в комикс — на текстовой формуле, где стиль был описан словами. Вернулся к тому, что работало: стиль берётся ссылкой с твоих рефов, ничего не описывается. Плюс поднял качество до предела.
--q 2 вместо стандартного. Вдвое больше проходов на детализацию.<сюжет: кто · где · что делает · какой свет>
--ar 16:9 --v 7 --q 2 --no back of head, seen from behind, faces turned away
--sref https://youtube-factory.obahoba.com/srefs/s02.jpg
https://youtube-factory.obahoba.com/srefs/s14.jpg
Седая борода, лицо прямо на нас, руки на рукоятях. За ним команда работает на снастях, стены волн по обе стороны, вершина острова в разрыве. Фонари и канаты держат передний план. Вот это ровно язык твоих рефов: мягкая заливка, тонкая линия, бирюза с охрой, кучевые башни.
Лица открыты, звёзды на груди, бутылки по стенам, дверной проём с городом за спинами.
Два ряда воинов по краям, храм в центре, знамёна, лес на склонах.
Композиция агрессивнее и ближе к тому, что ты просил — маски давят на зрителя, строй уходит в перспективу. Но половина воинов повёрнута спиной.
Язык рефов воспроизводится железно — это уже не вопрос. Сейчас мешает то, что требование «лица к камере» я написал слишком прямолинейно, и модель выстраивает всех фронтально в ряд.
Правильная формулировка — не «все смотрят в камеру», а задать каждой фигуре своё положение: главный герой лицом, второй вполоборота, третий срезан краем кадра. Тогда лица читаются, а композиция остаётся живой. Это следующая правка промпта, она дешёвая.
--q 2 — это его потолок. Banana в 4K даёт 5504×3072, вчетверо больше по площади. Если нужен запас на кроп макро-деталей, придётся либо апскейлить, либо возвращаться к Banana с правильной формулой стиля.