Исторический канал · производственная библия · v0.1

Как устроена режиссура «Сторикона» и что мы забираем себе

Первый этап: разобрана логика выбора кадров, консистентность повествования и производственный тракт. Дальше — наш визуальный стиль, система ассетов и выбор инструментов под каждый шаг.

Основано на покадровом разборе ролика про Александра Македонского (7:52, 143 шота) 26.07.2026
Поправка к первому разбору — ты был прав
0

статичных кадров в ролике. Перемерил правильно: не по первому и последнему кадру шота, а по остаточному локальному движению внутри кадра с компенсацией движения камеры. Минимум по всем 143 шотам — 0,92 единицы яркости, медиана 5,6. Порог «глаз не отличит от стоп-кадра» — примерно 0,3. Ниже него нет ни одного шота. Анимировано абсолютно всё, включая кадры с картой и книгой; предыдущая классификация «почти статика» была артефактом метода, а не свойством ролика.

едва заметное дыхание — 9 шотов (6%) спокойное движение — 34 (24%) заметное — 54 (38%) активное — 33 (23%) экшен — 13 (9%)
Главный производственный вывод
143 из 143

шота прогнаны через оживление — значит норматив на ролик такой длины это ~145 генераций картинки + 145 анимаций по 2–5 секунд, а не «часть можно закрыть зумом по картинке». Отсюда сразу два следствия. Первое: анимировать надо дёшево и пачкой, иначе экономика не сходится. Второе: чёрные карточки глав — единственное неанимированное место у них, и это наша самая дешёвая точка превосходства. Оживший титр стоит копейки и сразу читается как «сделано лучше».

Как выбирается кадр: 10 правил их режиссуры

Это не догадки — каждое правило подтверждается конкретными шотами с таймкодами. Я сверял текст озвучки, который звучит на шоте, с тем, что в этом шоте показано.

Первый кадр — Александр на смертном ложе
Правило 1 · 0:00

Начинать с конца

Первая же фраза — «Он прожил всего 32 года» — идёт не на мальчика и не на битву, а на мёртвого героя на ложе. Зритель с первой секунды знает, чем всё кончится, и смотрит уже не «что будет», а «как он к этому пришёл».

Кольцо замыкается в финале: последний кадр — мальчик над огромной долиной (7:46, 5,1 с — самый длинный кадр ролика).

Окровавленный кулак крупно
Правило 2 · 0:10–0:15

Антитеза в тексте = два соседних кадра встык

«Он мечтал о единой цивилизации» → герой смотрит на живой город сверху. «И утопил её в крови» → макро окровавленного кулака. Противопоставление в предложении всегда разбивается на пару кадров: широкий-светлый против крупного-тёмного.

Тот же приём: 2:32 «сотни тысяч воинов» (бесконечная колонна) → 2:40 «у Александра около 40 000» (горстка всадников в пустом кадре).

Филипп на троне
Правило 3 · 0:33–0:38

Перечисление — по кадру на каждый пункт

«Отец — жёсткий реалист» (0:33, трон) / «политик, полководец» (0:35, перед войском) / «мать Олимпиада, мистичная, религиозная» (0:38, у жертвенного огня). Никаких «одна картинка на весь абзац»: каждое определение получает свой шот на 2–2,6 с.

Так же режется список причин смерти на 6:41–6:48: малярия / брюшной тиф / раны — три кадра подряд.

Мальчик с короной и отражение всадника в зеркале
Правило 4 · 0:57

Внутреннее состояние — через отражение и предмет

«Он не хочет быть царём. Он хочет быть великим». В кадре мальчик держит корону и отворачивается от неё, а в зеркале за ним — конный полководец. Абстрактная мотивация показана предметом и отражением, без единого слова на экране. Лучший шот ролика по режиссуре.

Сюда же: 7:14 «наследника нет» — пустой освещённый тронный зал.

Пролив с орбиты
Правило 5 · 2:19

География — вид сверху, а не карта со стрелками

«Пролив между Европой и Азией» показан с орбиты, как спутниковый снимок в живописи. Ни одной анимированной карты со стрелочками, ни одной подписи. Масштаб доносится точкой съёмки, а не графикой.

Карта на столе со свечой
Правило 6 · 2:29

Карта — это предмет в кадре, а не интерфейс

Когда карта всё-таки нужна, она лежит на столе: пергамент, свеча, рука. Карта всегда часть сцены, никогда не оверлей. Тот же приём в финале главы о распаде — рука капает чернила на карту (7:00).

Малый отряд в пустоте
Правило 7 · 2:44

Числа показываются композицией, а не цифрами

«Армия меньше, беднее и дальше от дома» — четыре всадника в пустом широком кадре. Соотношение сил читается занятой площадью кадра. За весь ролик на экране не появилось ни одной цифры, ни одной подписи, ни одного инфографического элемента.

Крупный портрет Александра
Правило 8 · 2:03

Лицо героя — это знак препинания, а не иллюстрация

Крупные планы Александра не рассыпаны равномерно: они стоят ровно на выводах. «Он уже не наследник, он царь» (2:03), «между освободителем и тираном» (4:00, лицо расколото светом надвое), «не пример для подражания» (7:42). Между выводами герой либо в общем плане, либо его вообще нет в кадре.

Чёрная карточка главы
Правило 9 · семь раз за ролик

Глава закрывается тишиной, а не музыкальным акцентом

2,88 с чёрного экрана с золотым титром, жёсткий вход и выход без затемнения и полная тишина в озвучке — диктор молчит только здесь. Это одновременно разметка структуры, передышка для зрителя и точка, где он решает досматривать или нет.

Крупный план кричащего Александра в бою
Правило 10 · 7:42–7:46

Вывод ролика бьёт самым тяжёлым кадром

На фразу «Александр Македонский не пример для подражания. Это предупреждение» идут два самых жёстких кадра за весь ролик — окровавленное кричащее лицо в гуще боя, подряд, с нарастанием крупности. Самый сильный визуал приберегается под тезис, а не под битву.

Как устроен их сценарий

Слов всего
802
на 7:52 — норматив 100 слов на минуту
Слов на шот
5,6
одна мысль = один кадр
Глав
7
+ вступление, по 35–95 с
Длина фразы
6–12
слов, редко длиннее

Скелет, который повторяется в каждой главе

  • Якорь — «336 год до нашей эры. Македония». Дата и место первой же фразой, всегда на широком плане локации.
  • Событие — что произошло, 2–4 фразы, каждая со своим кадром.
  • Механика — почему это сработало: расстановка сил, решение, ресурс.
  • Поворот — цена или последствие, обычно через антитезу и крупный план.
  • Вывод главы — одна короткая фраза-обобщение, после неё сразу чёрная карточка.

Где у них слабо — и где место нашему авторству

  • Голоса автора нет вообще. 802 слова нейтрального энциклопедического пересказа: ни одной оценки, ни одной шутки, ни одного «а теперь смотри, что он сделал». Текст можно скормить любому каналу и он не изменится.
  • Нет вопросов к зрителю. Ни одного риторического крючка внутри глав — только в описании под роликом.
  • Все главы одинаковой интонации. Ровный темп 102 слова в минуту от начала до конца, ни ускорения на битве, ни замедления на смерти.
  • Ноль современных параллелей. История заканчивается в 323 году до нашей эры и никак не касается зрителя.

Каркас при этом безупречный и от текста не зависит. Сетка трёхсекундных шотов и паузы на карточках только усилят панч, если он в тексте есть — а у них его нет.

Консистентность: система ассетов

У «Сторикона» с этим ровно та проблема, которую ты назвал: Александр из кадра в кадр — то же амплуа, но не то же лицо. Держится типаж (светлые кудри, красный плащ, бронза), а не личность. На широких планах это не видно, на крупных — заметно. Мы это чиним системно.

Три уровня ассетов

УровеньЧто этоЧто фиксируемКогда обязателен
Персонажи Александр, Филипп, Олимпиада, Аристотель, Дарий, Гефестион, Парменион core-ref на нейтральном фоне (3/4, фас, профиль) · палитра одежды · 3 неизменных признака (шрам, наклон головы, застёжка плаща) · возрастные версии (мальчик / 20 / 32) появляется ≥2 раз или есть крупный план
Артефакты копьё, лавровый венец, карта-пергамент, перстень-печатка, шлем, чаша с ядом ref-кадр предмета на чистом фоне с 3 ракурсов · размер относительно руки · материал и степень износа предмет несёт смысл и возвращается
Локации Пелла, Фивы, Вавилон, Персеполь, Гидасп палитра (3 цвета) · один архитектурный признак · тип света и время суток · погода глава происходит в этом месте

Технический тракт консистентности — то, что у нас уже проверено

  • Reference-image в каждый промпт. vertex_image_ref.py уже умеет принимать core-ref. Без рефа лицо плывёт всегда, с рефом держится.
  • Фиксированный seed. VERTEX_SEED уже поддержан в обёртке — одна серия кадров = один seed.
  • Core-ref строго на белом фоне. Проверено на прошлых проектах: реф со сценой тянет за собой композицию и ломает новый кадр.
  • Keyframe-цепочка против плывущих лиц при анимации. Шот = 2 коротких сегмента между 3 сгенерированными кадрами (начало → середина → конец), а не один длинный проход. Модели нечего додумывать — она интерполирует между заданными точками.
  • На крупных планах — рот закрыт. Персонаж в наших роликах не говорит; открытый рот при оживлении даёт «щелкунчика». Эмоция играется глазами и бровями, в негатив-промпт идёт mouth opening, talking, warping.
  • Правило одного движения. На крупном плане — одно субтильное движение на месте. Два разнесённых ключа на крупном плане дублируют персонажа.

Что ломается предсказуемо — знать заранее

  • Толпа с лицами в кадре-старте блокируется фильтрами Veo. Обход: либо толпа только как текстура в расфокусе, либо кадр без узнаваемых лиц, либо оживление другим движком.
  • Второй персонаж в кадре удваивает шанс дрейфа. Диалоговые сцены строим через восьмёрку — по одному лицу в кадре.
  • Предмет в руке плывёт чаще лица. Артефакт либо крупно и отдельно, либо в статичной части кадра.

Наш стиль: четыре направления на пробу

Ты назвал ориентиры — «Человек-паук: Паутина вселенных» и «Аркейн». Оба про одно: трёхмерная форма, но поверхность нарисована рукой. У «Сторикона» этого нет — у них ровная цифровая историческая живопись без графического характера. Вот четыре направления, где мы можем встать; в каждом заложена своя авторская нота.

Направление A

Терракота и тушь

Аркейн + греческая вазопись. Объёмная нарисованная форма, тушевый контур только на переднем плане, фактура фрески с микротрещинами по всему кадру.

Наша нота: золото — единственный ненатуральный цвет в палитре и появляется только там, где в тексте идёт речь о власти или её цене. Чистого чёрного нет вообще, самый тёмный тон — тёплая умбра.

Сильно: мгновенно узнаётся в превью, цвет работает на смысл.

Направление B

Аркейн в лоб

Плотный живописный 3D, толстый мазок на коже и ткани, тяжёлый объёмный свет, приглушённая база с одним ядовитым акцентом.

Наша нота: холодный мир, тёплый герой — Александр всегда в тёплом пятне света, окружение всегда холоднее на пару шагов.

Риск: ближе всего к тому, что уже у всех; авторства меньше всего.

Направление C

Печатный рельеф

Паутина вселенных на античном материале. Растровая точка в тенях, сдвиг красного канала по краю героя, жёсткий контур, ризограф-палитра из четырёх красок.

Наша нота: кадр как страница античного комикса — диагональная энергия, зерно бумаги, плашки цвета вместо градиентов.

Риск: тяжелее анимируется, печатная фактура «плывёт» при движении — нужен тест.

Направление D

Пепел и золото

Почти монохром: пепел, кость, дым, тёплая пыль. Цвет только два — золото и запёкшаяся кровь, и только на смысловом.

Наша нота: огромное пустое пространство и один тёмный читаемый силуэт. Это же решает главную болезнь ИИ-кадра — кашу в деталях.

Сильно: самый дешёвый в производстве и самый непохожий на конкурентов.

Как будем выбирать

Каждое направление прогоняется через три одинаковые контрольные сцены, подобранные так, чтобы поймать всё, что обычно ломается: крупный план лица (консистентность и «пластилин»), эпический общий план с массовкой (каша в толпе, читаемость силуэта), макро-предмет (узнаваемость артефакта). Двенадцать кадров, один взгляд, один выбор. Скрипт написан и лежит в projects/youtube-factory/research/storikon-teardown/style_probe.py — запускается одной командой, как только откроется генерация.

Чем что делать: выбор из нашего арсенала

ЭтапБерёмПочему именно этоЧто НЕ берём и почему
Ключевые кадры Gemini 3 Pro Image на Vertex, с core-ref и фиксированным seed Единственный из наших, кто уверенно держит референс персонажа и не сыплется на кириллице, если титр всё-таки нужен внутри кадра Свободные text-to-image без рефа — лицо не удержат
Оживление обычного шота
~120 шотов из 145
Wan 2.7 через Higgsfield (план ultra уже оплачен) Дешевле Seedance в 2,5 раза, быстрее вдвое, минимум 2 секунды — ровно наш формат. 8 задач параллельно Veo на каждый шот — переплата за то, что в спокойном кадре не видно
Сложный шот с камерой
~20 шотов
Veo 3.1 на Vertex, keyframe-цепочка Единственный, кто внятно водит камеру и держит лицо на крупном. JSON-промптинг, длительность строго 4/6/8 с Wan на крупном лице — риск «пластилина»
Батальный экшен
~13 шотов
Seedance 2.0 через Higgsfield или OpenRouter Лучше остальных держит массу и пыль в движении Veo блокирует толпу с лицами
Приёмка шотов video-qc (Gemini смотрит клип целиком) Ловит то, что видно только в движении: плывущее лицо, дрожащий предмет, мёртвую анимацию. Меньше $0,10 на 20 шотов Проверка по стоп-кадрам — пропускает ровно те дефекты, ради которых всё затевалось
Озвучка ElevenLabs, темп 100–105 слов/мин Норматив снят с их ролика и подтверждён замером Бесплатные TTS — на восьмиминутном ролике слышно
Титры глав Remotion (движок уже есть) Оживлённая карточка вместо статичной — наша бесплатная точка превосходства Статичный PNG, как у них
Сборка Remotion по паспорту ролика + ffmpeg на мастер Уже работающий тракт из video-nextgen: раскадровка данными, кэш этапов, гейт темпа Ручной монтаж — не масштабируется на серию

Экономика — честный порядок цифр

Твёрдо знаем одно: Seedance стоит примерно $0,12 за секунду — то есть весь ролик на нём в лоб это 145 шотов × 3 с × $0,12 ≈ $52. Wan через уже оплаченный ultra-план даёт основной объём фактически без доплаты, и тогда живыми деньгами платим только за ~20 шотов Veo и ~13 Seedance. Точные цены Vertex за кадр и Veo за секунду я не подтверждал замером — их надо снять на первом же прогоне, а не брать из головы.

Пайплайн: восемь шагов с гейтами

1

Сценарий под норматив

800 ± 50 слов на 8 минут. 7 глав по скелету «якорь → событие → механика → поворот → вывод». Фразы 6–12 слов. Плюс наш слой: авторская оценка в конце каждой главы и одна современная параллель на ролик.

Гейт: read-aloud вслух под таймер — 100–105 слов/мин, иначе режем
2

Раскадровка по фразам

Каждая фраза получает шот: тип (общий / средний / крупный / макро-предмет), функцию (событие / антитеза / вывод / передышка) и длительность 2–5 с. Сумма длительностей сходится с хронометражом озвучки. Выход — storyboard.json, как в video-nextgen.

Гейт: средняя 3,0–3,3 с; ни одного шота длиннее 5,5 с; крупные планы стоят только на выводах
3

Ассет-лист и core-refs

Из раскадровки выписываются все персонажи, артефакты и локации с числом появлений. Всё, что встречается дважды и чаще, получает core-ref на белом фоне до генерации сцен.

Гейт: ни один шот не уходит в генерацию, пока у его героя нет ref
4

Ключевые кадры

Генерация всех ~145 кадров с core-ref, единым seed и единым стилевым блоком промпта. Сложные шоты сразу получают по 3 кадра под keyframe-цепочку.

Гейт: контактный лист всей раскадровки одним листом — стиль и герой держатся по всему ролику
5

Оживление

Пачкой, по 8 параллельно. Обычный шот — Wan, крупный план с камерой — Veo по цепочке, экшен — Seedance. Правило одного движения на крупном, рот закрыт.

Гейт: video-qc по каждому клипу, score ниже порога — переснять, а не «и так сойдёт»
6

Озвучка и карточки глав

ElevenLabs на 100–105 слов/мин, пословные тайминги на выходе. Семь карточек глав в Remotion — с живым фоном и оживающими буквами.

Гейт: на карточке в озвучке тишина — проверяется по таймингам автоматически
7

Сборка

Шоты режутся по таймингам озвучки. Переходы: 70% встык, 20% провал в чёрное на 0,8 с, карточки жёстко. Музыка — один готовый оркестровый трек на ролик, пока просто подкладываем.

Гейт: мастер −14 LUFS, true peak не выше −1 dBFS
8

Приёмка и публикация

Полный просмотр, policy-чек площадки, обложка, описание с таймкодами глав.

Гейт: policy-чек YouTube обязателен до заливки

Где мы делаем лучше них

Живые карточки глав
7
у них статичный чёрный PNG — самая дешёвая победа
Консистентность героя
core-ref
у них держится типаж, а не лицо
Авторский голос
7+1
оценка в конце каждой главы + одна параллель с сегодня
Темп по главам
±15%
у них ровно 102 слова/мин от начала до конца

Звук: как это устроено у них

Разбирал по замерам, не на слух: яркая полоса спектра держится на ровном уровне 0,24 весь ролик — то есть отдельных звуковых эффектов в ролике практически нет. Ни свиста стрел, ни лязга, ни ветра. Только оркестровая подложка и голос.

Как звук делают консистентным в таких проектах

Консистентность даёт не генерация, а один источник на весь ролик: берётся длинный оркестровый трек с одной гармонией и одним инструментальным составом, и внутри него меняется только громкость и плотность. Как только начинают склеивать разные треки по главам, ролик рассыпается на куски. Если позже захотим генерить музыку — генерить надо один длинный кусок под весь хронометраж, а не по фрагменту на главу.

Что нужно от тебя, чтобы двинуться дальше

Генерация сейчас заблокирована — одна кнопка

Проверил фактически: Vertex отвечает BILLING_DISABLED на всех трёх проектах Google (project-2a14e28f, claudebot-video, gen-lang-client), отдельного бесплатного ключа Gemini в системе нет. Higgsfield MCP уже оплачен планом ultra, но требует OAuth-авторизации, а её нельзя пройти из этой сессии — нужна интерактивная. То есть картинки прямо сейчас генерировать нечем.

Дешёвый путь: авторизовать Higgsfield — там план уже оплачен, новых трат не будет вообще. Быстрый путь: включить биллинг на Vertex — тогда работает уже написанный style_probe.py и весь наш проверенный тракт с core-ref и seed.

И один творческий выбор

Направление стиля — A «Терракота и тушь», B «Аркейн в лоб», C «Печатный рельеф» или D «Пепел и золото». Можно не выбирать вслепую: как только откроется генерация, прогоняю все четыре по трём контрольным сценам и присылаю двенадцать кадров одним листом. Моя ставка — A: самая узнаваемая в превью и единственная, где цвет работает на смысл текста.

Честные оговорки

Что измерено, а что пока рассуждение

  • Измерено: отсутствие статичных кадров, длительности и границы всех 143 шотов, типы переходов, темп речи, попадание резов в бит, громкость мастера, отсутствие SFX.
  • Наблюдение по кадрам, не замер: все десять правил режиссуры. Каждое подтверждено конкретными шотами с таймкодами, но это разбор одного ролика — на второй ролик канала я их не проверял.
  • Непроверенное утверждение: «у них плывёт лицо героя» — я сравнивал кадры глазами, численного теста идентичности лица не делал.
  • Стилевые направления — гипотезы. Ни один кадр ещё не сгенерирован, промпты написаны, но не прогнаны. Как поведёт себя печатная фактура направления C при оживлении — узнаем только на тесте.
  • Цены: подтверждена одна — Seedance ≈ $0,12 за секунду. Vertex за кадр и Veo за секунду надо снять замером на первом прогоне.
Производственная библия v0.1 · собрана на покадровом разборе ролика «Сторикона» · 26 июля 2026