Тимур выбрал VASKO — Deep, Warm and Pleasant. Ниже — проверка его на реальном куске сценария и решение проблемы с темпом. Кандидаты, между которыми выбирали, оставлены внизу.
«Он перешёл реку, которую переходить было нельзя. Один шаг — и республики больше нет.»
Одной фразы мало, поэтому прогнал кусок настоящего сценария про Цезаря: 51 слово, начало ролика.
Тембр отличный, но темп на четверть быстрее нормы жанра. У «Сторикона» замерено 102 слова в минуту — на этой скорости эпика не собирается, звучит как новостной сюжет.
Разрубил текст на короткие фразы, точки вместо запятых — по логике должно было замедлить. Стало ещё быстрее. Короткие фразы этот голос проговаривает только бодрее. Вывод: темп у него пунктуацией не регулируется.
Обработка atempo=0.79: тон не плывёт, тембр сохраняется, темп попадает ровно в норму жанра. Этот шаг вшит в пайплайн озвучки — сырую дорожку больше никогда не берём в сборку, и хронометраж ролика считаем по замедленной.
Самая размеренная подача из четырёх — читает на 40% дольше остальных на том же тексте. Ближе всего к тому «неторопливому, пробирающему» темпу, который ты описывал.
Тенор с низкой опорой, спокойный и ровный. Меньше давит, чем остальные — подойдёт, если хочется, чтобы голос не перетягивал внимание с картинки.
Самый низкий тембр в подборке. Быстрее по темпу — под наш формат его пришлось бы притормаживать паузами в тексте.
Тёплый и мягкий, но самый торопливый — читает фразу почти на три секунды быстрее Максима. Для эпического нарратива темп великоват.
Выбран VASKO. Я ставил на Максима из-за темпа, но темп, как выяснилось, чинится одной строкой на монтаже, а тембр — не чинится ничем. Так что выбор по голосу, а не по скорости, оказался правильным.
Записываю, чтобы не раскапывать заново.
research/storikon-teardown/tts_test.py — прогоняет любой текст любым набором голосов.