Я попросил провести эксперимент с коротким сериалом. Агент собрал пилот: ролик на 52,2 секунды, 19 планов, три вымышленных персонажа и английские диалоги. Есть и промо на 22,4 секунды.
Генерация шла на одной арендованной RTX PRO 6000 в Selectel. За сессию вышло четыре оплаченных часа, около 900 ₽.
Kandinsky - показался трагедией
Первую сборку я посмотрел со звуком и понял, что половины разговоров не слышно. Сначала винил Kandinsky. Прогнал расшифровку сырых клипов через Whisper small.en: все 16 реплик произнесены правильно, у 12 совпадение с текстом полное.
Проблема была в сборке. Kandinsky начинает говорить через 2-3 секунды после начала клипа, а сборщик обрезал каждый клип до длины реплики с нулевой секунды. В итог попадала тишина, а речь отрезалась, пошел фиксить.
Агент добавил speech_window(): функция находит первый всплеск громче −42 дБ в окне 50 мс и оставляет 0,25 секунды до него.
Я оставил Kandinsky 6 после сравнения кадров с Wan2.2
Публичного рейтинга, где Kandinsky 6, Wan2.2 и SkyReels-V3 стояли бы рядом, нет. В Artificial Analysis на 10.10 у них нет записи. MiniMax H3 и MAGI-2 в лидерах открытых весов тоже не стали вариантом: H3 требует четыре карты, а его открытая лицензия запрещает использовать или показывать результаты в США, ЕС, Великобритании и Корее (тут как бы спорно, но если делать - то делать хорошо, на весь мир).
На одной карте и на мастер-кадрах получилась такая разница:
Kandinsky 6 Pro (NVFP4, ComfyUI) |
Wan2.2-S2V + голос из Qwen3-TTS |
|
|---|---|---|
Голос |
свой на каждый план, между планами плывёт |
один на персонажа, реплика точно по тексту |
Время на клип 5 с |
144 с в тёплом состоянии |
≈9 минут при 480×832 |
Стоимость клипа |
≈9 ₽ |
≈20-35 ₽ |
Картинка |
больше жеста и света |
стабильное лицо, спокойная камера; рот иногда движется слишком широко |
Лицензия |
MIT, но аудио-VAE в рецепте ComfyUI - CC-BY-NC-4.0 |
Apache-2.0 у Wan и Qwen3-TTS |
Wan с зафиксированным голосом выглядит сильнее для диалоговых крупных планов. Я посмотрел первые кадры рядом с Kandinsky и оставил Kandinsky 6 для пилота, мое субъективное мнение.
NVFP4 сократил время Pro до 144 секунд на клип
Kandinsky Pro-distill в NVFP4 через ComfyUI 0.39 дал 144 секунды на warmed-up генерацию клипа. В diffusers с выгрузкой на CPU тот же Pro занимал 238 секунд в тёплом состоянии и 337 секунд при первом портретном запуске.
Агенту пришлось переложить UI-схему ComfyUI в API-вызовы: порядок виджетов не совпадал со входами ноды. В основной ветке ComfyUI нужного файла весов пока нет.
Проверка речи спасла три плана
Для повторных генераций агент добавил три проверки: число лиц и сходство с мастер-кадром; текст в кадре; совпадение реплики по Whisper. Для планов без реплики потребовал тишину: иначе Kandinsky на кадре без слов начинал говорить «Thank you very much».
Планы 11 и 19 стали тихими со второй попытки. План 14 со второй попытки произнёс «You knew?» с совпадением 1.0. План 17 пять раз говорил те же слова, но метрика ставила 0.67 из-за написания «Mister» и «Mr.».
План 5, пустой коридор, не прошёл проверку текста ни разу: она видела «5M» на знаке выхода. Этот знак уже был на мастер-кадре, поэтому нужно переделать именно его.
Дубли проверяла программа, а не человек
Голос Kandinsky генерирует заново в каждом плане, закрепить его за персонажем нельзя, и сходство голосов - не понравилось, я бы делал на Qwen TTS. Музыку из ACE-Step 1.5 (три фона) выбрал вслепую с помощью агента (да, я стараюсь все делать AI-first). Кадры проверяли вместе с агентами, они - счётчиком лиц и распознаванием текста и речи, я - визуально.
Финальный ролик увеличен до 1080×1920 обычным Lanczos, без супер-разрешения. На планшете в первом плане и на знаке в пятом ещё могут остаться артефакты.
p.s. честно пытаюсь прицепить картинку и видео, но не грузятся
Комментарии (5)

CyberGlavbuh
11.10.2026 10:34Я тоже пробовала арендовать GPU на RunPod для генерации видео, но в итоге отказалась. Проблема была даже не в стоимости, а в нестабильности сессий. Нужно установить ComfyUI, скачать модели, библиотеки, дополнительные ноды, собрать всё в рабочую схему. А потом сессия обрывается, и ты теряешь не только результаты, но иногда и всю настроенную среду. И начинай сначала.
В итоге перешла на локальный ComfyUI. По крайней мере, всё сохраняется и не приходится каждый раз заново собирать окружение.
Но если речь о коммерческом сериале, я бы скорее выбрала подписку на Runway или аналогичный сервис. Сейчас есть видеомодели, которые генерируют сразу со звуком, а для отдельной озвучки можно использовать ElevenLabs. Не уверена, что экономия на аренде GPU оправдывает время, потраченное на настройку и отладку.
И очень хотелось бы посмотреть сам пилот. Есть ссылка на готовое видео? Интересно оценить не только стоимость, но и качество результата.
nurix
Спасибо за честный разбор с цифрами, особенно ценно, что вы проверяли дубли программно, а не на глаз. Пара идей по проблемам, которые вы описали:
"Mister" против "Mr." - лечится нормализацией текста перед сравнением. В пакете openai-whisper есть EnglishTextNormalizer, который приводит сокращения, числа и пунктуацию к единой форме, после него подобные расхождения обычно исчезают и метрика перестаёт ложно ронять хорошие дубли.
"5M" на знаке в плане 5. Можно сделать проверку текста относительной: прогонять OCR по мастер-кадру и считать браком только текст, которого на мастере не было. Тогда знак, нарисованный ещё на мастер-кадре, не будет бесконечно заваливать генерацию.
Поиск начала речи по порогу −42 дБ работает, пока в клипе тихо, но на дыхании, шорохах или музыке может сработать раньше времени. Как более надёжный вариант можно попробовать VAD, например Silero VAD: он ищет именно речь, а не громкость.
Плавающий голос. Как компромисс между вашими двумя вариантами: оставить видео и тайминг реплик от Kandinsky, а голос прогнать через voice conversion в один закреплённый тембр на персонажа. Синхронизация губ сохранится, а голос перестанет меняться от плана к плану.
И вопрос: какая часть из четырёх оплаченных часов ушла на чистую генерацию, а какая на отладку и повторные дубли? Если 19 планов по ~144 секунды - это около 45 минут, то следующий пилот на готовом конвейере, видимо, выйдет заметно дешевле.
daniel_ivanov Автор
Спасибо, все четыре идеи по делу, и две из них я бы уже применил.
Нормализация перед сравнением: да, моя проверка была грубее нужного. «Mister» и «Mr.» она считала расхождением, хотя Whisper расслышал реплику верно. Прогонять обе строки через EnglishTextNormalizer из openai-whisper - правильное решение, возьму на заметку.
Относительный OCR: тоже согласен. Считать браком только текст, которого на мастере не было - логичнее. Хотя сам мастер для коридора я всё равно переделаю без таблички.
VAD: порог -42 дБ у меня сработал, потому что до речи в этих клипах тишина (-60…-107 дБ). Если в клипе будет музыка или дыхание, он ошибётся раньше времени. Silero VAD ищет именно речь, а не громкость, так что надёжнее. Попробую, тут я еще пилю напильником.
Voice conversion: про такой компромисс я не думал. Видео и тайминг реплик остаются от Kandinsky, голос выравнивается в один тембр на персонажа. Пока не проверял, поэтому сказать, как оно звучит и не сломает ли эмоциональную часть, не могу. Это первый эксперимент для второй серии, наряду с вариантом «Qwen TTS + Wan S2V».
По времени. Из четырёх оплаченных часов чистая генерация Kandinsky заняла около полутора: основной батч на 19 планов примерно час вместе с загрузкой модели, плюс около 40 минут переделок (из них примерно четверть ушла на косячный прогон). Остальное:
около часа с небольшим - сравнение с Wan (подбор параметров и 5 планов);
около 20 минут - мастер-кадры и голоса;
остаток - сборка, музыка, настройка окружения и ожидание.
Если бы я сразу пошёл только по Kandinsky, это были бы те самые 45 минут чистой генерации плюс минут двадцать на мастера и сборку. Так что да, следующий пилот на готовом конвейере выйдет заметно дешевле. Хотя до второй серии дело пока не дошло.
Вы занимаетесь этим? Имеет ли смысл вообще делать такое в РФ?
CyberGlavbuh
Я немного экспериментировала с озвучкой видео и пришла к тому, что всё зависит от задачи. Если ролик короткий, секунд на 10–15, иногда проще сразу генерировать его со звуком. А если нужен постоянный голос персонажа в нескольких сценах, удобнее делать озвучку отдельно, например через ElevenLabs, и потом работать с синхронизацией.
Поэтому мне и интересно ваше предложение с voice conversion. Насколько хорошо при этом сохраняются интонации и эмоции? Ведь для сериала важно, чтобы персонаж не только говорил одним голосом, но и звучал естественно от сцены к сцене.
daniel_ivanov Автор
Можно посмотреть здесь, вставить в пост не могу.
https://t.me/csylabs/152