Vidu Q4 reference to video: один клип из многих референсов
Vidu Q4 reference to video собирает один клип из нескольких референсных картинок. Кому она подходит, готовые промпты и приёмы для узнаваемых героев.

Вот задача, которую она решает. У вас есть персонаж, куртка, локация и продукт, каждый на своей картинке, и вы хотите их в одном кадре. Модель из картинки в видео стартует только с одного кадра, так что этот общий кадр пришлось бы сначала нарисовать. Vidu Q4 Preview reference to video пропускает этот шаг: вы даёте ей стопку референсов и промпт, а она строит сцену вокруг них. Пример на её странице - модный клип, где мужчина в кожаной куртке и тёмных очках идёт по индустриальному помещению, такой кадр обычно требует отдельно подготовленного стартового кадра.
Кому её выбирать
- Бренды и мода, где одежда или продукт должны оставаться узнаваемыми, а сцена новая.
- Серии с постоянным героем. Давайте одни и те же референсы лица и одежды в каждый эпизод, и персонаж остаётся тем же человеком.
- Все, у кого нет стартового кадра. Если вам проще описать сцену, чем нарисовать её, это ваша модель; если точный кадр уже есть, берите версию image to video.
Входы и зачем каждый нужен
Prompt - единственное обязательное поле. Images принимает несколько референсов сразу (поле вмещает щедрую стопку). Audios в разделе Advanced принимает несколько аудиореференсов для звука клипа, в дополнение к тому, что Generate audio пишет сам. Дальше привычные настройки: соотношение сторон (по умолчанию широкое, плюс вертикальное, квадрат и два промежуточных), разрешение от лёгкого черновика до большого финального размера, длительность в целых секундах, Generate audio (включено по умолчанию) и seed.
Готовые промпты
Мужчина с портрета идёт к камере по бетонному складу, на нём кожаная куртка и тёмные очки с других фото. Медленный проезд камеры, холодный дневной свет из высоких окон, эхо его шагов.Флакон духов с референса стоит на мокром чёрном камне, на крышку падает одна капля, медленный макронаезд, мягкий фиолетовый контровой свет, тихий низкий гул.Девушка с первой картинки сидит на сиденье поезда со второй картинки, смотрит в окно и тихо говорит: «Мы почти дома». Дождь по стеклу.Приёмы, которые держат узнаваемость
- Меньше чистых референсов лучше, чем много шумных. Фото лица на однотонном фоне и одно фото наряда несут больше, чем десять случайных снимков, которые спорят друг с другом.
- Один объект на референс. Картинка с тремя людьми оставляет модель гадать, кого вы имели в виду.
- Черновики на минимальном разрешении и длительности. Цена на кнопке Generate зависит от обоих. Когда сцена работает, зафиксируйте seed и отрендерьте финал в нужном размере.
- Держите один набор референсов на всю серию, в том же порядке, и повторяйте формулировки персонажа в промпте. В руководстве по единому стилю больше о том, как собрать набор референсов для повторного использования.
Честное ограничение
Референсы - это ориентир, а не вставка. Логотипы, надписи на одежде и тонкие украшения выходят приблизительно, и чем больше референсов, тем сильнее каждый усредняется. Если мелкая деталь должна быть точной, сгенерируйте стартовый кадр с правильной деталью и используйте image to video. Кроме того, это preview-модель, так что сцену придётся перезапускать чаще, чем у зрелой модели; гид по видеомоделям поможет решить, когда стабильная модель выгоднее.
Вопросы
Обязательно ли загружать референсные картинки?
Нет. Обязателен только промпт, так что модель работает и как обычное видео из текста. Но выбирают её именно ради референсов.
Зачем аудиореференсы?
Это необязательные аудиофайлы, на которые может опираться звук клипа. Они в разделе Advanced; без них Generate audio всё равно пишет звук для сцены.
Можно сделать вертикальное видео?
Да. Выберите вертикальное соотношение сторон до запуска; широкое стоит только по умолчанию.


