视频

Vidu Q4 reference to video:用多张参考图生成一段视频

Vidu Q4 reference to video 用多张参考图组合出一段视频。适合谁、现成提示词,以及让角色保持一致的技巧。

阅读约 1 分钟
一枚黑色相机镜头悬浮在近乎全黑的背景上,三道细细的紫色光束汇聚进镜片

它解决的是这样一个问题:你有一个角色、一件夹克、一个场景和一件产品,各在一张图里,而你想让它们出现在同一个镜头中。图生视频模型只能从一帧开始,所以你得先把这张合成帧画出来。Vidu Q4 Preview reference to video 省掉了这一步:给它一叠参考图和一段提示词,它就围绕这些参考搭建场景。它页面上的示例是一段时尚短片,一个穿皮夹克、戴墨镜的男人走过工业风空间,这种镜头通常需要专门布置的起始帧。

谁应该选它

  • 品牌和时尚:场景是新的,但服装或产品必须一眼认得出。
  • 有固定角色的系列内容。 每一集都给同样的脸和服装参考,角色就始终是同一个人。
  • 没有起始帧的人。 如果你更愿意描述场景而不是画出来,就选它;如果已经有确切的那一帧,请用image to video 版本。

各项输入及其用途

Prompt 是唯一的必填项。Images 可以一次放多张参考(能放下相当多张)。Advanced 里的 Audios 可以放几段音频参考,作为片段声音的补充,叠加在 Generate audio 自己生成的声音之上。然后是常规设置:画幅比例(默认宽屏,另有竖屏、方形和两种中间比例)、从轻量试样到大尺寸成片的 分辨率、以整秒计的 时长、Generate audio(默认开启)和 种子。

现成提示词

提示词
肖像里的男人穿着其他照片中的皮夹克和墨镜,穿过一座混凝土仓库走向镜头。缓慢跟拍,高窗透进冷色日光,脚步声回响。
参考:一张脸、一件夹克、一副墨镜。宽屏。
提示词
参考图中的香水瓶立在湿润的黑色石头上,一滴水落在瓶盖上,缓慢的微距推进,柔和的紫色轮廓光,低沉安静的嗡鸣。
参考:产品的两个角度。方形,适合商品页。
提示词
第一张图里的女孩坐在第二张图里的火车座位上,望向窗外,轻声说:“我们快到家了。”雨打在玻璃上。
参考:她的肖像和车厢内景。竖屏,适合快拍。

保持一致的技巧

  1. 少而干净的参考胜过多而杂乱的参考。 一张纯色背景的脸部照片加一张服装照片,比十张互相矛盾的随手拍更有用。
  2. 每张参考只放一个主体。 一张有三个人的图,会让模型猜你指的是谁。
  3. 草稿用最低分辨率和最短时长。 Generate 按钮上的价格随两者变化。场景成立后,固定种子,再按需要的尺寸出最终片。
  4. 整个系列使用同一套参考,顺序不变,提示词里的角色描述也沿用。风格一致性指南详细讲了如何建立可复用的参考集。

坦白的局限

参考是引导,不是粘贴。标志、衣服上的印字和精细首饰只会大致还原,参考越多,每一张被平均得越厉害。当某个小细节必须准确时,先生成一张细节正确的起始帧,再用 image to video。它也是预览版模型,所以重跑的次数会比成熟模型多;视频模型选择指南能帮你判断什么时候换一个更稳定的模型更划算。

常见问题

必须上传参考图吗?

不必。只有提示词是必填的,所以它也能当作普通的文生视频使用。不过,参考图才是选它的理由。

音频参考有什么用?

它们是可选的音频文件,片段的声音可以以此为依据。位于 Advanced 中;不加的话,Generate audio 依然会为场景生成声音。

能做竖屏视频吗?

能。运行前选择竖屏比例即可;宽屏只是默认值。

#视频#模型#一致性

继续阅读

全部文章 →