视频

Vidu Q4 image to video:让一张图动起来,带声音和台词

如何用 Vidu Q4 Preview image to video 做出好片段:它擅长什么、三条现成提示词、真正重要的设置,以及一个坦白的局限。

阅读约 1 分钟
一张山间湖泊的照片立在暗色圆形底座上,下边缘卷成一圈发光的电影胶片,整体笼罩在紫光中

大多数图生视频模型只给你一段无声片段,声音留给你自己处理。Vidu Q4 Preview image to video 不一样:它接收一张图和一段提示词,默认会在生成动作的同时写出音频。在它页面上的一个示例里,一位网球选手赛后看着镜头说了一句话,嘴型和台词对得上。这正是选它的理由。如果你只需要几秒钟风景上的流云,模型页面上更便宜的同类模型也能做到。

你需要给它什么

  • 一张图片(必填)。它会成为第一帧,所以构图、光线和人脸都在这里决定。
  • 提示词(必填)。描述接下来发生什么,而不是图里已经有的东西。
  • 分辨率。 从轻量的试样尺寸到大的成片尺寸,默认是适中的一档。
  • 时长。 以整秒为单位的滑块。默认偏短;拉到最长足够说完一整句话再加一个反应。
  • Generate audio。 默认开启。片段要配你自己的音乐时就关掉。
  • Advanced: 提示词扩写(默认关闭)和种子。

它最擅长的地方

会说话的肖像,以及画面里有声源的小场景。说一句台词的角色、开始鸣叫的水壶、听得见的窗上雨声。声音和画面出自同一次生成,所以时间点往往一致:门在你听到关门声时关上。给它一张干净、光线好、主体占画面较大的起始帧,它就能让脸和衣服贴近你的原图,而不是跑偏。

三条起步提示词

提示词
女人放下球拍,喘了口气,看着镜头说:“这是我这辈子打过最难的一盘。”轻微手持镜头,背景是观众的低语。
适合人像起始帧。台词放在引号里,只写一句。
提示词
杯子里升起热气,勺子慢慢停止转动,背后是安静的咖啡馆人声和杯子的碰撞声。固定机位,不动。
适合产品或静物。一个动作,一种环境声。
提示词
雪继续落下,镜头缓缓推向小木屋,风穿过松林,窗里亮起一盏温暖的灯。
适合风景。亮起的灯给片段一个结尾。

用词和任何图生视频模型一样:一个镜头运动,一个主体动作,一种氛围。运动提示词词汇表整理了站得住的词和会让画面融化的词。这里新增的是声音这一栏:写明你想要的声音,而且只写一次。

实用技巧

  • 提示词写得仔细时,别开提示词扩写。 它会把短提示词改写成长的,对一句话的点子有帮助,对精确的提示词有害,尤其是你想要逐字说出的台词。
  • 调整期间固定种子。 改提示词前先设一个自己的种子数,这样每次改动都是唯一的变化。种子详解说明了为什么这能省下生成次数。
  • 时长要配合动作。 眨眼或喝一口用短片段,说一句话用长一点的。长片段配一个很小的动作,剩下的时间会被你没要求的运动填满。

坦白的局限

这是预览版模型,在说话上看得出来。清晰的短句效果好;长独白、人名和念出来的数字,是嘴型和台词开始错开的地方。每个片段的台词控制在一句,长的话拆成几个片段,每段从上一段的最后一帧开始。起始帧依然说了算:图里的手和小字不会因为动起来就变好,所以先修好它们(照片转视频分步指南讲了如何准备起始帧)。

常见问题

Vidu Q4 image to video 能让角色说话吗?

可以,需要开启 Generate audio。把台词放在引号里写进提示词,保持一句短句;起始帧里脸越大、光线越好,嘴型越贴合台词。

可以关掉声音吗?

可以。关闭 Generate audio,片段会以无声形式返回,方便配上你自己的音乐或旁白。

一个片段多少钱?

取决于你选择的分辨率和时长。运行前价格会显示在 Generate 按钮上,设置好两项后在那里查看。

#视频#模型#提示词

继续阅读

全部文章 →