Vidu Q4 image to video:让一张图动起来,带声音和台词
如何用 Vidu Q4 Preview image to video 做出好片段:它擅长什么、三条现成提示词、真正重要的设置,以及一个坦白的局限。

大多数图生视频模型只给你一段无声片段,声音留给你自己处理。Vidu Q4 Preview image to video 不一样:它接收一张图和一段提示词,默认会在生成动作的同时写出音频。在它页面上的一个示例里,一位网球选手赛后看着镜头说了一句话,嘴型和台词对得上。这正是选它的理由。如果你只需要几秒钟风景上的流云,模型页面上更便宜的同类模型也能做到。
你需要给它什么
- 一张图片(必填)。它会成为第一帧,所以构图、光线和人脸都在这里决定。
- 提示词(必填)。描述接下来发生什么,而不是图里已经有的东西。
- 分辨率。 从轻量的试样尺寸到大的成片尺寸,默认是适中的一档。
- 时长。 以整秒为单位的滑块。默认偏短;拉到最长足够说完一整句话再加一个反应。
- Generate audio。 默认开启。片段要配你自己的音乐时就关掉。
- Advanced: 提示词扩写(默认关闭)和种子。
它最擅长的地方
会说话的肖像,以及画面里有声源的小场景。说一句台词的角色、开始鸣叫的水壶、听得见的窗上雨声。声音和画面出自同一次生成,所以时间点往往一致:门在你听到关门声时关上。给它一张干净、光线好、主体占画面较大的起始帧,它就能让脸和衣服贴近你的原图,而不是跑偏。
三条起步提示词
女人放下球拍,喘了口气,看着镜头说:“这是我这辈子打过最难的一盘。”轻微手持镜头,背景是观众的低语。杯子里升起热气,勺子慢慢停止转动,背后是安静的咖啡馆人声和杯子的碰撞声。固定机位,不动。雪继续落下,镜头缓缓推向小木屋,风穿过松林,窗里亮起一盏温暖的灯。用词和任何图生视频模型一样:一个镜头运动,一个主体动作,一种氛围。运动提示词词汇表整理了站得住的词和会让画面融化的词。这里新增的是声音这一栏:写明你想要的声音,而且只写一次。
实用技巧
- 提示词写得仔细时,别开提示词扩写。 它会把短提示词改写成长的,对一句话的点子有帮助,对精确的提示词有害,尤其是你想要逐字说出的台词。
- 调整期间固定种子。 改提示词前先设一个自己的种子数,这样每次改动都是唯一的变化。种子详解说明了为什么这能省下生成次数。
- 时长要配合动作。 眨眼或喝一口用短片段,说一句话用长一点的。长片段配一个很小的动作,剩下的时间会被你没要求的运动填满。
坦白的局限
这是预览版模型,在说话上看得出来。清晰的短句效果好;长独白、人名和念出来的数字,是嘴型和台词开始错开的地方。每个片段的台词控制在一句,长的话拆成几个片段,每段从上一段的最后一帧开始。起始帧依然说了算:图里的手和小字不会因为动起来就变好,所以先修好它们(照片转视频分步指南讲了如何准备起始帧)。
常见问题
Vidu Q4 image to video 能让角色说话吗?
可以,需要开启 Generate audio。把台词放在引号里写进提示词,保持一句短句;起始帧里脸越大、光线越好,嘴型越贴合台词。
可以关掉声音吗?
可以。关闭 Generate audio,片段会以无声形式返回,方便配上你自己的音乐或旁白。
一个片段多少钱?
取决于你选择的分辨率和时长。运行前价格会显示在 Generate 按钮上,设置好两项后在那里查看。


