Vidu Q4 image to video: 1枚の画像を音声とセリフ付きで動かす
Vidu Q4 Preview image to video で良いクリップを作るコツ。得意なこと、すぐ使えるプロンプト3つ、効く設定、そして正直な弱点を紹介します。

画像から動画を作るモデルの多くは無音のクリップを返し、音はこちら任せです。Vidu Q4 Preview image to video は違います。画像1枚とプロンプト1つを受け取り、初期設定のまま動きと一緒に音声も書き出します。モデルページの作例のひとつでは、試合を終えたテニス選手がカメラを見てひと言話し、口の動きが言葉に合っています。これこそ選ぶ理由です。風景の上を雲が流れる数秒だけが欲しいなら、モデル一覧にあるもっと安い近縁モデルで十分です。
渡すもの
- 画像1枚(必須)。これが最初のフレームになるので、構図、光、顔はここで決まります。
- プロンプト(必須)。画像にすでにあるものではなく、次に起きることを書きます。
- 解像度。 軽い試作サイズから大きな仕上げサイズまでの一覧で、初期値はほどよい中間です。
- 長さ。 秒単位のスライダー。初期値は短めで、上限ならひと続きのセリフと反応まで収まります。
- Generate audio。 初期設定でオン。自分の音楽を乗せるクリップならオフにします。
- Advanced: プロンプト拡張(初期設定でオフ)とシード。
得意なところ
話す人物のポートレートと、音の出どころがある小さな場面です。ひと言話すキャラクター、鳴り始めるやかん、聞こえる窓の雨。音と映像が同じ生成から出てくるので、タイミングがそろいやすく、ドアは閉まる音と同時に閉まります。被写体を大きく写した、きれいで明るい開始フレームを渡せば、顔や服装が元の画像から崩れにくくなります。
最初に試す3つのプロンプト
女性がラケットを下ろし、息を整え、カメラを見て言う。「人生でいちばんきつい1セットだった」。わずかな手持ちカメラ、背景に観客のざわめき。カップから湯気が立ちのぼり、スプーンの回転がゆっくり止まる。背後に静かなカフェのざわめきとカップの触れ合う音。カメラは固定。雪が降り続くなか小屋へゆっくり寄っていく。松林を風が吹き抜け、窓に温かい明かりがひとつ灯る。語彙はほかの画像から動画モデルと同じで、カメラの動き1つ、被写体の動作1つ、空気感1つです。動きのプロンプト用語集に、効く言葉と画を溶かす言葉をまとめています。ここで新しいのは音の枠です。欲しい音を名指しし、それを1回だけ書きます。
使いこなしのコツ
- 丁寧に書いたプロンプトならプロンプト拡張はオフのままに。 短いプロンプトを長く書き換える機能なので、ひと言のアイデアには効きますが、正確なプロンプト、特に一字一句そのまま話してほしいセリフには逆効果です。
- 調整中はシードを固定。 プロンプトを変える前に自分でシード値を決めておけば、変化はその修正だけになります。シードの解説に、生成回数を節約できる理由があります。
- 長さは動作に合わせる。 まばたきやひと口なら短く、セリフなら長めに。長いクリップに小さな動作だけだと、残りを頼んでいない動きで埋められます。
正直な弱点
プレビュー版のモデルで、それがセリフに出ます。はっきりした短い文はうまくいきますが、長い独白、人名、数字の読み上げでは口と言葉がずれ始めます。セリフは1クリップ1文までにし、長い話は前のクリップの最終フレームから始める複数のクリップに分けましょう。そして開始フレームが主役なのは変わりません。画像の中の手や小さな文字は動かしても良くならないので、先に直しておきます(準備の手順は写真から動画へのステップガイドにあります)。
よくある質問
Vidu Q4 image to video でキャラクターに話させられますか?
はい、Generate audio がオンなら可能です。セリフをかぎ括弧に入れてプロンプトに書き、短い1文にします。開始フレームで顔が大きく明るく写っているほど、口が言葉によく合います。
音をオフにできますか?
できます。Generate audio をオフにすると無音のクリップが返り、自分の音楽やナレーションを乗せられます。
1本いくらかかりますか?
選んだ解像度と長さで変わります。価格は実行前に Generate ボタンに表示されるので、両方を設定してそこで確認してください。


