音声・音声セリフ・会話付きのAI動画を生成する方法
MyDreamVid · 2026-09-11
多くの人は無音のクリップからAI動画に出会い、それからエディターで一晩かけて音を足します。Seedance は音声を映像と一緒に生成します。シーンに合った環境音、動きに同期した効果音、そして誰もが驚く部分——発話されるセリフです。
クリップに音声セリフを入れる
プロンプトの中で、言葉を引用符で囲むだけ。それだけです。
屋台の店主が湯気の立つ鍋をかき混ぜ、こう呼びかける。「熱々の麺、今夜最後の一鍋だよ!」
セリフは自然なイントネーションで発話され、これは最も安いモデル(2.0 Mini)でも機能します。トーンは普通の描写で操作できます。ささやく、雨に負けじと叫ぶ、疲れた様子で言う など。
動物がしゃべるトリック
検証済みの落とし穴が一つ。動物に対して「口が言葉に合わせて動く」ことを求めると、モデルは不気味なほど人間的な唇と歯を動物に移植しがちです。リップシンクの学習映像のほとんどが人間の顔だからです。対策はボイスオーバー構文です。
子猫の声はボイスオーバーとして聞こえる。口は自然な猫の口のままで、ごくわずかな動きだけ、人間のような唇や歯はなし。「しゃべる」間に小さく頭を傾け、耳をぴくつかせる。
愛らしさは保ったまま、ボディホラーは避けられます。Seedance 2.5 は「口を自然に保つ」制約も、Mini や Fast より従順に守ります。
音声のコスト
音声はデフォルトでオンで、価格はモデルによって異なります。長いクリップに踏み切る前に知っておく価値があります。
- Seedance 2.0 Fast と 2.0 Mini:音声は無料。音声オン・オフで価格は同じです。
- Seedance 2.5 と 2.0:音声はクリップの価格をおよそ倍にします。これらのモデルでは、映像をドラフトする間は音声をオフにし、最終レンダリングでオンにしましょう。
いずれにせよ、ジェネレーターは開始前に実際の設定での正確なクレジットコストを見積もります。料金ページに秒単価の表があります。
リファレンス音声:リズムを決める
reference-to-video モードでは、音声ファイル(最大5分)を添付し、プロンプトで指し示せます。「@Audio1 がリズムを決める」 のように。動きをビートに合わせて切るのに便利です。リファレンス音声はその長さに応じて出力とは別に課金され、見積もりではその追加分が生成前に個別に表示されます。
代わりにエディターで音を足すべきとき
生成される音声はシーンの音、つまり環境音、効果音、セリフです。ライセンス取得済みの楽曲、正確なナレーション、あるいはマルチショット映画の連続したスコアには、クリップを書き出し(映画制作ワークスペースはショットの ZIP とラフカットの MP4 を用意します)、任意のエディターで楽曲を重ねてください。音楽ベッドの下に敷いた生成環境音は、たいていうまく混ざります。
よくある質問
すべてのモデルが音声に対応していますか?
はい。4つの Seedance 動画モデルすべてが音声を生成し、ネイティブ音声は特に 2.5 の強みです。
音声をオフにできますか?
はい、生成ごとに。2.5 と 2.0 では価格がおよそ半分になります。Fast と Mini では価格は変わりません。
特定の声をクローンできますか?
いいえ。声はサンプルからクローンするのではなくシーンに合わせて生成され、実在の人物のなりすましはコンテンツポリシーに違反します。
セリフのムードが違って出ました。どう直せばいいですか?
脚本家のように演出しましょう。引用符の前後の地の文に演技を書き込みます。「彼女は目も上げず、平坦に言う。『わかってる。』」 のように。そして再生成します。Mini でドラフトすれば、こうしたやり直しも安く済みます。