Wie man KI-Video mit Ton, Sprache und Dialog generiert
MyDreamVid · 2026-09-11
Die meisten Menschen entdecken KI-Video über stumme Clips und verbringen dann einen Abend im Editor, um Ton hinzuzufügen. Seedance generiert Audio zusammen mit dem Video: Umgebung, die zur Szene passt, Effekte, die mit der Handlung synchron sind, und — der Teil, der alle überrascht — gesprochenen Dialog.
Sprache in einen Clip bekommen
Setze die Worte in Anführungszeichen, in den Prompt. Das ist alles:
Ein Straßenhändler rührt in einem dampfenden Topf und ruft: „heiße Nudeln, letzter Topf heute Abend!“
Die Zeile wird mit natürlicher Betonung gesprochen, und das funktioniert sogar beim günstigsten Modell (2.0 Mini). Der Ton lässt sich mit schlichter Beschreibung steuern — flüstert, ruft über den Regen hinweg, sagt müde.
Der Trick mit sprechenden Tieren
Eine erprobte Falle: Wenn du ein Tier verlangst, dessen „Maul sich synchron zu den Worten bewegt“, neigen Modelle dazu, unheimlich menschliche Lippen und Zähne auf das Tier zu pfropfen, weil fast alles Lippensynchron-Trainingsmaterial menschliche Gesichter zeigt. Die Lösung ist eine Voice-over-Konstruktion:
Die Stimme des Kätzchens ist als Voice-over zu hören; sein Maul bleibt ein natürliches Katzenmaul mit nur winzigen Bewegungen, keine menschenähnlichen Lippen oder Zähne. Kleine Kopfneigungen und zuckende Ohren, während es „spricht“.
Du behältst den Charme und verlierst den Body-Horror. Seedance 2.5 befolgt „halte das Maul natürlich“-Vorgaben auch gehorsamer als Mini oder Fast.
Was Audio kostet
Audio ist standardmäßig aktiviert, und die Preisgestaltung unterscheidet sich je nach Modell — das solltest du wissen, bevor du dich auf einen langen Clip festlegst:
- Seedance 2.0 Fast und 2.0 Mini: Audio ist kostenlos — der Preis ist mit Audio an oder aus identisch.
- Seedance 2.5 und 2.0: Audio verdoppelt den Preis des Clips in etwa. Schalte Audio bei diesen Modellen aus, während du Bilder entwirfst, und schalte es für den finalen Render an.
So oder so beziffert der Generator die genauen Credit-Kosten für deine tatsächlichen Einstellungen, bevor du startest — die Preisseite hat die Tabelle pro Sekunde.
Referenz-Audio: den Rhythmus vorgeben
Im Referenz-zu-Video-Modus kannst du eine Audiodatei (bis zu 5 Minuten) anhängen und im Prompt darauf verweisen — „@Audio1 gibt den Rhythmus vor“ — nützlich, um Bewegung auf einen Beat zu schneiden. Beachte, dass Referenz-Audio zusätzlich zur Ausgabe nach seiner eigenen Länge abgerechnet wird und der Kostenvoranschlag diesen Zusatz vor der Generierung gesondert ausweist.
Wann du Ton stattdessen im Editor hinzufügst
Generiertes Audio ist Szenenton — Umgebung, Effekte, Dialog. Für einen lizenzierten Musiktrack, präzise Erzählung oder die durchgehende Filmmusik eines mehrteiligen Films exportiere deine Clips (der Film-Workspace gibt dir ein ZIP der Shots plus eine Rohschnitt-MP4) und lege den Track in einem beliebigen Editor. Generierte Umgebung unter einem Musikbett mischt sich meist gut.
Häufig gestellte Fragen
Unterstützt jedes Modell Audio?
Ja — alle vier Seedance-Videomodelle generieren Audio, wobei natives Audio eine besondere Stärke von 2.5 ist.
Kann ich Audio ausschalten?
Ja, pro Generierung. Bei 2.5 und 2.0 halbiert das den Preis in etwa; bei Fast und Mini ändert sich der Preis nicht.
Kann es eine bestimmte Stimme klonen?
Nein — Stimmen werden passend zur Szene generiert, nicht aus Samples geklont, und das Imitieren echter Personen verstößt gegen die Inhaltsrichtlinie.
Der Dialog kam in der falschen Stimmung heraus. Wie behebe ich das?
Führe Regie wie ein Drehbuchautor: Setze die Vortragsweise in die Prosa rund um das Zitat — „sagt sie tonlos, ohne aufzublicken, ‚Ich weiß.'“ — und generiere neu. Entwürfe auf Mini halten diese Wiederholungen günstig.