Blog/tutorials·24. Sept. 2026·5 Min.·vom eroq-Team
Charakterstimmen in KI-Videos mit Seedance und Hailuo
Wie die Stimme eines Charakters in den Video-Render kommt: Zeilen in der Szene, Stimmbeschreibung, Stimmprobe als Audio-Referenz, welche Engine was kann.
Video-Engines mit Tonspur erfinden für jeden, der spricht, eine Stimme – in jedem Clip eine andere. Für eine einzelne Einstellung ist das in Ordnung, für einen Film tödlich. Die Antwort von eroq ist der Charakter: Gib einem Mitglied deiner Besetzung im Studio eine Stimme, schreib seine Zeile in eine Szene, und bei Engines, die eine Audio-Referenz annehmen, kommt die Zeile in genau dieser Stimme heraus, Szene für Szene. Dieser Leitfaden zeigt, was tatsächlich mit einem Render mitreist, bei welchen Engines, und wie du Dialoge schreibst, die in fünf Sekunden passen.
Was ein Charakter mitbringt
Ein Charakter im Studio hat ein Sheet (das Aussehen), eine Persona (wie er im Chat denkt und redet) und eine Stimme – eine Katalogstimme oder einen deiner Klone, zugewiesen im Tab „Stimme“ des Charakters. Drei dieser Dinge zählen fürs Video, eines nicht:
- Das Sheet reist als Referenzbild mit, damit das Gesicht stimmt.
- Die Stimmbeschreibung – eine einzeilige Beschreibung der Stimme, etwa „female voice, warm and low“ (weibliche Stimme, warm und tief) – reist bei jeder Engine mit Ton im Prompt mit.
- Die Stimmprobe – ein kurzes gesprochenes Sample der zugewiesenen Stimme, einmal gerendert und aufbewahrt – reist als Audio-Referenz mit, bei Engines, die eine annehmen.
- Die Persona landet nie in einem Video-Prompt. Die Engine rendert ein Bild; sie muss nicht wissen, wie die Figur streitet.
Welche Engine was macht
Drei Stufen, laut Engine-Tabelle:
- Audio-Referenz – Seedance 2.5, Seedance 2.0, Seedance 2.0 Fast, Seedance 2.0 Mini, Hailuo 3. Die Stimmprobe geht mit dem Render mit; die Zeilen des Charakters kommen in seiner Stimme heraus. Eine Stimmprobe pro Render – vom ersten Sprecher der Szene, der eine Stimme hat –, verlässlich ist also ein sprechender Charakter pro Szene. Eine durchgehende Einstellung, die mit dem letzten Frame der vorherigen Szene beginnt, trägt keine Referenzen und damit auch keine Stimmprobe: Ihre Stimmen reisen als Beschreibungen mit.
- Ton, keine Audio-Referenz – Veo 3.1 mit seinen Stufen Fast und Lite, Sora 2 Pro, Kling 3.0 und Pro, Wan 3.0, Motion One. Die Beschreibung reist im Prompt mit; die Engine besetzt eine Stimme, die zu den Worten passt. Konsistent innerhalb eines Clips, nicht über Clips hinweg.
- Kein Ton – Hailuo 3 Max, Runway Gen-4.5, Grok Imagine. Zeilen reisen trotzdem als Regieanweisung mit (ein Mund, der sich bewegt, eine Sprechweise); zu hören ist nichts. Füg die Stimme im Schnitt hinzu, aus dem Tool „Stimme“.
Das Look-Panel in Cinema zeigt, auf welcher Stufe die Engine des Films steht. Der Ton lässt sich bei jeder Engine mit Tonspur abschalten, und ohne Ton wird es günstiger, wo die Engine ihn extra berechnet.
Die Zeile schreiben
In Cinema stehen die Zeilen einer Szene in ihrer Karte: + Zeile unter der Handlung, dann Sprecher, Sprechweise und Text. Cinema schreibt jede davon in den eigenen Absatz der Szene, direkt nach der Handlung – Mina (whispering) says: "It's still lit." – und schließt den Prompt mit einem beschrifteten Voices-Satz ab, der sagt, wie jeder vertonte Charakter klingt, damit er jedes Mal gleich gelesen wird. Klapp auf der Karte Was die Engine liest auf, um den Absatz zu sehen. Ein paar Regeln, die aus ein paar hundert beobachteten Renders stammen:
- Eine Zeile pro fünf Sekunden. Ein kurzer Satz dauert gesprochen drei bis vier Sekunden. Zwei Sätze brauchen zehn.
- Sprechweise statt Adjektive. „flüsternd“, „zu sich selbst“, „ohne aufzusehen“ funktionieren; „emotional“ nicht.
- Satzzeichen sind Regie. Ein Gedankenstrich ist eine Pause, Auslassungspunkte lassen den Satz verklingen, ein Fragezeichen hebt das Ende an. Der Leitfaden zur Regie über Satzzeichen gilt fürs Video genauso wie für Sprachaufnahmen.
- Nenn den Sprecher auch in der Handlung, wenn zwei Personen im Bild sind: „Mina wendet sich Rook zu“ vor Minas Zeile, sonst gibt die Engine die Zeile dem, der der Kamera am nächsten ist.
- Keine Regieanweisungen im Text der Zeile. Die Zeile ist, was gesagt wird; die Sprechweise, wie. Mischst du beides, wird die Anweisung laut mitgesprochen.
Eine Szene von Anfang bis Ende
Die Szenenkarte:
INT. LIGHTHOUSE — DUSK
@Mina reaches the top of the spiral stairs, out of breath, slow push-in
as she sees the lamp.
MINA (whispering) It's still lit.
Gerendert mit Seedance 2.0 Mini, 5 Sekunden, Ton an – 45 Credits. Was die Engine bekommt: den Absatz der Szene – die Slugline, die Handlung mit der Ranfahrt, dann ihre Zeile mit der Sprechweise; Mina, gebunden an Referenzbild 1, ihr Sheet; die Kamerabewegung und den Look; und eine Voices-Zeile, die der Engine sagt, mit der Stimme aus dem Referenz-Audio zu sprechen – dazu ihre Stimmprobe als genau diese Audio-Referenz. Der Clip hat ihr Gesicht und ihre Stimme. Render Szene zwei mit einer anderen Zeile, und es ist dieselbe Stimme, weil dieselbe Stimmprobe mitging – solange Szene zwei keine durchgehende Einstellung ist. Eine Szene, die mit dem vorherigen Frame beginnt, schickt keine Stimmprobe, ihre Stimme kommt also aus der Beschreibung; für einen dialoglastigen Film, in dem die Stimme mehr zählt als der Fluss, schalte Durchgehende Einstellungen im Look-Panel aus.
Mit Kling 3.0 kostet dieselbe Szene 170 Credits, und die Stimme ist Klings Vermutung anhand der Beschreibung – eine gute, und in der nächsten Szene eine andere.
Wenn die Stimme exakt sein muss
Für eine Erzählstimme, ein Voice-over oder eine Zeile, die exakt der Klon sein muss, verlass dich gar nicht auf die Engine: Render die Zeile im Tool „Stimme“ mit der Stimme des Charakters (3 Credits pro 100 Zeichen) und leg die MP3 im Schnitt von Cinema unter das Bild – mit stummgeschaltetem oder abgesenktem Originalton des Clips. Die Tonspur der Engine ist dann Atmosphäre; die Worte gehören dir. Bei Engines ohne Ton ist das auch der einzige Weg.
Grenzen, klar gesagt
- Eine Stimmprobe pro Render. Bei einem Dialog zu zweit bekommt der erste Sprecher seine Stimmprobe, der andere die Beschreibung.
- Die Stimmprobe ist eine Referenz, kein Skript: Die Engine spricht in dieser Stimme; sie synchronisiert keine Lippen zu einer Aufnahme.
- Die Sprache folgt der Zeile. Eine deutsche Zeile in einer Stimme, die aus englischer Sprache geklont wurde, kommt mit Akzent heraus – genau wie im Tool „Stimme“.
- Datenschutz: Die Stimmprobe ist ein signierter Link aus deinem eigenen Speicher, gültig lange genug für die Warteschlange der Engine.
Häufige Fragen
Beeinflusst die Persona des Charakters, wie die Zeile gesprochen wird?
Nein. Die Persona ist für den Chat. Der Vortrag ergibt sich aus der Sprechweise, den Satzzeichen und der Stimme selbst.
Können zwei Charaktere in einer Szene sprechen?
Beide Zeilen reisen mit ihren Beschreibungen im Prompt mit. Pro Render geht nur eine Stimmprobe mit, eine der beiden Stimmen besetzt also die Engine. Teil den Wortwechsel auf zwei Szenen auf, um zwei exakte Stimmen zu bekommen, mit ausgeschalteten durchgehenden Einstellungen – eine Szene, die mit dem vorherigen Frame beginnt, schickt keine Stimmprobe.
Welche Engine hält die Stimme am konsistentesten?
Die Seedance-Familie und Hailuo 3, weil sie die Stimmprobe annehmen. Anderswo hält die Beschreibung die Art der Stimme konsistent, nicht die Stimme selbst.
Kostet die Stimmprobe etwas?
Nein. Sie wird einmal pro Stimme gerendert und aufbewahrt; ein Render auf einer Engine mit Audio-Referenz schickt sie ohne Aufpreis mit.
Weise im Tab „Stimme“ eines Charakters eine Stimme zu und schreib dann die Zeile in eine Szenenkarte in Cinema.
Mach das mit den Modellen hinter diesem Artikel – starte mit 50 Gratis-Credits oder sieh dir alle Engines und ihre Preise an.