Blog/tutorials·10. Sept. 2026·5 Min.·vom eroq-Team
KI-Voice-over fürs Video – so geht's von Anfang bis Ende
Skript schreiben, ausdrucksstark vertonen, auf den Clip timen und in Premiere mit dem eroq-Panel unter den Schnitt legen. Ein Praxis-Workflow.
Ein stummer KI-Clip ist Tapete. Derselbe Clip mit dreißig Sekunden Sprechertext ist Content, den jemand bis zum Ende schaut. Ein Voice-over ist das günstigste Upgrade der ganzen Pipeline – ein Skript mit hundert Wörtern kostet ein paar Credits, das Footage darunter hundert oder mehr.
Vor den Schritten eine Klarstellung, weil sie alles andere bestimmt: Es geht um Sprechertext, nicht um Lippensynchronisation. Nichts hier bringt einen Mund mit deinem Audio in Einklang. Du baust eine separate Tonspur, die über deinem Footage läuft, so wie bei einer Doku oder einem Faceless-Kanal. Schreib dafür, und es funktioniert wunderbar. Erwartest du einen sprechenden Mund, wirst du enttäuscht.
Schritt 1 – schreib das Skript dort, wo Umschreiben billig ist
Schreib im Tool „Text“, nicht im Eingabefeld für die Stimme. Zwei Gründe: Du bekommst ein Modell, das gut in Prosa ist, und einen Chat, in dem du iterieren kannst, ohne jedes Mal Audio neu zu rendern.
Wähl den Stil bewusst. Szene liefert immersive Prosa – die richtige Wahl für Sprechertext über einem Film. Nachrichten liefert kurze Zeilen im Chat-Stil – die richtige Wahl, wenn ein Charakter spricht, oder für knackige Werbetexte. Eine Antwort kostet je nach Modell 1 oder 3 Credits, das Entwerfen ist neben dem Footage also praktisch gratis.
Zwei Regeln, die wichtiger sind als der Text selbst:
- Schreib kürzer als der Clip. Stille am Anfang und Ende einer Einstellung ist ein Geschenk für deinen Schnitt. Eine Tonspur, die jeden Frame füllt, hat keinen Raum zum Atmen.
- Schreib in Sätzen, die du auch laut sagen würdest. Stolperst du beim Lesen, stolpert die Engine auch.
Schritt 2 – wähl eine Stimme
Öffne das Tool „Stimme“. Die kuratierte Auswahl umfasst Aria, warm und nah, weiblich, und Orion, tief und ruhig, männlich, in 13 Sprachen, neben dem Rest des Katalogs. Such nach Name, Kategorie oder Sprache und hör dich durch die Auswahl, bevor du dich festlegst.
Brauchst du eine bestimmte Stimme, die nicht in der Auswahl ist, klon eine aus deinem eigenen Audio – auf der Seite zum Stimmklonen steht, was ein brauchbares Sample ausmacht. Klone verhalten sich danach überall im Studio genau wie Studio-Stimmen. Auch ein gespeicherter Charakter kann eine Stimme tragen, aus der Auswahl oder geklont, sodass ein wiederkehrender Sprecher über eine ganze Serie gleich bleibt, ohne dass du dir merken musst, welche Stimme du genommen hast.
Schritt 3 – rendern
Zwei Modelle, dieselbe Auswahl, dieselben Klone:
- Voice One – das ausdrucksstarke Flaggschiff, 3 Credits pro 100 Zeichen, Ausgabe als MP3. Nimm es für alles, was jemand mehr als einmal hören wird.
- Voice Turbo – schneller, 2 Credits pro 100 Zeichen. Nimm es für Entwürfe, Timing-Tests und lange Formate, bei denen das Budget die Grenze setzt.
Beide haben die Regler Tempo und Ausdruck. Zum Tempo greifst du, wenn eine Zeile drei Sekunden zu lang für ihre Einstellung ist. Beim Ausdruck lohnt sich ein Test in beide Richtungen – Sprechertext will meist weniger, als du denkst, Charakterzeilen meist mehr.
Jeder Render landet wie alles andere in deiner Bibliothek, sodass du zu dem Take zurückkehren kannst, der dir gefallen hat.
Schritt 4 – Satzzeichen sind die Regie
Einen eigenen Emotionsparameter gibt es nicht. Der Vortrag folgt dem Text selbst, genauer gesagt den Satzzeichen – dein Skript ist also die Regie. Ehrlich betrachtet bekommst du damit Folgendes:
- Ein Punkt beendet den Gedanken und senkt die Tonhöhe.
- Ein Komma ist ein kurzes Anheben, kein Halt.
- Ein Gedankenstrich – wie dieser hier – hält den Moment länger als ein Komma.
- Auslassungspunkte lassen ausklingen und machen das Ende weicher.
- Ein Fragezeichen hebt an, auch mitten im Absatz.
- Absätze sind die längste Pause, die du anfordern kannst.
Ein Skript, geschrieben für den Vortrag statt fürs Papier:
Er ließ die Schlüssel auf dem Tisch liegen. Kein Zettel – nichts.
Ich stand lange da, einen Kaffee in der Hand, der längst kalt war, und versuchte herauszufinden, welchem Teil davon ich eigentlich zugestimmt hatte.
Und das Seltsamste? Die Tür war immer noch nicht abgeschlossen.
Lies das laut, und du hörst, wo es atmet. Das ist der Test. Willst du eine längere Pause, setz einen Absatz; klingt eine Zeile flach, hilft meist ein Gedankenstrich, wo du ein Komma geschrieben hast.
Was Satzzeichen nicht können: einem Satz eine Emotion anschrauben, die er nicht hat. Schreib das Gefühl in die Worte.
Schritt 5 – auf den Clip timen
Mach das, bevor du einen Editor öffnest, nicht danach.
- Lies das Skript mit Stoppuhr laut vor. Mit dieser Zahl kannst du gut genug planen.
- Wähl die Cliplänge passend dazu – Engines rendern je nach Modell 3 bis 30 Sekunden, und dein Plan begrenzt das Maximum auf 10, 15, 20 oder 30 Sekunden.
- Render die Stimme zuerst mit Turbo und hör sie dir zum Clip an.
- Ist es zu lang, streich Wörter, bevor du das Tempo erhöhst. Mehr als ein leichter Schubs beim Tempo klingt schnell nach Hetze.
- Render die finale Fassung mit dem Flaggschiff-Modell neu, sobald die Wörter stehen.
Bei Sequenzen arbeite pro Einstellung statt pro Film. Eine lange Sprecherspur über sechs Clips heißt, dass jede Schnittänderung ein neues Rendering erzwingt; sechs kurze Zeilen heißen, dass eine Änderung nur eines kostet. So bleiben auch Workflows für Faceless YouTube bei großen Mengen wartbar.
Schritt 6 – unter den Schnitt legen
Lade die MP3 herunter und zieh sie in das Programm, in dem du schneidest. Ist das Premiere Pro oder After Effects, spart dir das eroq-Panel den Umweg: Generiere Video, Bilder oder Sprache direkt im Panel, und die Renders werden sofort ins offene Projekt importiert, die Dateien landen in deinem Ordner „Dokumente“. Zeile generieren, auf die Timeline ziehen, anpassen, die nächste generieren – ohne den Schnitt zu verlassen.
Dann misch wie ein Mensch. Die Stimme liegt oben, alles andere duckt sich darunter, und das letzte Wort sollte vor dem letzten Frame landen. Bringt eine Einstellung eigenen Ton mit, weil die Engine nativ Sound rendert, lass diesen Klangteppich unter dem Sprechertext mitlaufen, statt ihn stummzuschalten – Atmo unter einer Stimme macht den Großteil dessen aus, was nach „produziert“ klingt.
Die Speech-Doku behandelt dasselbe von der API-Seite, falls du es skripten willst, und im Tool „Video“ entsteht die Footage-Hälfte.
Häufige Fragen
Kann eroq einen Charakter lippensynchron zu meinem Voice-over machen?
Nein. Lippensynchronisation gibt es nicht. Die Tonspur entsteht unabhängig vom Footage, und das macht sie ideal für Sprechertexte, Werbung und Faceless-Content – schreib und schneide mit genau dieser Annahme.
Was kostet ein Voice-over?
3 Credits pro 100 Zeichen mit dem Flaggschiff und 2 mit dem schnelleren Modell, Ausgabe als MP3. Ein Skript mit 600 Zeichen kostet rund 18 oder 12 Credits – wenig im Vergleich zum Clip, über dem es läuft.
Kann ich denselben Sprecher für eine ganze Serie verwenden?
Ja. Wähl eine Studio-Stimme oder klon eine und verknüpf sie mit einem gespeicherten Charakter, damit jedes Mal dieselbe Stimme ausgewählt ist. Klone funktionieren überall, wo auch Studio-Stimmen funktionieren.
Schreiben, sprechen, schneiden. Öffne das Tool „Stimme“ – neue Konten starten mit 50 Gratis-Credits.
Mach das mit den Modellen hinter diesem Artikel – starte mit 50 Gratis-Credits oder sieh dir alle Engines und ihre Preise an.