Rabatt auf Premium-Pläne, wenn du dich registrierstRabatt sichern

Blog/tutorials·2. Sept. 2026·6 Min.·vom eroq-Team

Mehrsprachiges KI-Voice-over: 13 Sprachen, ein Skript

Einen Film mit KI-Stimme in 13 Sprachen vertonen: Skript vorbereiten, Satzzeichen als Regie, eine Stimme einmal besetzen und Credits pro Zeichen.


Einen Kurzfilm zu lokalisieren hieß früher: dreizehn Buchungen, dreizehn Studios, dreizehn Rechnungen. Heute heißt es dreizehn Textfelder, und das klingt einfacher, als es ist – die Aufnahme war nie das Schwierige. Schwierig ist, dass ein Skript, das für eine Sprache geschrieben, in einem bestimmten Rhythmus gelesen und unter ein Bild gelegt wurde, das auf genau diesen Rhythmus geschnitten ist, die Übersetzung nicht übersteht, wenn du nicht dafür planst. In diesem Leitfaden geht es um die Vorbereitung, die Satzzeichen und die Rechnung.

Was dir das Tool „Stimme“ wirklich bietet

Das Tool „Stimme“ ist Text-zu-Sprache mit einer kuratierten Auswahl an Stimmen – Aria, warm und nah; Orion, tief und ruhig –, die in dreizehn Sprachen lesen, dazu Stimmklonen aus deinen eigenen Aufnahmen, Regler für Tempo und Ausdruck und eine Sprechweise, die sich nach den Satzzeichen des eingefügten Textes richtet. Ausgegeben wird MP3.

Zwei Modelle, dieselben Stimmen, dieselben Klone:

  • Voice One – das ausdrucksstarke Flaggschiff, 3 Credits pro 100 Zeichen.
  • Voice Turbo – schneller, 2 Credits pro 100 Zeichen.

Weil beide dieselben Stimmen nutzen, kannst du jede Sprache mit Turbo entwerfen und nur die gelungenen Fassungen mit Voice One neu einlesen lassen, ohne etwas neu zu besetzen. Das spart in der Erkundungsphase ganz nebenbei ein Drittel.

Bereite das Skript vor, bevor du besetzt

Vier Dinge, die du klären solltest, solange das Skript noch Text ist.

Schreib fürs Ohr. Sätze, die ein Leser verzeiht, verliert ein Zuhörer. Ziel auf einen Gedanken pro Satz und bring das Verb früh. Wenn du eine Zeile nicht in einem Atemzug sprechen kannst, wird die Engine dir auch keinen vortäuschen.

Schreib alles aus, was eine Maschine erraten müsste. Zahlen, Einheiten, Währungen, Daten, Abkürzungen, Artikelnummern. „1080p“, „2026“ und „ca.“ sind Typografie, keine Sprache; schreib, was du hören willst. Das ist in jeder Sprache die mit Abstand häufigste Ursache für falsch klingende Takes.

Plan Platz für Ausdehnung ein. Derselbe Satz ist in jeder Sprache unterschiedlich lang – manchmal merklich länger als im Original. Wenn dein Bild auf die Lesung der Originalsprache geschnitten ist, rennen die anderen zwölf gegen eine Wand. Lass am Ende jedes Abschnitts Luft oder schneide das Bild auf die längste Lesung und lass die kurzen atmen.

Übersetze die Bedeutung, nicht den Rhythmus. Eine Wort-für-Wort-Übersetzung einer Zeile, die für den englischen Rhythmus geschrieben wurde, klingt in den meisten anderen Sprachen wie ein Erpresserbrief. Lass das Skript jeder Sprache so schreiben, als wäre es das Original, und prüf dann, ob es in den Takt passt.

Die Satzzeichen sind die Regie

Im Prompt versteckt sich kein Regler für die Darbietung. Die Sprechweise kommt aus Satzzeichen, Satzlänge und den Reglern für Tempo und Ausdruck, und das ist tatsächlich das meiste, was du brauchst:

  • Punkt. Ein Halt und ein Neustart der Tonhöhe.
  • Komma. Ein kurzer Atemzug. Zwei Kommas um einen Einschub sind der billigste Weg, eine Zeile zu verlangsamen.
  • Auslassungspunkte. Ein auslaufender, unvollendeter Gedanke. Wirkungsvoll und schnell überstrapaziert – höchstens einmal pro Absatz.
  • Gedankenstrich. Eine Unterbrechung, härter als ein Komma.
  • Fragezeichen. Ein Anheben am Ende der Zeile. Rhetorische Fragen sind der einfachste Weg, Melodie in eine flache Erzählung zu bringen.
  • Absatz. Eine echte Pause. Gliedere eine Lesung mit Leerzeilen, so wie du ein Gedicht setzen würdest.

Die Regel ist in jeder Sprache dieselbe, die Zeichen sind es nicht. Schreib jedes Skript mit den Satzzeichen seiner eigenen Sprache, so gesetzt, wie ein muttersprachlicher Typograf sie setzen würde, und lass diese Zeichen steuern. Verpflanze keine englischen Komma-Gewohnheiten in eine Sprache, die an anderen Stellen atmet, und entferne nicht die eigenen Zeichen einer Sprache, nur damit die Datei ordentlich aussieht – damit löschst du die Regie. Welche Sprachen eine Stimme liest, zeigt dir verbindlich die Sprachauswahl im Studio.

Ein vollständiger Erzählblock, gesetzt für die Sprechweise statt für den Deutschunterricht:

Nach sieben kommt niemand mehr in den zwölften Stock. Die Aufzüge fahren noch – sie öffnen nur nicht mehr. Das hat sie in ihrer dritten Nacht gelernt, allein, mit einem Ausweis, der jede Tür öffnete außer einer. Und die eine, die nicht aufging? Sie war nicht abgeschlossen. Jemand hielt sie zu.

Sechs Sätze, ein Gedankenstrich, bewusst keine Auslassungspunkte, eine rhetorische Frage, neunzig Sekunden Bild. Einfügen, auf „Generieren“ klicken und zuerst das Tempo anpassen, bevor du irgendetwas anderes anfasst.

Einmal besetzen, für immer wiederverwenden

Wähl die Stimme in einer Sitzung, für alle dreizehn Sprachen, und hör dann auf, die Entscheidung wieder aufzurollen. Eine Stimme aus der Auswahl ist der einfachste Weg. Ein Klon aus deinen eigenen Aufnahmen ist der, mit dem du dich abhebst – beim Stimmklonen wird deine Aufnahme einmal verarbeitet, danach steht der Klon wie jede andere Stimme aus der Auswahl bereit, auch auf beiden Stimmmodellen.

Wenn du mit einer wiederkehrenden Besetzung arbeitest, häng die Stimme an den Charakter, statt sie im Kopf zu behalten. Ein Charakter trägt eine Stimme, sodass dieselbe Person in einem Film, einem Trailer und einer Kurzfassung für Social Media gleich klingt. Mehr dazu, wie du Stimmen für eine Besetzung auswählst und führst, steht in KI-Charakteren eine Stimme geben.

Die Rechnung, pro Zeichen und pro Sprache

Abgerechnet wird pro 100 Zeichen Text, was die Budgetplanung ungewöhnlich ehrlich macht.

Eine Erzählung mit 1.200 Zeichen – etwa neunzig Sekunden Lesezeit – kostet 36 Credits auf Voice One und 24 auf Voice Turbo. Über dreizehn Sprachen sind das 468 Credits auf Voice One, 312 auf Turbo. Zu den Preisen des Einstiegspakets, bei denen ein Credit ungefähr einen Cent kostet, landet die gesamte lokalisierte Erzählung unter fünf Dollar.

Jetzt eine Szene mit sprechender Besetzung. Drei Figuren mit je 300 Zeichen Dialog ergeben 900 Zeichen – 27 Credits pro Sprache auf Voice One oder 9 Credits pro Figur und Sprache. Dreizehn Sprachen dieser Szene: 351 Credits. Die 1.800 monatlichen Credits eines Hobby-Plans decken also drei komplette Durchgänge einer neunzigsekündigen Erzählung in dreizehn Sprachen ab, mit Luft für den Großteil eines vierten – und monatliche Credits verfallen nicht.

Der teure Fehler ist nicht das Modell, sondern das erneute Einlesen. Jedes Mal, wenn du nach der Lokalisierung eine Zeile änderst, zahlst du dreizehn neue Renders. Erst das Skript festschreiben, dann lokalisieren.

Eine Sprache prüfen, die du nicht sprichst

Du wirst einen Take in einer Sprache veröffentlichen, in der du Fehler nicht hörst. Zwei günstige Absicherungen:

Transkribiere deine eigene Ausgabe. Scribe One ist Sprache-zu-Text für 1 Credit pro Minute Audio, Dateien bis 8 MB, mit automatischer Spracherkennung. Schick dein generiertes MP3 wieder hindurch und lies, was die Engine tatsächlich gesagt hat. Verunstaltete Namen, verschluckte Zahlen und eine falsch erkannte Sprache fallen im Text sofort auf.

Führ ein Aussprache-Glossar. Eigennamen, Markennamen und erfundene Ortsnamen sind die Stellen, an denen jede Sprache danebenliegt. Schreib die Aussprache, die du willst, phonetisch direkt ins Skript – die Engine liest, was du tippst, also tipp, was du hören willst.

Dann zusammensetzen

eroq schneidet, mischt und gradet nicht, und Lip-Sync gibt es keins – die Erzählung liegt über dem Bild, nicht in einem Mund. Exportier das MP3, leg es in Premiere oder After Effects an den Schnitt an und dupliziere die Sequenz für jede Sprache. Jede Generierung wird automatisch mit ihrem Rezept in deiner Bibliothek gespeichert, ein erneuter Export sechs Wochen später heißt also nicht, die Einstellungen neu zu tippen. Wenn du das statt in eine Timeline in eine Pipeline einbaust, sind dieselben Stimmen nur einen POST entfernt – siehe die Speech-Doku.

Häufige Fragen

In wie vielen Sprachen können die Stimmen lesen?

In dreizehn. Sowohl die Stimmen aus der Auswahl als auch deine eigenen Klone lesen sie, und die Auswahl im Tool „Stimme“ zeigt genau, welche es sind.

Muss ich eine Stimme für jede Sprache klonen?

Nein. Einmal geklont ist der Klon wiederverwendbar – über Sprachen und Projekte hinweg und auf beiden Stimmmodellen.

Was kostet eine lokalisierte Erzählung tatsächlich?

Voice One kostet 3 Credits pro 100 Zeichen, Voice Turbo 2. Ein Skript mit 1.200 Zeichen in dreizehn Sprachen kostet 468 Credits auf Voice One und 312 auf Turbo.

Skript steht? Öffne das Tool „Stimme“ und besetze es einmal.

Tagsvoice-overtext-to-speechlanguagesvoice-cloningtutorial

Mach das mit den Modellen hinter diesem Artikel – starte mit 50 Gratis-Credits oder sieh dir alle Engines und ihre Preise an.