Rabatt auf Premium-Pläne, wenn du dich registrierstRabatt sichern

Blog/use-cases·6. Sept. 2026·5 Min.·vom eroq-Team

KI-Stimmen für Spieldialoge: Barks, Menüs und Platzhalter-VO

Besetze jeden Charakter mit einer Stimme, rendere tausend Zeilen aus einer Tabelle und kenne die Kosten vorab. Plus die ehrliche Grenze: kein Lip-Sync.


Ein Build mit stummen Figuren wirkt wie ein Prototyp, egal wie gut die Grafik ist. Dreißig Barks und ein vertontes Menü ändern diesen Eindruck an einem Nachmittag – deshalb ist Platzhalter-VO still und leise zu einem der ersten Dinge geworden, die Indie-Teams generieren, statt zu einem der letzten, die sie aufnehmen.

Vor allem anderen die Grenze, die deinen Umfang bestimmt: Es gibt keinen Lip-Sync. Keine sprechenden Avatare, keine Visem-Spur, keine Echtzeit-Synthese. Was von den Sprachmodellen zurückkommt, ist eine MP3-Datei. Alles Folgende ist darauf ausgelegt, und wie sich zeigt, brauchte der Großteil der Dialoge eines Spiels ohnehin nie einen Mund auf dem Bildschirm.

Wofür generierte Stimmen in einem Build wirklich taugen

  • Barks. Kampf-Callouts, Leerlauf-Geplauder, Aggro-Sätze, Treffer-Reaktionen, Begrüßungen von Händlern. Kurz, zahlreich, außerhalb des Bildes oder so weit weg, dass niemand Lippen liest.
  • Menüs und Systeme. Tutorial-Hinweise, Vorlesefunktion für Barrierefreiheit, „Speichern abgeschlossen“, Bestätigungen.
  • Funk und Comms. Der beste Fit überhaupt – eine Stimme am anderen Ende eines Headsets hat von Haus aus kein Gesicht.
  • Erzähler und Kodex. Lore-Einträge, Level-Intros, Todesbildschirme.
  • Platzhalter-VO für einen Slice. Temporäre Zeilen in einem Vertical Slice, damit sich das Pacing beurteilen lässt, bevor es ein Casting-Budget gibt.

Wofür sie nicht gedacht sind: Zwischensequenzen, in denen eine Figur vor der Kamera spricht. Schneide um den Mund herum, leg die Zeile über eine Reaktionseinstellung oder heb dir diese Szene für eine echte Aufnahme auf.

Einmal besetzen, pro Charakter, für immer

Die Regel, die dir später den meisten Ärger erspart, ist langweilig: ein Charakter, eine Stimme, für die gesamte Laufzeit des Projekts.

Ein Charakter im Studio hat einen Namen, eine Persona und eine Stimme – eine Katalogstimme (Aria, warm und nah; Orion, tief und gelassen) oder eine geklonte. Weise sie einmal zu, und jede Zeile, die du für diesen Charakter renderst, verwendet sie. Über die API ist dasselbe eine Voice-ID der Form char:<id>, sodass dein Export-Skript nie wissen muss, welcher Klon zum Quartiermeister gehörte.

Zwei Katalogstimmen klingen nicht nach einem Ensemble – bis dir einfällt, dass sich Tempo und Ausdruck pro Zeile unabhängig verstellen lassen und das Schreiben ohnehin den Großteil des Charakters trägt. Ein knapper, nüchterner Quartiermeister und ein blumiger Wirt können sich eine Klangfarbe teilen und trotzdem wie zwei Personen wirken. Wenn sie das wirklich nicht können, klone die zusätzlichen Stimmen – Klonen ist kostenlos, nur die Sprachausgabe wird berechnet.

Tausend Zeilen im Batch

Halte die Zeilen in einer Datei, nicht in einem Tool. Eine zweispaltige TSV mit line_id und text ist die gesamte Pipeline, und sie ist zugleich dein Diff, wenn ein Autor im nächsten Sprint elf Zeilen ändert.

Die eroq-CLI rendert eine Zeile pro Aufruf und schreibt die MP3 dorthin, wo du sie haben willst – damit ist der Batch eine vierzeilige Shell-Schleife:

while IFS=$'\t' read -r id text; do
  eroq speech "$text" -v orion -m eroq-voice-turbo -o "vo/quartermaster/$id.mp3"
done < barks.tsv

Drei praktische Hinweise. Jeder Request ist auf 5.000 Zeichen Input begrenzt, was kein Bark je erreicht, ein Kodex-Eintrag aber durchaus. Sprachausgabe ist in einem kostenlosen Workspace auf 6 Requests pro Minute und Schlüssel begrenzt, multipliziert mit deinem Plan – 2× bei Creator, 4× bei Studio –, ein Durchlauf mit tausend Zeilen dauert mit einem kostenlosen Schlüssel also knapp drei Stunden und mit einem Studio-Schlüssel etwa vierzig Minuten. Und jeder Render wird automatisch in deiner Bibliothek gespeichert, eine verlorene lokale Datei ist also ärgerlich, aber kein Grund für einen neuen Render.

Wenn deine Toolchain WAV statt MP3 will, konvertiere beim Import:

ffmpeg -i vo/quartermaster/bark_01.mp3 -ar 48000 -ac 1 vo/quartermaster/bark_01.wav

Was tausend Zeilen kosten

Sprachausgabe wird pro angefangenem Block von 100 Input-Zeichen berechnet – 3 Credits bei Voice One, 2 bei Voice Turbo. Das Wort „angefangen“ ist das ganze Kostenmodell für Spieldialoge, denn Barks sind kurz, und jeder einzelne wird auf einen vollen Block aufgerundet.

Die Rechnung folgt also deiner Zeilenzahl, nicht deiner Zeichenzahl:

  • 1.000 Barks mit durchschnittlich 45 Zeichen – 1.000 Blöcke. 3.000 Credits bei Voice One, 2.000 bei Turbo. Zum Preis des Einstiegspakets sind das ungefähr $30 bzw. $20.
  • 60 Menü- und Systemzeilen – 180 Credits bei Voice One, 120 bei Turbo.
  • 40 Kodex-Einträge mit je 480 Zeichen – je 5 Blöcke, also 600 Credits bei Voice One.

Zwei Konsequenzen, nach denen du handeln solltest. Erstens: Iteriere mit Turbo und liefere mit Voice One aus – dieselben tausend Barks neu zu rendern kostet ein Drittel weniger, solange du noch an den Texten feilst. Zweitens: Widersteh der Versuchung, kurze Zeilen zu einem Request zusammenzufassen, um die Rundung zu umgehen – du bekämst eine einzige MP3 zurück, und sie von Hand zu zerschneiden kostet mehr als die gesparten Credits.

Erstattungen bei fehlgeschlagenen Generierungen laufen automatisch. Ein Batch, der in einer Nacht mit schlechtem Netz auf halber Strecke abbricht, lässt dich also nicht für Stille bezahlen.

VO über einen Patch hinweg stabil halten

Behandle barks.tsv als Source of Truth und den Audio-Ordner als Build-Output. Ändert ein Autor elf Zeilen, renderst du elf Dateien neu – die IDs sind stabil, die Pfade sind stabil, und sonst bewegt sich nichts im Projekt. Speichere Stimme, Tempo und Ausdruck jedes Charakters in derselben Datei oder in einer kleinen JSON daneben, damit ein Re-Render in sechs Monaten dieselbe Performance liefert statt einer neuen Interpretation.

Für die Charakterarbeit vor der Stimme – Personas, Referenz-Artwork, eine konsistente Besetzung – deckt die Concept-Art-Pipeline für Game-Studios die visuelle Hälfte ab, und TTS für KI-Charaktere zeigt, wie du Zeilen schreibst, die gespielt statt vorgelesen klingen.

Häufige Fragen

Kann eroq generierte Dialoge lippensynchron auf ein Charaktermodell legen?

Nein. Es gibt keinen Lip-Sync, keine Visem-Ausgabe und keine Funktion für sprechende Avatare – die Sprachmodelle liefern eine MP3 und sonst nichts. Konzipiere die Dialoge als Barks, Funkverkehr, Erzählung und Zeilen außerhalb des Bildes, und heb Sprache vor der Kamera für aufgenommenes VO auf.

Was kosten tausend Barks?

Abgerechnet wird pro angefangenem Block von 100 Zeichen, ein kurzer Bark kostet also einen Block, egal wie kurz er ist. Tausend Barks kosten 3.000 Credits bei Voice One oder 2.000 bei Voice Turbo, zum Preis des Einstiegspakets ungefähr $30 bzw. $20, vor eventuellen Re-Renders.

Darf ich generierte Sprachzeilen in einem kommerziellen Spiel verwenden?

Die Ergebnisse gehören laut Nutzungsbedingungen dir, und die Pläne enthalten eine kommerzielle Lizenz. Bleiben also die Inhaltsregeln – nur Fiktion, nichts mit Minderjährigen, keine echten, identifizierbaren Personen ohne Einwilligung, nichts Illegales –, und jede geklonte Stimme braucht die Erlaubnis der Person, der sie gehört. Prüfe auf der Preisseite, was jeder Plan enthält, bevor du veröffentlichst.

Kann ich alle Zeilen mit einem einzigen Request generieren?

Nein, und das willst du auch nicht. Jeder Request liefert eine MP3, also ist ein Request pro Zeile genau das, was dir einzelne Dateien pro Zeile mit stabilen IDs gibt. Verarbeite sie im Batch mit einer Shell-Schleife über deine Zeilendatei und lass das Rate-Limit das Tempo vorgeben.

Bereit, deinen Build sprechen zu hören? Öffne das Tool „Stimme“, besetze einen Charakter richtig und setz dann eine Schleife auf den Rest an.

Tagsgame-devtext-to-speechvoicebarkscharacters

Mach das mit den Modellen hinter diesem Artikel – starte mit 50 Gratis-Credits oder sieh dir alle Engines und ihre Preise an.