Rabatt auf Premium-Pläne, wenn du dich registrierstRabatt sichern

Blog/developers·5. Aug. 2026·4 Min.·vom eroq-Team

KI-Charakteren eine Stimme geben: TTS-Latenz, Kosten und Handwerk

Wo Stimme in ein Charakter-Produkt passt, wie du Synthesekosten im Griff behältst und was eine generierte Zeile gespielt statt vorgelesen klingen lässt.


Text gibt einer Figur einen Verstand, Stimme gibt ihr einen Körper. Der Unterschied bei der Retention ist real: Eine Figur, die spricht, wird wieder geöffnet. Aber Stimme ist auch das Feature, das sich am leichtesten schlecht bauen lässt: teuer, langsam und flach. Das hier ist unser Playbook.

Stimme als Moment, nicht als Modalität

Der erste Impuls ist, alles zu vertonen. Widersteh ihm. Synthese kostet echtes Geld pro Eingabezeichen (3 Credits pro 100 Zeichen mit Voice One, 2 mit dem schnelleren Voice Turbo), und eine Wand aus automatisch abgespieltem Audio ermüdet ohnehin.

Stimme funktioniert als Satzzeichen: die Begrüßung, wenn eine Unterhaltung beginnt, ein emotionaler Moment, eine Antwort, die der Nutzer ausdrücklich hören möchte. Produkte, die Stimme als Premium-Moment behandeln, geben ein Zehntel aus und holen mehr Retention heraus, denn gerade die Knappheit sorgt dafür, dass sie wirkt.

Das Kostenmodell

POST /v1/audio/speech rechnet pro angefangenem Block von 100 Zeichen ab. Praktische Zahlen:

Zeile Zeichen Credits ~Kosten
Kurze Begrüßung 80 3 $0.03
Typische Antwort 240 9 $0.09
Langer dramatischer Moment 600 18 $0.18

Daraus folgen zwei Dinge. Erstens: Schreib fürs Sprechen. Eine gesprochene Zeile sollte ohnehin kürzer sein als eine geschriebene; auf 200 Zeichen zu kürzen ist eine handwerkliche Verbesserung, die deine Rechnung halbiert. Zweitens: Cache aggressiv. Begrüßungen, Catchphrases und wiederkehrende Momente sind jedes Mal dasselbe Audio. Hash voice + text und speichere die MP3 selbst – jede Zeile landet zwar auch in deiner Bibliothek, aber erst ein eigener Cache macht eine Wiedergabe kostenlos –, und ein riesiger Teil der Wiedergaben kostet nichts mehr.

Latenz und wie sie wahrgenommen wird

Die Synthese dauert ein, zwei Sekunden. Der Trick ist, dass die wahrgenommene Latenz eine Eigenschaft der UI ist:

  • Zeig die Textantwort sofort an und lass das Audio mit einem dezenten Hinweis „Stimme lädt“ hinterherkommen. Nutzer lesen, während es rendert.
  • Generiere geskriptete Momente (Onboarding, Begrüßungen) vorab: Diese Zeilen stehen fest, bevor der Nutzer überhaupt ankommt.
  • Blockier die Unterhaltung nie wegen Audio. Wenn die Stimme ausfällt, sollte still auf Text zurückgefallen werden, statt die ganze Runde mit einem Fehler abzubrechen.

Damit es gespielt wirkt

Der Unterschied zwischen „vorgelesen“ und „gespielt“ liegt vor allem im Eingabetext:

  • Satzzeichen sind Prosodie. Mit Kommas, Gedankenstrichen und Auslassungspunkten führst du beim Tempo Regie. „Na ja… das ist neu.“ wird gespielt; „Na ja das ist neu“ wird vorgelesen.
  • Leg den Charakter in die Worte. Die Synthesestimme trägt die Klangfarbe, das Schreiben trägt die Persönlichkeit. Eine sarkastische Figur braucht sarkastische Sätze, keine sarkastische Stimmeinstellung.
  • Ordne einer Figur einmal eine Stimme zu und ändere sie dann nie wieder. Die Identität der Stimme ist die Identität der Figur; mitten in einer Beziehung die Stimme zu wechseln, ist das akustische Gegenstück zum Austausch des Avatars.

Der Katalog (aria, warm und nah; orion, tief und gelassen – siehe die Referenz) ist bewusst kuratiert statt endlos: Zwei Stimmen, die immer richtig klingen, schlagen vierzig, die es nur manchmal tun, und beide sprechen 13 Sprachen. Wenn keine davon zur Figur passt, klon eine Stimme aus deinem eigenen Audio und besetz stattdessen diese.

Der Rückweg: auch Ohren

Dieselbe Audio-Pipeline läuft auch in die andere Richtung: /v1/audio/transcriptions (1 Credit pro Audiominute) macht aus der Sprachnachricht eines Nutzers Text, auf den deine Figur antworten kann. Stimme rein, Denken in Text, Stimme raus – das ist die komplette Schleife eines „Anrufmodus“, und jede Etappe ist ein einziger API-Aufruf.

Häufige Fragen

Was kostet KI-Text-to-Speech pro Zeile?

Voice One berechnet 3 Credits pro angefangenen 100 Zeichen, Voice Turbo 2 für denselben Katalog und dieselben Klone. Eine Antwort mit 240 Zeichen kostet mit Voice One 9 Credits, etwa neun Cent. Kürzere Zeilen zu schreiben ist eine handwerkliche Verbesserung und zugleich der günstigste Weg, die Rechnung zu halbieren.

Kann ich die Stimme einer Figur klonen?

Ja. Lad dein eigenes Audio im Tool „Stimme“ hoch, und der Klon kommt zu deinen Stimmen dazu, über die API besetzbar wie aria oder orion. Einer Figur lässt sich einmalig eine geklonte Stimme oder eine Katalogstimme zuweisen; so bleibt die Identität der Stimme über eine ganze Beziehung hinweg stabil.

Welche Sprachen sprechen die Stimmen?

Beide Sprachmodelle sprechen 13 Sprachen, und eine geklonte Stimme funktioniert ebenfalls in allen. Die Sprache ergibt sich aus dem Text, den du schickst, nicht aus einem separaten Parameter; so kann eine Figur in der Sprache des Nutzers mit derselben Klangfarbe antworten.

Kann eroq eine Stimme lippensynchron auf ein Video oder einen Avatar legen?

Nein. Es gibt kein Lip-Sync, keine Funktion für sprechende Avatare und keine Echtzeitstimme; die Synthese liefert eine MP3, die du selbst abspielst. Gestalte den Moment als Sprachnachricht zu einem Standbild, was in der Produktion ohnehin funktioniert, und exportier in ein Schnittprogramm, wenn du beides auf einer Timeline brauchst.

Fang mit Begrüßungen an: eine gecachte Zeile pro Figur, je ein paar Credits, an einem Nachmittag ausgeliefert. Miss, was das mit der Retention an Tag zwei macht, und entscheide dann, wie weit du gehen willst. Unserer Erfahrung nach ist es genau dieser erste Nachmittag, der das Produkt verändert.

Tagsvoicettscharacters

Mach das mit den Modellen hinter diesem Artikel – starte mit 50 Gratis-Credits oder sieh dir alle Engines und ihre Preise an.