Rabatt auf Premium-Pläne, wenn du dich registrierstRabatt sichern

Blog/use-cases·11. Sept. 2026·5 Min.·vom eroq-Team

KI-Stimme für Hörbücher und Podcasts: die echte Credit-Rechnung

Ein Kapitel mit eroq vertonen: Voice One gegen Voice Turbo pro hundert Zeichen, Stimmklonen, Zeichensetzung als Regie und dreizehn Sprachen.


Langes Audio ist erst eine Budgetfrage und dann eine kreative. Ein Kapitel ist kein Satz, den du so lange neu generierst, bis er richtig klingt; es sind sechzigtausend Zeichen, die du renderst, anhörst, korrigierst und noch einmal renderst. Das Erste, was du über das Vertonen mit eroq wissen solltest, ist deshalb die Abrechnungseinheit – Zeichen, nicht Wörter, nicht Minuten –, und das Zweite, wie du weniger davon für Entwürfe ausgibst. Die Kurzfassung steht beim Anwendungsfall Hörbücher und Podcasts.

Zwei Engines, dieselben Stimmen

Das Tool Stimme hat zwei Text-to-Speech-Modelle, und beide teilen sich den Katalog und deine Klone:

  • Voice One – das ausdrucksstarke Flaggschiff, 3 Credits pro 100 Zeichen, Ausgabe als MP3.
  • Voice Turbo – schneller, 2 Credits pro 100 Zeichen, dieselben Stimmen, dieselben Klone.

Der kuratierte Katalog ist mit Absicht klein: Aria klingt warm und nah, Orion tief und ruhig, und der Katalog deckt 13 Sprachen ab. Tempo und Ausdruck sind Schieberegler, und ein Charakter, den du angelegt hast, kann mit einer Stimme aus dem Katalog oder mit einem eigenen Klon sprechen.

Die Rechnung für ein Kapitel mit 10.000 Wörtern

Englische Prosa kommt auf etwa sechs Zeichen pro Wort inklusive Leerzeichen (deutsche Texte wegen der langen Wörter eher etwas mehr). Ein Kapitel mit 10.000 Wörtern hat also rund 60.000 Zeichen, das sind 600 Blöcke zu je 100.

  • Voice One – 600 × 3 = 1.800 Credits
  • Voice Turbo – 600 × 2 = 1.200 Credits

Der Unterschied beträgt 600 Credits pro Kapitel, also etwa $6 zum Tarif des Einstiegspakets von $10 für 1.000 Credits – und er ist der Grund für die einzige Workflow-Regel, die hier zählt: Korrektur mit Turbo, Endfassung mit One. Render den Kapitelentwurf mit Voice Turbo, hör auf den falsch ausgesprochenen Nachnamen und den Satz, der wie eine Frage klingt, korrigier den Text und render die Endfassung dann einmal mit Voice One.

Ein Buch mit zwölf Kapiteln, auf diese Weise geprüft, kostet 12 × 1.200 = 14.400 Credits für Entwürfe plus 12 × 1.800 = 21.600 Credits für die Endfassungen, zusammen 36.000 Credits – genau das Monatskontingent des Plans Team ($249 für 36.000 Credits). Renderst du nur Endfassungen, kostet dasselbe Buch 21.600 Credits – Studio ($149 für 20.000 Credits) plus zwei Starter-Pakete ($10 für je 1.000 Credits), oder 20.000 ÷ 1.800 = 11,1 Kapitel im Monat mit Studio allein. Credits werden für immer übertragen und verfallen nie, und fehlgeschlagene Generierungen werden automatisch erstattet – ein Buch, das über vier Monate entsteht, braucht also nicht vier Monate lang denselben Plan.

Zeichensetzung ist die Regie

Es gibt keine separate Regiespur. Der Vortrag entsteht aus der Zeichensetzung, und sobald du das weißt, schreibst du anders: Ein Komma ist ein Atemzug, ein Gedankenstrich eine Pause mit Absicht, drei Punkte ein Zögern, und ein Punkt setzt einen Boden. Kurze Sätze mit je einem Gedanken klingen laut gelesen besser als die eleganten Nebensätze, die auf dem Papier gut aussehen.

Hier ist eine Passage, die fürs Mikrofon geschrieben ist statt fürs Auge – zitierfähig und ein fairer Test für jede Stimme, die du gerade ausprobierst:

Er hatte den Satz den ganzen Nachmittag geprobt. Im Auto. Im Aufzug. An der Tür, die Hand flach auf dem Holz – und dann öffnete sie, bevor er klopfen konnte, und jedes Wort, das er geübt hatte, war plötzlich woanders. „Du bist früh dran“, sagte sie. Er war nicht früh dran. Er war drei Jahre zu spät.

Render das mit beiden Modellen, bevor du dich für ein ganzes Buch festlegst. Sechzig Sekunden Zuhören entscheiden einen Streit, den kein Datenblatt entscheiden kann.

Die eigene Stimme klonen

Wenn der Kanal deiner ist, sollte es die Stimme auch sein. Stimmklonen nimmt deine eigene Aufnahme und macht daraus eine Stimme, die du überall nutzen kannst, wo der Katalog funktioniert, mit beiden Modellen, zum selben Preis pro 100 Zeichen. Für einen Podcast heißt das: ein einheitliches Intro, ein korrigierter Satz in einer Folge, die schon veröffentlicht ist, und Nachaufnahmen, ohne die Sprecherkabine noch einmal zu buchen.

Eine Regel, klar gesagt: Klon deine eigene Stimme oder eine Stimme, für die du eine schriftliche Erlaubnis hast. Echte, erkennbare Personen ohne Einwilligung sind ausnahmslos verboten, und das gilt auch für Stimmen.

Podcasts und alles rund ums Audio

Das Einsprechen ist einer von vier Jobs in einem Podcast-Workflow, und die anderen drei sind günstig:

  • Skript – Text mit RP+ für 3 Credits pro Antwort oder RP mini für 1. Der Stil „Szene“ schreibt immersive Prosa, die laut gelesen besser klingt als Stichpunkte. Ein gestrafftes Skript in sechs Antworten kostet 18 Credits.
  • Zwei Stimmen – eine Folge im Dialog sind zwei Renders, einer pro Sprecher, mit Aria und Orion, im Schnittprogramm zusammengeschnitten. Teilst du das Skript nach Sprechern auf, bekommst du außerdem günstige Retakes, denn ein neuer Render kostet nur den Block, den du geändert hast.
  • Transkripte und Shownotes – Scribe One wandelt Sprache in Text um, für 1 Credit pro Audiominute, Dateien bis 8 MB, mit automatischer Spracherkennung. Transkribier die fertige Folge für Kapitelmarken, Untertitel und den SEO-Text auf der Episodenseite.

Jeder Render wird automatisch in deiner Bibliothek gespeichert, die MP3 griffbereit – das Intro aus dem März ist also im September noch da.

Dreizehn Sprachen, ein Buch

Der Katalog spricht 13 Sprachen, eine übersetzte Ausgabe ist also ein neuer Render statt einer neuen Besetzung. Die Rechnung lässt sich direkt übertragen – ein übersetztes Kapitel mit 10.000 Wörtern sind ungefähr dieselben 600 Blöcke, also 1.800 Credits mit Voice One –, und die Zeichensetzung, die du für den Vortrag geschrieben hast, übersteht die Übersetzung besser als Adverbien.

Wenn sich das Volumen lohnt, stehen dieselben Modelle über die API bereit. audio/speech nimmt den Text und die Stimme entgegen und gibt die Datei zurück; die Parameter stehen in der Dokumentation zu Speech. Ein Skript, das über einen Ordner mit Kapiteldateien läuft, rendert in einer Nacht ein ganzes Buch.

Häufige Fragen

Wie viele Credits kostet eine Minute Sprechertext?

Rechne nach Zeichen, nicht nach Minuten. Gesprochenes Englisch liegt bei etwa 150 Wörtern pro Minute, eine Minute hat also rund 900 Zeichen oder 9 Blöcke – 27 Credits mit Voice One und 18 mit Voice Turbo. Eine Folge von 40 Minuten hat etwa 36.000 Zeichen, also 360 × 3 = 1.080 Credits mit Voice One.

Kann ich einen Absatz korrigieren, ohne das ganze Kapitel neu zu rendern?

Ja, und das solltest du auch. Render in Abschnitten – eine Szene, ein Kapitelteil, ein Sprecherwechsel –, dann kostet eine Korrektur nur diesen Abschnitt. 500 Zeichen mit Voice One neu zu rendern kostet 5 × 3 = 15 Credits statt 1.800.

Ist Voice Turbo spürbar schlechter?

Sie ist schneller und günstiger mit 2 Credits pro 100 Zeichen, mit demselben Katalog und denselben Klonen. Voice One ist das ausdrucksstarke Flaggschiff, und das hört man am deutlichsten bei emotionaler Fiktion und am wenigsten bei sachlicher Erzählung. Teste deinen eigenen Text mit beiden – eine Probe mit 1.000 Zeichen kostet 30 Credits mit der einen und 20 mit der anderen.

Kapitel fertig? Öffne das Tool Stimme, füg 1.000 Zeichen ein und render dieselbe Passage mit beiden Modellen, bevor du ein ganzes Buch planst.

Tagsaudiobookspodcaststext-to-speechvoice-cloning

Mach das mit den Modellen hinter diesem Artikel – starte mit 50 Gratis-Credits oder sieh dir alle Engines und ihre Preise an.