Rabatt auf Premium-Pläne, wenn du dich registrierstRabatt sichern

Blog/guides·5. Sept. 2026·6 Min.·vom eroq-Team

KI-Stimme vs. Sprecher buchen: der ehrliche Kostenvergleich

Was eine Minute KI-Vertonung wirklich kostet, wie schnell Korrekturen fertig sind und wann ein menschlicher Sprecher noch die richtige Wahl ist.


Dieser Vergleich wird meistens von jemandem geschrieben, der eine Seite verkaufen will. Hier ist die Version mit offengelegter Rechnung und zugegebenen Niederlagen. Synthetische Stimmen werden pro Zeichen abgerechnet, ein Mensch pro Projekt, und diese beiden Einheiten verhalten sich so unterschiedlich, dass die spannende Frage nicht lautet, was günstiger ist, sondern: Welche Art des Scheiterns kannst du dir bei diesem Auftrag leisten?

Was eine Minute Vertonung tatsächlich kostet

Sprachmodelle rechnen pro Zeichen ab, nicht pro Sekunde. Als Erstes musst du also umrechnen. Ein angenehmes Sprechtempo liegt bei etwa 150 Wörtern pro Minute, und ein englisches Wort samt Leerzeichen kommt auf ungefähr sechs Zeichen. Eine gesprochene Minute entspricht also rund 900 Zeichen.

Voice One berechnet 3 Credits pro angefangenem Block von 100 Zeichen, Voice Turbo 2.

  • Voice One: 900 ÷ 100 = 9 Blöcke × 3 = 27 Credits pro Minute. Etwa 27 Cent zum Tarif des Einstiegspakets, etwa 22 Cent zum Tarif des Creator-Plans.
  • Voice Turbo: 9 Blöcke × 2 = 18 Credits pro Minute. Etwa 18 Cent, mit Creator 15.

Jetzt hochgerechnet auf echte Projekte:

  • Das Skript für ein 90-Sekunden-Erklärvideo hat rund 1.350 Zeichen, also 14 Blöcke: 42 Credits mit Voice One, ungefähr 34 Cent.
  • Eine 30-minütige Vertonung hat rund 27.000 Zeichen: 810 Credits mit Voice One, etwa $6.62 zum Creator-Tarif. Mit Turbo sind es 540 Credits, etwa $4.41.
  • Die 50 Gratis-Credits, mit denen ein neues Konto startet, reichen mit Voice One für etwa 1.600 Zeichen, also eindreiviertel Minuten Sprache. Genug, um zu hören, ob die Stimme passt, aber nicht genug, um irgendetwas zu vertonen.

Eine praktische Einschränkung: Eine einzelne Sprachanfrage nimmt bis zu 5.000 Zeichen an, das sind etwa fünfeinhalb Minuten. Lange Formate teilst du ohnehin nach Abschnitten auf, und genau so hältst du auch Neuaufnahmen klein.

Ein menschlicher Sprecher kalkuliert anders: eine Studiogage, oft plus Nutzungsrechte, und die Höhe hängt vom Markt, vom Medium und von der Laufzeit ab. Eine ehrliche Einzelzahl gibt es nicht, und wer eine nennt, verallgemeinert. Sicher sagen lässt sich nur die Form: Es ist ein Projektpreis mit Untergrenze. Für einen 30-Sekunden-Job schrumpft er kaum, und für einen 30-Minuten-Job wächst er nicht linear mit.

Durchlaufzeit und was sie mit deinem Zeitplan macht

Ein Render ist in Sekunden fertig und landet in deiner Bibliothek. Eine Buchung bedeutet Verfügbarkeit, eine Session und Lieferung, bei den meisten Projekten also einen Tag oder mehrere.

Der Effekt auf den Zeitplan ist größer, als es klingt. Wenn Audio einen Tag dauert, wird das Skript eingefroren, bevor der Schnitt steht, und der Schnitt richtet sich nach der Aufnahme. Wenn Audio Sekunden dauert, kannst du zuerst das Bild schneiden und die Erzählstimme auf das fertige Timing aufnehmen. Das ist die richtige Reihenfolge, und fast niemand kommt dazu, so zu arbeiten.

Bei Korrekturen trennen sich die Wege

Das ist der ehrliche Kern des Vergleichs.

Ändere eine Zeile in einer 30-minütigen Vertonung. Mit synthetischer Sprache renderst du nur diese Zeile neu: Ein Satz mit 120 Zeichen sind 2 Blöcke, 6 Credits mit Voice One, etwa fünf Cent, und er ist fertig, bevor du die Anmerkung zu Ende gelesen hast. Bei einer Studioaufnahme planst du eine Nachaufnahme, und kleine Nachaufnahmen bringen für alle Beteiligten unverhältnismäßig viel Aufwand mit sich.

Genau das macht generierte Stimmen stark bei Arbeit, die von Natur aus iterativ ist: versionierte Werbetexte, Varianten pro Markt, ein Produktname, der sich vor dem Launch zweimal ändert. Zehn Varianten einer Zeile mit 200 Zeichen kosten 10 × 6 = 60 Credits. Das ist ein Rundungsfehler, und es heißt, dass du den Text tatsächlich testen kannst.

Die Kehrseite, ganz offen gesagt: Dein einziger Regiekanal ist der Text. Bei eroq steuerst du die Sprechweise über Satzzeichen, über die Regler für Tempo und Ausdruck und indem du die Zeile umschreibst. Kommas bremsen, ein Punkt setzt den Schlusspunkt, ein Fragezeichen hebt das Ende an. Du kannst nicht sagen: „Wärmer, und betone das zweite Wort.“ Eine Regisseurin im Raum mit einem Sprecher kann das, und das ist eine echte Fähigkeit, keine Nostalgie.

Sprachen und Casting

Die Studio-Stimmen, Aria (warm und nah) und Orion (tief und gelassen), sprechen jeweils 13 Sprachen. Damit wird Lokalisierung von einer Casting-Aufgabe zu einer Übersetzungsaufgabe. Dasselbe Skript in sechs Märkten bedeutet sechs Renders und sechs Übersetzungen, nicht sechs Buchungen. Die komplette Methode dafür steht im Leitfaden für mehrsprachige Voice-overs.

Du kannst auch eine Stimme aus deinem eigenen Audio klonen. Das ist das richtige Werkzeug für Gründer, die ihre Produktvideos selbst sprechen und nicht jedes Update neu aufnehmen wollen. Die Einwilligungsregel ist absolut und verdient eine Wiederholung: Klone eine Stimme, die dir gehört oder für die du eine schriftliche Erlaubnis hast, niemals die Stimme einer realen Person ohne diese Erlaubnis. Der Leitfaden zum Stimmklonen erklärt, was eine brauchbare Sprachprobe ausmacht.

Zwei Grenzen solltest du einplanen: Bei eroq gibt es kein Lip-Sync. Generierte Sprache ist also Erzählstimme und Voice-over, keine Figur, die lippensynchron vor der Kamera spricht. Und ungewöhnliche Eigennamen musst du manchmal phonetisch umschreiben, damit sie richtig herauskommen.

Wann ein menschlicher Sprecher immer noch die richtige Wahl ist

Buch einen Menschen in diesen Fällen:

  • Die Stimme ist die Marke. Eine Kampagnenstimme, die jahrelang läuft und die das Publikum wiedererkennt und mit dir verbindet, ist eine Casting-Entscheidung, an der ein Mensch hängt. Behandle sie wie das Casting eines Schauspielers, denn genau das ist sie.
  • Die Aufnahme braucht Regie. Wenn das Skript komisch, ironisch oder emotional so speziell ist, dass alles am Timing hängt, schlägt ein Sprecher, der Anweisungen in Echtzeit umsetzt, jede noch so große Zahl an Prompt-Umschreibungen.
  • Gewerkschaften, Einwilligungen oder Rechte spielen eine Rolle. Rundfunk, Games und viele Agenturkontexte haben vertragliche Rahmenbedingungen für Sprecherleistungen. Die gibt es aus guten Gründen, und sie sind keine optionalen Zutaten.
  • Die Identität der Person ist Teil des Produkts. Ein bekannter Sprecher bei einem Hörbuch, eine Gründerin, die wirklich selbst sprechen sollte, die Protagonistin einer Doku.
  • Der Dialog muss in einer Szene sitzen. Dialog vor der Kamera, passgenaues ADR, zwei Figuren, die sich ins Wort fallen: Das ist Schauspielarbeit mit Bild, keine Erzählstimme.

So entscheidest du im konkreten Fall

Zwei Fragen klären die meisten Briefings. Erstens: Wird sich diese Zeile ändern? Versionierte, lokalisierte oder vorläufige Texte sprechen klar für die Synthese, weil Korrekturen fast nichts kosten. Zweitens: Leistet die Stimme kreative Arbeit, oder vermittelt sie Informationen? Informationen, also Tutorials, Produkt-Walkthroughs, Hörbücher deiner eigenen Texte, interne Videos oder Voice-overs für Social Media, sind genau das, worin Synthese stark ist. Kreative Darbietung ist es nicht.

Die häufigste gute Antwort lautet: beides. Synthetisiere die Temp-Spur, damit der Schnitt auf echtes Timing gesetzt werden kann, friere das Skript ein, und wenn das Stück eine echte Darbietung verdient, buch eine für die finale Fassung, mit bereits erprobtem Timing. Du zahlst dann für eine Session statt für drei.

Vergleich die beiden Sprach-Engines direkt in Voice One vs. Voice Turbo, prüf die Plan-Tarife auf der Preisseite, und dann schreib eine Zeile und hör sie dir im Tool „Stimme“ an. Workflows für lange Formate findest du unter Hörbücher und Podcasts.

Häufige Fragen

Was kostet eine Minute KI-Voice-over?

Etwa 27 Credits mit Voice One oder 18 mit Voice Turbo, denn eine gesprochene Minute hat rund 900 Zeichen, und die Modelle berechnen 3 bzw. 2 Credits pro 100 Zeichen. In Dollar sind das zum Tarif des Einstiegspakets ungefähr 27 bzw. 18 Cent, mit einem Plan weniger.

Kann eine KI-Stimme einen Sprecher komplett ersetzen?

Bei informierender Vertonung wie Tutorials, Produktvideos, internen Inhalten oder Lokalisierung meistens schon. Für eine Darbietung, die eine Marke trägt, für Dialog in einer Szene oder überall dort, wo es um Regie und Timing geht, ist ein menschlicher Sprecher nach wie vor besser. Der sinnvolle Workflow nutzt Synthese so oder so für Temp-Spuren und Entwürfe.

Ist es legal, eine Stimme zu klonen?

Klone deine eigene Stimme oder eine, für die du eine schriftliche Erlaubnis hast. Die Stimme einer realen, identifizierbaren Person ohne Einwilligung zu klonen, ist auf eroq nicht erlaubt und birgt auch anderswo offensichtliche rechtliche Risiken. Die Studio-Stimmen und deine eigenen Klone sind sicherer Boden.

Wie viele Sprachen können die Stimmen sprechen?

Jede Studio-Stimme spricht 13 Sprachen, sodass dieselbe Besetzung eine ganze lokalisierte Reihe tragen kann. Übersetze das Skript, rendere jede Version und halte die Sprechweise über alle Märkte hinweg einheitlich.

Tagsvoicettsbudgetingcomparison

Mach das mit den Modellen hinter diesem Artikel – starte mit 50 Gratis-Credits oder sieh dir alle Engines und ihre Preise an.