Stimme
Text-zu-Sprache (TTS)
Text-zu-Sprache (Text-to-Speech) wandelt geschriebenen Text in gesprochenes Audio um. Ausdrucksstarke TTS-Engines lesen Satzzeichen als Vortragsanweisung und bieten Regler wie Tempo und Ausdrucksstärke – für natürliche Erzählung und Dialoge.
Abgerechnet wird meist pro Zeichen, wodurch sich Budgets für lange Sprechertexte leicht berechnen lassen.
Auf eroq
Voice One (3 Credits / 100 Zeichen) und Voice Turbo (2), eine kuratierte Stimmauswahl, geklonte Stimmen, sprechende Charaktere, MP3-Ausgabe, 13 Sprachen.
Fragen
Wie wird TTS auf eroq abgerechnet?
Pro angefangenem Block von 100 Zeichen: 3 Credits auf Voice One, 2 auf Voice Turbo.
Kostet eine kurze Zeile weniger als eine lange?
Nur in ganzen Blöcken. Eine Zeile mit 40 Zeichen und eine mit 100 Zeichen kosten beide einen Block – 3 Credits auf Voice One –, eine Zeile mit 101 Zeichen kostet zwei. Ein Skript in kurze Zeilen aufzuteilen kostet mehr, nicht weniger.
In welchem Format kommt das Audio zurück?
MP3 – geliefert vom Studio und von POST /v1/audio/speech und in deiner Bibliothek gespeichert. Es gibt keinen Stem-Export, keine Timing-Daten und kein Lip-Sync – die Datei legst du in deinem eigenen Schnittprogramm unter das Bild.
Weitere Begriffe: Stimme