Stimme
Sprache-zu-Text (STT)
Sprache-zu-Text (Speech-to-Text) transkribiert gesprochenes Audio in geschriebenen Text. Zusammen mit einem Chatmodell und TTS entsteht daraus ein vollständiger Sprachdialog.
Die Erkennung der Sprache, Dateigrößenlimits und Preise pro Anfrage oder pro Minute sind die praktischen Eckdaten.
Auf eroq
Scribe One: 1 Credit pro angefangener Minute Audio, Dateien bis 8 MB, automatische Spracherkennung.
Fragen
Was kostet eine Transkription?
1 Credit pro angefangener Minute Audio auf Scribe One – eine Sprachnachricht kostet 1 Credit, eine Stunde Audio 60.
Welches Audio verarbeitet Scribe One?
Eine wav- oder mp3-Datei bis 8 MB – etwa acht Minuten komprimierte Sprache –, wobei die Sprache automatisch erkannt oder per Code vorgegeben wird. Längere Aufnahmen müssen geteilt werden; abgerechnet wird 1 Credit pro angefangener Minute jeder Datei, das Teilen kostet also nur die Rundung.
Liefert die Transkription Zeitstempel oder Sprecherkennzeichnungen?
Nein – die Antwort ist der Text des Audios und sonst nichts. Es gibt keine Diarisierung, keine Zeitangaben auf Wortebene und keine Untertiteldatei; Untertitel entstehen nachgelagert aus dem Text.
Weitere Begriffe: Stimme