Stimme
Diarisierung
Diarisierung (Sprecherdiarisierung) ist der Teil der Transkription, der ermittelt, wer wann gesprochen hat, und ein Transkript nach Sprechern kennzeichnet. Sie macht aus der Textwand eines Interviews ein lesbares Gespräch in zwei Spalten.
Dafür ist ein anderes Modell zuständig als für die Umwandlung von Ton in Worte – deshalb liefern viele Transkriptionsdienste präzisen Text ganz ohne Sprecherkennzeichnung.
Zeitstempel auf Wortebene sind eine verwandte, aber eigene Funktion – und genau die, die Untertiteldateien tatsächlich brauchen.
Auf eroq
Scribe One liefert Text für 1 Credit pro Minute Audio, mit automatischer Spracherkennung. Es diarisiert nicht, liefert keine Zeitstempel auf Wortebene und erstellt keine Untertiteldatei – es eignet sich also eher, um deinen eigenen Sprechertext zu untertiteln, als um ein Interview zu zerlegen.
Fragen
Kann eroq in einer Aufnahme kennzeichnen, wer was gesagt hat?
Nein. Scribe One liefert den Text des Gesagten ohne Sprecherkennzeichnung, eine Aufnahme mit mehreren Sprechern kommt also als ein durchgehendes Transkript zurück.
Bekomme ich eine SRT-Datei für Untertitel?
Nicht von eroq – es gibt weder Zeitstempel auf Wortebene noch eine Untertitel-Ausgabe. Das Transkript ist Text, den du in ein Untertitel-Tool übernimmst.
Wofür ist die Transkription hier dann gut?
Um deinen eigenen Sprechertext wieder in Text zu verwandeln – für Untertitel, die du selbst timst, für eine Beschreibung oder um zu prüfen, was eine generierte Stimme tatsächlich gesagt hat.
Weitere Begriffe: Stimme