Blog/developers·13. Sept. 2026·6 Min.·vom eroq-Team
Transkription mit Scribe One – Sprache zu Text in einer Anfrage
1 Credit pro angefangene Audiominute, automatische Spracherkennung, max. 8 MB und ehrliche Grenzen: keine Diarisierung, keine Zeitstempel, keine Untertitel.
Scribe One ist der kleinste Endpoint der Plattform und der, auf dem am häufigsten das Falsche gebaut wird. Er nimmt eine Audiodatei entgegen und gibt die Wörter darin zurück. Keine Untertiteldatei, kein Transkript mit Sprecherkennzeichnung, keinen Stream – die Wörter. Die meiste Arbeit an einer Transkriptionsfunktion besteht darin, deine Seite der Pipeline um genau diese Tatsache herum zu bauen. Deshalb hier der Endpoint, ehrlich beschrieben, und der Workflow, der dazu passt.
Die komplette Anfrage
Ein Multipart-POST, kein Job, den du abfragen musst, kein Webhook:
curl https://eroq.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $EROQ_API_KEY" \
-F model=eroq-scribe-one \
-F [email protected]
Und die komplette Antwort:
{
"model": "eroq-scribe-one",
"text": "That noise is the reactor missing its coolant flush.",
"usage": { "audio_seconds": 4.2, "credits_spent": 1, "credits_remaining": 882 }
}
Der Teil file muss WAV oder MP3 sein. Andere Container werden mit unsupported_format abgelehnt, statt stillschweigend umgewandelt zu werden. Wenn du im Browser aufnimmst, nimm also entweder WAV über WebAudio auf oder kodiere vor dem Upload clientseitig um – eine .ogg- oder .m4a-Datei direkt aus einem Recorder wird abgewiesen. Die vollständige Parameterliste steht in der Transkriptions-Referenz.
Ein Credit pro Minute
Scribe One berechnet 1 Credit pro angefangene Minute Audio. Die Länge wird vor der Transkription aus der Datei selbst gelesen, und die Antwort meldet sie neben dem Preis als usage.audio_seconds – die Abrechnung lässt sich also jederzeit mit dem gesendeten Audio abgleichen.
Was das in der Praxis heißt:
- Eine vier Sekunden lange Sprachnachricht kostet 1 Credit. Eine mit 59 Sekunden ebenfalls; 61 Sekunden kosten 2 Credits.
- Eine Stunde Audio kostet 60 Credits, egal wie du sie schickst. Aufteilen kostet nur die Rundung: Jede Anfrage rundet ihre eigene letzte Minute auf, also kosten zwanzig Clips à 30 Sekunden 20 Credits, während dieselben zehn Minuten in einer Datei 10 Credits kosten würden.
- Sprachnachrichten sind bewusst der günstige Fall. Ein Posteingang voller kurzer Nachrichten kostet einen Credit pro Nachricht – und genau das macht es bezahlbar, vorsorglich alles zu transkribieren: jede Sprachnachricht, jeden Clip in einer Bibliothek.
Automatische Spracherkennung und wann du nachhilfst
Die Sprache wird am Audio erkannt. Es gibt keinen Pflichtparameter und kein Modell pro Sprache, das du auswählen müsstest – ein mehrsprachiger Posteingang funktioniert also ohne Routing-Logik auf deiner Seite.
Das optionale Feld language nimmt einen ISO-Code (en, fr, de) als Hinweis entgegen, nicht als Vorgabe. Es lohnt sich in genau zwei Situationen: wenn du die Sprache aus dem Kontext schon kennst – eine Profileinstellung, ein Kanal, der immer in derselben Sprache läuft – und wenn kurzes oder verrauschtes Audio falsch erkannt wird. Ein Clip mit vier Wörtern gibt der Erkennung sehr wenig an die Hand, und ein Hinweis behebt das kostenlos.
Die 8-MB-Grenze und wie du darunter bleibst
Uploads sind auf 8 MB begrenzt, laut Doku ungefähr acht Minuten komprimiertes Audio. Das ist bewusst auf Material in Sprachnachrichtenlänge zugeschnitten, nicht auf Archive, und genau um diese Grenze herum planst du.
Der Hebel ist die Bitrate. Acht Megabyte sind bei einer typischen Podcast-Bitrate etwa acht Minuten; kodierst du auf 64 kbps mono um, fassen dieselben 8 MB ungefähr das Doppelte, ohne nennenswerten Verlust für Sprache. Aus einer langen Aufnahme wird so eine Handvoll Anfragen:
ffmpeg -i episode.mp3 -c:a libmp3lame -b:a 64k -ac 1 \
-f segment -segment_time 600 part%02d.mp3
Zehn-Minuten-Segmente mit 64 kbps mono landen bei jeweils rund 4,8 MB – bequem unter der Grenze, mit Luft für einen langen ersten Satz. Eine Folge von vierzig Minuten ergibt vier Anfragen von genau zehn Minuten, also 40 Credits für alles – genauso viel wie am Stück, weil Segmente aus ganzen Minuten keine Rundung kosten.
Ein Haken bei Segmenten fester Länge: Ein Schnitt kann mitten in einem Wort landen, und beide Hälften werden dann jeweils leicht falsch transkribiert. Wenn die Nahtstelle wichtig ist, schneide an Sprechpausen statt nach der Uhr, oder lass die Segmente ein bis zwei Sekunden überlappen und entferne die Überlappung, wenn du den Text zusammenfügst.
Die Transkription teilt sich das Rate-Limit für Medien – 6 Anfragen pro Minute und Schlüssel in einem kostenlosen Workspace, multipliziert mit deinem Plan. Das ist weit mehr, als eine segmentierte Folge braucht, aber gut zu wissen, wenn du ein Archiv nachträglich transkribierst. Fehlgeschlagene Anfragen werden automatisch erstattet, ein Netzwerkaussetzer mitten in der Archivverarbeitung lässt dich also nicht für nichts bezahlen.
Die eigene Erzählstimme untertiteln
Der häufigste Fall: Du hast eine MP3 und kein Skript. Vielleicht hast du sie selbst aufgenommen, vielleicht ist es eine alte Folge, vielleicht eine Sprachnachricht, die du jetzt als Text brauchst. Transkribier sie und erledige das Timing dann in dem Tool, in dem deine Timeline ohnehin liegt.
Sei dir über die Arbeitsteilung im Klaren, denn genau hier wird oft zu viel erwartet. Scribe One gibt einen Textblock zurück. Keine SRT, keine VTT und keine Zeiten pro Wort – Untertitel kann es also nicht selbst auf eine Timeline setzen. Was du bekommst, ist der genaue Text: der Teil, den Untertitel-Tools am schlechtesten können und den du am langsamsten abtippst. Füg ihn in den Untertitel-Aligner deines Schnittprogramms ein und lass den das Timing übernehmen.
Teilst du das Audio selbst auf, bekommst du ein grobes Timing gratis dazu – ein Segment, das bei Minute 10 beginnt, liefert Text, der zu Minute 10 gehört. Genauigkeit pro Untertitelzeile kommt weiterhin vom Aligner, aber Kapitelmarken, Shownotes und ein durchsuchbarer Index brauchen nur den Anker pro Segment, den du schon hast.
Die Gegenrichtung schließt den Kreis: Transkribier die Sprachnachricht eines Nutzers, beantworte sie mit einer Chat-Completion und sprich die Antwort mit /v1/audio/speech wieder ein. Stimme rein, Text dazwischen, Stimme raus – das sind drei Aufrufe, ganz ohne Streaming-Infrastruktur. TTS für KI-Charaktere behandelt den Sprachteil und seine Tricks gegen Latenz.
Die Grenzen, klar gesagt
Plane um sie herum, nicht gegen sie:
- Keine Diarisierung. Die Antwort enthält keine Sprecherkennzeichnung und keine Sprecherwechsel. Musst du wissen, wer gesprochen hat, nimm die Teilnehmenden auf getrennten Spuren auf, transkribier jede einzeln und füg sie auf deiner Seite nach Zeitstempel zusammen.
- Keine Zeitstempel auf Wort- oder Segmentebene. Die Antwort ist
text. Das Timing ergibt sich daraus, wie du das Audio schneidest, oder aus einem nachgelagerten Aligner. - Keine Untertiteldatei. Kein SRT, kein VTT, keine JSON-Cue-Liste.
- Kein Streaming und keine Echtzeit-Transkription. Es ist eine Anfrage und eine Antwort zu einer fertigen Datei, kein Live-Socket.
- Kein CLI-Befehl. Die
eroq-CLI deckt Bild, Video und Sprachausgabe ab; Transkription läuft über curl oder einen SDK-Aufruf.
Nichts davon ist ein Hinweis auf die Roadmap – so arbeitet der Endpoint heute, und eine Funktion auf Annahmen zu bauen, die er nicht erfüllt, ist der teuerste Weg, das herauszufinden. Braucht dein Produkt Sprecherkennzeichnungen für einen Gruppenanruf, lautet die ehrliche Antwort: getrennte Spuren, kein Parameter.
Für das Gesamtbild der Audio-Seite der API: Die Seite zur Voice-Plattform bündelt die Endpoints, Sprache-zu-Text ist die Definition in einem Absatz, und unter Preise findest du die Credit-Pakete, wenn du die Transkription eines Archivs kalkulierst.
Häufige Fragen
Was kostet die Transkription mit Scribe One?
1 Credit pro angefangene Minute Audio, mindestens eine Minute pro Anfrage. Eine Sprachnachricht kostet 1 Credit, eine Stunde Audio 60 Credits. Die gemessene Länge kommt als usage.audio_seconds zurück, und eine fehlgeschlagene Anfrage wird automatisch erstattet.
Welche Audioformate akzeptiert der Transkriptions-Endpoint?
Nur WAV und MP3. Alles andere liefert unsupported_format, statt umgewandelt zu werden – kodiere also vorher auf deiner Seite um. Für eine Aufnahme-Pipeline ist WAV über WebAudio im Browser die übliche Lösung.
Bekomme ich Zeitstempel oder Sprecherkennzeichnungen?
Nein. Die Antwort enthält den transkribierten Text und den Usage-Block – ohne Zeiten pro Wort, ohne Segmente und ohne Diarisierung. Schneide das Audio an bekannten Offsets für ein grobes Timing, nutze getrennte Spuren pro Sprecher, wenn du Kennzeichnungen brauchst, und lass nachgelagert einen Aligner laufen, wenn Untertitel framegenau sitzen müssen.
Erkennt Scribe One die Sprache automatisch?
Ja, die Spracherkennung läuft automatisch und braucht keinen Parameter. Du kannst in language einen ISO-Code als Hinweis mitgeben, wenn das Audio kurz oder verrauscht ist oder du die Sprache aus dem Kontext des Nutzers schon kennst – das verbessert die Genauigkeit ohne Aufpreis.
Audiodatei und Schlüssel parat? Ein curl, und du hast den Text. Hol dir einen API-Schlüssel – die ersten 50 Credits decken fünfzig Minuten Audio ab, bevor du etwas ausgibst.
Mach das mit den Modellen hinter diesem Artikel – starte mit 50 Gratis-Credits oder sieh dir alle Engines und ihre Preise an.