Rabatt auf Premium-Pläne, wenn du dich registrierstRabatt sichern

eroq api · Stimme

Gib Worten eine Stimme.
Und hol sie zurück.

Zwei Sprachmodelle für zwei bis drei Credits pro hundert Zeichen, eine kuratierte Stimmauswahl und Klonen aus einer sauberen Aufnahme. Weise einem Charakter eine Stimme zu, und jede Zeile, die er spricht, hat dieselbe Stimme – dann transkribiere Audio mit demselben Schlüssel zurück in Text.

MP3-Ausgabe · 13 Sprachen · Klone privat in deinem Konto

50 Gratis-Credits bei der Registrierung · keine Kreditkarte nötig

curl https://eroq.ai/v1/audio/speech \
  -H "Authorization: Bearer $EROQ_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "eroq-voice-one",
  "input": "That noise is the reactor missing its coolant flush. [sighing] Again.",
  "voice": "aria"
}' \
  --output speech.mp3

Was du bekommst

Voice, gebaut für Produkte, die live gehen.

Zwei Geschwindigkeiten

Voice One für drei Credits pro hundert Zeichen, Voice Turbo für zwei. Gleiches Request-Format und dieselbe Stimmauswahl – Turbo opfert ein wenig Nuance für geringere Latenz und Kosten, wenn der Satz eine Benachrichtigung ist und keine Performance.

Stimme klonen

Lade eine saubere Aufnahme hoch, und der Klon gehört nur dir – privat in deinem Konto, nutzbar über die API, im Studio und für jeden Charakter, dem du ihn zuweist. Er wird in keiner gemeinsamen Stimmauswahl veröffentlicht, und niemand sonst kommt an ihn heran.

Charaktere, die sprechen

Verknüpfe eine Stimme mit einem gespeicherten Charakter, und alles, was er sagt, klingt in dieser Stimme – egal, ob der Aufruf aus deinem Produkt, einem Film oder dem Studio kommt. Eine einzige Zuweisung statt einer Stimm-ID, die du durch jede Aufrufstelle reichen musst.

Regie im Text

Tempo und Ausdruck sind Parameter, der Rest der Performance steckt im Input: Satzzeichen – Kommas, Auslassungspunkte, Zeilenumbrüche – bei beiden Engines, und bei Voice One zusätzlich Tags in eckigen Klammern wie [whispering] oder [laughing], die gespielt und nie vorgelesen werden. Es gibt keinen SSML-Dialekt, den du lernen musst – und keinen, bei dem du Fehler machen kannst.

Dreizehn Sprachen

Dieselben Stimmen sprechen dreizehn Sprachen, sodass ein geklonter Sprecher Texte vorlesen kann, die nie in dieser Sprache aufgenommen wurden. Die Aussprache folgt dem Text – Zahlen und Namen schreibst du also am besten aus.

Und wieder zurück

Die Transkription läuft mit demselben Schlüssel für einen Credit pro Minute Audio – so schließt sich der Kreis, wenn du deine eigene Erzählstimme untertiteln willst. Es gibt keine Sprechertrennung und keine Zeitstempel auf Wortebene, du bekommst also Text, keine Untertiteldatei.

FAQ

Die Kurzfassung.

Was kostet Sprachausgabe? +

Drei Credits pro hundert Zeichen mit Voice One und zwei mit Voice Turbo, berechnet auf den gesendeten Text. Transkription kostet einen Credit pro angefangener Minute Audio.

Wer kann eine Stimme nutzen, die ich klone? +

Nur dein Konto. Klone sind privat, landen in keiner gemeinsamen Stimmauswahl und lassen sich löschen – damit verschwinden sie auch bei jedem Charakter, dem sie zugewiesen waren.

In welchem Format kommt das Audio zurück? +

MP3. Es gibt keinen Endpoint für Audio-Streaming, ein langer Abschnitt kommt also als eine fertige Datei an und nicht schon während des Sprechens.

Gibt es Lip-Sync für ein generiertes Gesicht? +

Nein. Sprache und Video sind getrennte Aufrufe, und es gibt kein Lip-Sync-Tool. Veo 3.1 kann einen gesprochenen Satz als Teil eines Clips rendern, aber du kannst keine Sprachspur über einen bestehenden Clip legen und die Mundbewegung daran anpassen lassen.

Liefert die Transkription Zeitstempel? +

Nein – sie liefert Text. Es gibt keine Sprechertrennung, kein Timing auf Wortebene und keine Untertiteldatei; Untertitel brauchen also noch einen Durchgang in deinem Editor.

Der erste Aufruf in fünf Minuten.

Registrieren, Schlüssel erstellen, Quickstart einfügen. 50 Gratis-Credits reichen, um jedes Modell auszuprobieren, und Pläne gibt es ab $15.