Rabatt auf Premium-Pläne, wenn du dich registrierstRabatt sichern

Blog/tutorials·11. Sept. 2026·7 Min.·vom eroq-Team

Stimmregie mit Satzzeichen – SSML gibt es hier nicht

Sechs Zeilen vorher/nachher: was jedes Zeichen am Vortrag ändert, was Satzzeichen nicht können, wo Tags von Voice One übernehmen, wo die Regler greifen.


Bei eroq gibt es kein SSML. Kein <break time="400ms"/>, kein Prosodie-Markup, keine Betonungs-Tags, keine Phonem-Overrides. Die Regiesprache besteht aus den Satzzeichen, die du schon kennst, aus zwei Reglern – und bei Voice One aus ein paar schlichten Wörtern in eckigen Klammern für das, was Satzzeichen nicht ausdrücken können. Die meisten rechnen mit einer Einschränkung und behandeln Zeichensetzung am Ende als Handwerk. Denn ein Skript, das trägt, wenn ein Mensch es vorliest, trägt auch, wenn die Engine es liest. Tags sind der letzte Schliff, nie das Gerüst.

Hier kommen die sechs Zeichen, die einen Vortrag verändern – jedes zweimal gezeigt.

Sechs Zeichen, sechs Aufgaben

Auslassungspunkte halten eine Pause

Vorher: Komm näher, ich war noch nicht fertig mit dir.

Nachher: Komm näher… ich war noch nicht fertig mit dir.

Das Komma holt Luft. Die Auslassungspunkte lassen die Stimme in der Schwebe. Sie bremsen außerdem die Wörter davor und danach, deshalb ist einmal pro Absatz die Grenze – eine Stimme, die in jedem Satz ausklingt, wirkt bei allen unsicher.

Der Gedankenstrich setzt eine Zäsur

Vorher: Ich wollte eigentlich warten, aber warum sollte ich?

Nachher: Ich wollte eigentlich warten – aber warum sollte ich?

Ein Komma verbindet zwei Satzteile. Ein Gedankenstrich unterbricht einen. Nutze ihn für einen Sinneswandel mitten im Satz, eine Selbstkorrektur, einen Gedanken, der spät kommt und den vorigen beiseiteschiebt.

Fragezeichen heben die Zeile an

Vorher: Du dachtest echt, ich hätte dich vergessen.

Nachher: Du dachtest echt, ich hätte es vergessen? Dich?

Eine Frage steigt am Ende an. Zwei gestapelte Fragen steigen zweimal, und das Fragment bekommt den zweiten Anstieg ganz für sich. Einen Satz in eine Frage plus Fragment zu zerlegen, ist der billigste Weg zu einer Haltung, die dir kein Regler liefert.

Ausrufezeichen treiben die Energie hoch

Vorher: Stopp, genau da. Perfekt, bleib genau so.

Nachher: Stopp, genau da! Perfekt – bleib genau so.

Lautstärke und Tempo gehen eine Stufe nach oben. Sparsam damit umzugehen ist keine Geschmacksfrage, sondern simple Rechnung: Wenn drei Sätze hintereinander schreien, schreit keiner davon, und die Zeile wirkt wie eine Grundstimmung statt wie eine Reaktion.

Satzlänge steuert das Tempo

Vorher: Mach langsam und atme durch, und dann können wir richtig anfangen.

Nachher: Mach langsam. Atme. Gut – jetzt können wir anfangen.

Kurze Sätze klingen knackig, weil jeder Punkt ein echter Halt ist, auf dem die Stimme landen muss. Lange, von Kommas getragene Sätze fließen. Das ist der mit Abstand größte Hebel in dieser Liste – und der, zu dem Autoren zuletzt greifen, weil er Umschreiben bedeutet, statt nur ein Zeichen zu ergänzen.

Kommas um ein Wort lassen es landen

Vorher: Und das ist genau das Problem.

Nachher: Und das, genau das, ist das Problem.

Wenn du eine Wendung mit Kommas absetzt, legt der Vortrag Gewicht darauf. Näher kommst du an eine Betonung einzelner Wörter nicht heran, und anders als ein Tag übersteht es das laute Vorlesen durch einen Menschen – du kannst es also testen, ohne einen Credit auszugeben.

Alle sechs findest du in der Vortrags-Syntax im Tool „Stimme“: Ein Tipp auf einen Eintrag setzt sein Beispiel in den Editor, damit du den Unterschied hörst, statt mir einfach zu glauben.

Zeilenumbrüche und Absätze

Ein Punkt beendet einen Satz; ein Absatz trennt Gedanken, und der Vortrag behandelt ihn als die größere der beiden Lücken. Setz den Umbruch dort, wo ein Vorleser tatsächlich Luft holen würde – zwischen Aufbau und Pointe –, nicht dort, wo die Seite ordentlich aussieht. Eine Wand aus sechs Sätzen wird auch als Wand gerendert.

Was Satzzeichen nicht können

Gut zu wissen, bevor du einen ganzen Nachmittag mit Ausprobieren verbringst:

  • Es gibt keine getimte Pause. Du kannst keine 400 Millisekunden anfordern. Muss eine Lücke exakt sitzen – ein Beat, auf das Bild geschnitten, eine Lücke für einen Soundeffekt –, renderst du die beiden Hälften getrennt und setzt sie in deinem Schnittprogramm zusammen.
  • Es gibt keinen Betonungs-Tag. Deine Werkzeuge sind Kommas um eine Wendung oder ein Umbau des Satzes, sodass das wichtige Wort am Ende eines kurzen Satzes landet.
  • Es gibt kein Stimmungszeichen. Kein Satzzeichen bringt eine Stimme zum Flüstern, Lachen oder Schluchzen. Das ist die eine Aufgabe, die den Tags bleibt – siehe unten.
  • Es gibt keinen Aussprache-Override. Ein Akronym oder ein ungewöhnlicher Name, der falsch herauskommt, wird korrigiert, indem du ihn so schreibst, wie er klingt – „Es Ku El“ oder „Kess-ler“ –, nicht über einen Phonem-Tag.

Tags für das, was Satzzeichen nicht sagen können

Bei Voice One steuern ein, zwei Wörter in eckigen Klammern den Vortrag, und die Stimme spielt sie, statt sie auszusprechen:

[whispering] Komm näher. Ich muss dir etwas sagen.

[laughing] Okay, okay – du hast mich erwischt.

Drei Familien decken fast alles ab:

  • Sprechweise und Emotion – [whispering], [shouting], [soft], [excited], [sad], [angry] (flüsternd, schreiend, sanft, aufgeregt, traurig, wütend) oder jede kurze Beschreibung wie [warm and teasing]. Ein Sprechweisen-Tag gilt bis zum nächsten Tag oder zum nächsten Zeilenumbruch, ein einziges [whispering] deckt also einen ganzen Absatz ab.
  • Laute – [laughing], [sighing], [gasping], [clear throat] (Lachen, Seufzen, Luftschnappen, Räuspern). Sie passieren einmal, genau dort, wo du sie hinsetzt.
  • Pausen – [pause] und [long pause] wirken wie ein Beat, so wie Auslassungspunkte. Eine abgemessene Lücke sind sie trotzdem nicht.

Zwei Gewohnheiten halten sie zuverlässig. Setz den Tag direkt vor die Wörter, die er färben soll, und gib der Stimme immer nur eine Stimmung auf einmal – [sad][whispering] lässt sich ganz natürlich kombinieren, [whispering][shouting] zieht gleichzeitig in zwei Richtungen. Tags brauchen Voice One; Turbo liest die Wörter und überspringt die Klammern.

Dann die zwei Regler

Satzzeichen formen die Darbietung; die Regler legen das Register fest, in dem sie stattfindet.

Tempo reicht von 0,70× bis 1,30× in Schritten von 0,05, wobei 1 natürlich klingt. Ausdruck reicht von 0, einem ruhigen, nahen Vortrag, bis 100%, theatralisch, und bestimmt, wie stark sich die Engine in die Satzzeichen legt, die du geschrieben hast. Beide funktionieren bei Studio-Stimmen genauso wie bei deinen eigenen Klonen, und beide sind echte Engine-Parameter, keine Nachbearbeitung.

Drei Kombinationen, die sich bewähren:

  • Hörbuch-Erzählung – Tempo 0,95, Ausdruck 30%. Gleichmäßig, ohne Eile, nichts, was den Text kommentiert.
  • Charakterdialog – Tempo 1,00, Ausdruck 70%. Die Zeichen schauspielern; der Regler lässt es zu.
  • Werbesprecher – Tempo 1,10, Ausdruck 55%. Nach vorn gelehnt, ohne zur Karikatur zu werden.

Verstell immer nur einen Regler, und wenn eine geklonte Stimme nicht mehr nach ihrem Original klingt, nimm zuerst den Ausdruck zurück, bevor du das Tempo anfasst. Die Sprachprobe ist der Anker, und beide Regler ziehen davon weg.

Ein Absatz, vorher und nachher

Vorher

Ich kann nicht glauben, dass du nach allem, was letztes Mal passiert ist, tatsächlich zurückgekommen bist, und ehrlich gesagt weiß ich nicht, was ich dir sagen soll, also setz dich vielleicht besser hin und erzähl mir, was du gesehen hast, bevor jemand merkt, dass die Tür offen ist.

Nachher

Du bist zurückgekommen. Ich dachte nicht, dass du das tust… nicht nach letztem Mal.

Setz dich – nein, wirklich, setz dich. Wir haben vielleicht zehn Minuten, bevor sie die Tür bemerken.

Also. Erzähl mir, was du gesehen hast.

Dieselbe Information, vier Sekunden länger, und es klingt nach einem Menschen statt nach einem Absatz. Getaggt wurde nichts. Die ganze Änderung besteht aus fünf Punkten, Auslassungspunkten, einem Gedankenstrich und einem Absatzumbruch.

Iteriere mit dem günstigen Modell

Satzzeichen umzuschreiben ist eine Schleife, und Schleifen sollten billig sein. Entwirf mit Voice Turbo für 2 Credits pro 100 Zeichen, liefere mit Voice One für 3 – dieselben Studio-Stimmen, dieselben Klone, am Ende dieselbe MP3. Eine Zeile mit 200 Zeichen kostet 6 Credits mit Voice One und 4 mit Turbo – ein Dutzend Durchgänge an einem widerspenstigen Satz kostet also weniger als ein Kaffee. Die Ausnahme ist eine Zeile mit Tags: Turbo überspringt sie, also hör dir solche Zeilen mit Voice One an. Voice One vs. Voice Turbo zeigt, wo sich der zusätzliche Credit bemerkbar macht.

Über die API heißen dieselben zwei Regler speed und expressiveness auf POST /v1/audio/speech, dokumentiert in der Speech-Referenz, und der Eingabetext ist die Regie – genau wie im Studio. Willst du das Ergebnis unter ein Bild legen, macht KI-Voice-over für Video dort weiter, wo dieser Artikel aufhört.

Häufige Fragen

Unterstützt eroq SSML oder Stimm-Tags?

Kein SSML – kein Break-Tag mit Dauer, kein Prosodie-Markup. Voice One liest aber kurze Tags in eckigen Klammern wie [whispering], [laughing] oder [pause] und spielt sie, statt sie auszusprechen; Turbo überspringt sie. Satzzeichen, Satzbau und die Regler für Tempo und Ausdruck erledigen den Rest.

Wie bekomme ich eine Pause mit exakter Länge?

Anfordern lässt sie sich nicht. Auslassungspunkte erzeugen eine schwebende Pause und ein Absatz eine größere Lücke, aber keins von beidem ist abgemessen. Muss eine Lücke einen bestimmten Frame treffen, renderst du die beiden Hälften als getrennte Zeilen und legst sie in deinem eigenen Schnittprogramm auf eine Timeline.

Warum klingt meine Zeile flach, egal was ich einstelle?

Fast immer, weil der Text flach ist. Lange Kommasätze ohne Punkt geben der Engine nichts, worauf sie landen kann, und mehr Ausdruck auf einem flachen Skript erzeugt nur einen nachdrücklichen Einheitston. Zerleg ihn zuerst in kurze Sätze und rendere dann neu.

Funktionieren diese Zeichen bei einer geklonten Stimme genauso?

Ja. Satzzeichen, Tempo und Ausdruck verhalten sich bei Studio-Stimmen und bei deinen Klonen identisch, denn der Klon liefert Klangfarbe und Sprechart, das Skript die Darbietung. Klingt ein Klon bei hohem Ausdruck nicht mehr nach sich selbst, dreh den Regler herunter, statt den Text umzuschreiben.

Du willst die sechs Zeilen lieber hören als lesen? Öffne das Tool „Stimme“, ruf die Vortrags-Syntax auf und tipp jede einzeln in den Editor.

Tagstext-to-speechvoicewritingdeliverytutorial

Mach das mit den Modellen hinter diesem Artikel – starte mit 50 Gratis-Credits oder sieh dir alle Engines und ihre Preise an.