Was sind Audio-Tags? Der vollständige Leitfaden für emotionales TTS
- Verfasst von
- Jack Limebear
- Veröffentlicht
- Zuletzt aktualisiert
AnhörenArtikel anhören
Audio-Tags sind in eckige Klammern gesetzte, natürlichsprachliche Hinweise wie [lacht], [keucht], [aufgeregt] und [besorgt], die Eleven v3 als Regieanweisung und nicht als zu sprechende Wörter interpretiert. Wenn Sie ein Skript für ein Text to Speech-Modell schreiben, ermöglichen Ihnen diese Audio-Tags eine präzise Steuerung der emotionalen Wiedergabe Ihres Textes.Eleven v3 ist Audio-Prompting zu einer wichtigen Fähigkeit geworden. Anstatt nur Text einzugeben oder einzufügen, können Sie jetzt eine neue Funktion nutzen – Audio-Tags – um alles von Emotion bis Vortrag gezielt zu steuern.
Eleven v3 ist eine Alpha-Version Forschungsvorschau des neuen Modells. Es erfordert mehr Prompt Engineering als frühere Modelle – aber die Ergebnisse sind beeindruckend.
ElevenLabs Audio-Tags sind Wörter in eckigen Klammern, die das neue Eleven v3 Modell interpretieren und zur Steuerung der Audioausgabe nutzen kann. Beispiele sind [excited], [whispers], [sighs] bis hin zu [gunshot], [clapping] und [explosion].
Mit Audio-Tags gestalten Sie, wie
Dieser Leitfaden erklärt, was Audio-Tags sind, wie sie funktionieren, welche Kategorien es gibt und wie sie sich mit SSML (Speech Synthesis Markup Language) vergleichen. Außerdem stellen wir typische Anwendungsfälle vor, jeweils mit weiterführendem Leitfaden.
Sie können Audio-Tags überall im Skript platzieren, um die Ausgabe in Echtzeit zu beeinflussen. Auch Kombinationen innerhalb eines Skripts oder Satzes sind möglich. Die Tags lassen sich in Hauptkategorien einteilen:
Zusammenfassung:
Diese Tags helfen, die emotionale Stimmung der Stimme zu setzen – ob ernst, intensiv oder fröhlich. Zum Beispiel mit [sad], [angry], [happily] oder [sorrowful], einzeln oder kombiniert.
Audio-Tags stehen direkt im Skript und sind in eckige Klammern gesetzt. Immer wenn Sie die Wiedergabe ändern möchten, zum Beispiel von normal zu [besorgt], fügen Sie einfach ein Audio-Tag ein.
Hier geht es um Ton und Vortrag. Mit diesen Tags passen Sie Lautstärke und Energie an – für Szenen, die Zurückhaltung oder Kraft erfordern. Beispiele: [whispers], [shouts] oder auch [x accent].
Menschliche Reaktionen
Die Architektur von Eleven v3 ermöglicht es dem Modell, Kontext tiefer zu erfassen als frühere Modelle. So kann es emotionalen Hinweisen, Tonwechseln, Sprecherwechseln und Kontextsignalen folgen, ohne dass zusätzliche Parameter oder Einstellungen nötig sind. Geben Sie einfach vor, was die Situation verlangt – das Modell setzt es exakt um.
Eleven v3 verarbeitet auch Dialoge mit mehreren Sprechern spontan, inklusive Unterbrechungen, Stimmungswechseln und natürlichem Gesprächsfluss – allein durch Tags und Skriptstruktur.
Audio-Tags vs. SSML
Wenn Sie mit anderen TTS-Systemen gearbeitet haben, kennen Sie wahrscheinlich Speech Synthesis Markup Language. Plattformen wie Amazon Polly und Microsoft Azure Speech nutzen SSML-Tags wie <break> oder <emphasis>, um einem TTS-Skript zusätzlichen Kontext zu geben.Dialoge mit mehreren Sprechern erstellen, die spontan wirken – inklusive Unterbrechungen, Stimmungswechseln und Gesprächsnuancen mit minimalem Prompting.
Jetzt verfügbar
Eleven v3 unterstützt keine SSML-Break-Tags oder andere SSML-Tags. Stattdessen übernehmen Audio-Tags, Zeichensetzung und die Struktur des Textes diese Rolle – und bieten dabei präzise Kontrolle über die Wiedergabe.
Eleven v3 ist in der ElevenLabs-Oberfläche verfügbar, und wir bieten 80 % Rabatt bis Ende Juni an. Die öffentliche API für Eleven v3 (Alpha) ist ebenfalls verfügbar. Egal ob Sie experimentieren oder im großen Maßstab einsetzen – jetzt ist der richtige Zeitpunkt, die Möglichkeiten zu erkunden.
Mit der folgenden Tabelle können Sie gängige SSML-Tags den entsprechenden Eleven v3-Tags zuordnen.

Aus Sicht von Autorinnen und Autoren ist das Hinzufügen von [flüstert] zu einer Zeile deutlich einfacher als das Konfigurieren einer Prosodie-Rate.performt – und nicht nur vorliest – gelingt mit dem gezielten Einsatz von Audio-Tags. Wir haben sieben kompakte, praxisnahe Anleitungen erstellt, die zeigen, wie Tags wie [FLÜSTERT], [LACHT LEISE] oder [französischer Akzent] Kontext, Emotion, Tempo und sogar Dialoge mit mehreren Charakteren mit nur einem Modell steuern.
Kategorien von Audio-Tags in v3: Performance mit Audio-Tags steuern
- Situationsbewusstsein – Tags wie
[FLÜSTERT],[RUFT]und[SEUFZT]lassen Eleven v3 auf den Moment reagieren – Spannung aufbauen, Warnungen abschwächen oder für Dramatik pausieren. - Charakter-Performance – Von
[Piratenstimme]bis[französischer Akzent]wird aus Erzählung Rollenspiel. Wechseln Sie mitten im Satz die Rolle und steuern Sie Charakter-Performances, ohne das Modell zu wechseln. - Emotionale Kontexte – Hinweise wie
[seufzt],[begeistert]oder[müde]steuern die Stimmung im Moment – Spannung, Erleichterung oder Humor, ganz ohne Nachbearbeitung. - Erzählintelligenz – Storytelling ist Timing. Tags wie
[Pause],[staunend]oder[dramatischer Ton]steuern Sie Rhythmus und Betonung, damit - Dialoge mit mehreren Charakteren – Schreiben Sie überlappende Sätze und schnelle Wortwechsel mit
[unterbricht],[überlappend]oder Tonwechseln. Ein Modell, viele Stimmen – natürliche Gespräche in einem Durchgang. - Vortragskontrolle – Feintuning von Tempo und Betonung. Tags wie
[Pause],[eilig]oder[gedehnt]geben Ihnen Kontrolle über das Tempo und machen aus einfachem Text eine Performance. - Akzent-Emulation – Wechseln Sie Regionen im Handumdrehen –
[amerikanischer Akzent],[britischer Akzent],[südamerikanischer Akzent]und mehr – für kulturell vielfältige Sprache ohne Modellwechsel.








.webp&w=3840&q=80)
.webp&w=3840&q=80)
