Czym są tagi audio? Kompletny przewodnik po emocjonalnym TTS
- Autor
- Jack Limebear
- Opublikowano
- Ostatnia aktualizacja
PosłuchajPosłuchaj tego artykułu
Tagi audio to naturalne wskazówki w nawiasach, takie jak [śmiech], [westchnienie], [podekscytowany], [zmartwiony], które Eleven v3 traktuje jako instrukcje wykonania, a nie słowa do przeczytania. Gdy piszesz skrypt do modelu Text to Speech, dodając tagi audio, zyskujesz pełną kontrolę nad emocjami w nagraniu.Eleven v3, promptowanie audio stało się kluczową umiejętnością. Zamiast tylko wpisywać tekst, który ma przeczytać głos AI, możesz teraz użyć nowej funkcji — tagów audio — żeby sterować wszystkim: od emocji po sposób wypowiedzi.
Eleven v3 to wersja alfa podgląd badawczy nowego modelu. Wymaga więcej promptowania niż wcześniejsze modele — ale efekty są niesamowite.
Tagi audio ElevenLabs to słowa w nawiasach kwadratowych, które nowy model Eleven v3 rozumie i wykorzystuje do sterowania dźwiękiem. Mogą to być np. [excited], [whispers], [sighs], ale też [gunshot], [clapping] czy [explosion].
Tagi audio pozwalają ci kształtować, jak
W tym przewodniku znajdziesz wszystko o tagach audio: czym są, jak działają, jakie są ich kategorie i jak wypadają w porównaniu z SSML (Speech Synthesis Markup Language). Pokazujemy też najczęstsze zastosowania – każde z osobnym przewodnikiem.
Możesz wstawiać tagi audio w dowolnym miejscu skryptu, by na bieżąco zmieniać sposób wypowiedzi. Możesz też łączyć tagi w jednym skrypcie, a nawet zdaniu. Tagi dzielą się na główne kategorie:
Podsumowanie:
Te tagi pozwalają ustawić emocjonalny ton głosu — czy ma być poważny, intensywny czy radosny. Możesz użyć np. [sad], [angry], [happily] albo [sorrowful], osobno lub razem.
Tagi audio wpisujesz bezpośrednio w tekst, w kwadratowych nawiasach. Gdy chcesz zmienić sposób wypowiedzi, np. z normalnego na [zmartwiony], po prostu dodaj tag audio.
Te tagi dotyczą tonu i wykonania. Pozwalają zmienić głośność i energię w scenach wymagających ciszy lub siły. Przykłady: [whispers], [shouts], a nawet [x accent].
Reakcje ludzkie
Architektura Eleven v3 pozwala modelowi czytać kontekst głębiej niż wcześniejsze wersje, dzięki czemu rozpoznaje emocje, zmiany tonu, przejścia między postaciami i inne wskazówki bez dodatkowych ustawień. Po prostu napisz, czego oczekujesz, a model wykona to dokładnie tak, jak chcesz.
Eleven v3 radzi sobie też z dialogami wielu postaci, które brzmią naturalnie – z przerwami, zmianami nastroju i spontaniczną rozmową, wszystko dzięki tagom i strukturze skryptu.
Tagi audio vs. SSML
Jeśli korzystałeś z innych systemów TTS, pewnie spotkałeś się z Speech Synthesis Markup Language. Platformy jak Amazon Polly czy Microsoft Azure Speech używają tagów SSML, np. <break> czy <emphasis>, by dodać kontekst do skryptu TTS.dialogi z wieloma postaciami, które brzmią naturalnie — z przerwami, zmianami nastroju i niuansami rozmowy, bez skomplikowanego promptowania.
Dostępne już teraz
Eleven v3 nie obsługuje tagów SSML, takich jak break, ani innych tagów SSML. Zamiast tego rolę tę przejmują tagi audio, interpunkcja i sama struktura tekstu, dając ci pełną kontrolę nad nagraniem.
Eleven v3 jest dostępny w interfejsie ElevenLabs, a my oferujemy 80% zniżki do końca czerwca. Publiczne API dla Eleven v3 (alfa) też jest dostępne. Niezależnie czy testujesz, czy wdrażasz na większą skalę — teraz jest dobry moment, by sprawdzić nowe możliwości.
W tabeli poniżej możesz sprawdzić, jak zamienić popularne tagi SSML na odpowiedniki w Eleven v3.

Dla autora dodanie [szeptem] do zdania jest dużo prostsze niż ustawianie tempa prozodii.gra — a nie tylko czyta — to kwestia opanowania tagów audio. Przygotowaliśmy siedem krótkich, praktycznych przewodników, które pokazują, jak tagi takie jak [SZEPT], [CICHO SIĘ ŚMIEJE], czy [francuski akcent] pozwalają ci sterować kontekstem, emocjami, tempem, a nawet dialogiem wielu postaci jednym modelem.
Kategorie tagów audio w v3: Sterowanie nagraniem przez tagi audio
- Reakcja na sytuację – Tagi takie jak
[SZEPT],[KRZYK], czy[WESTCHNIENIE]pozwalają Eleven v3 reagować na sytuację — podkręcać napięcie, łagodzić ostrzeżenia czy robić pauzy dla efektu. - Gra aktorska postaci – Od
[głos pirata]po[francuski akcent], tagi zamieniają narrację w odgrywanie ról. Możesz zmienić postać w trakcie zdania i reżyserować całe sceny bez zmiany modelu. - Kontekst emocjonalny – Wskazówki jak
[westchnienie],[podekscytowany], czy[zmęczony]pozwalają sterować emocjami w każdej chwili — budować napięcie, ulgę czy humor, bez ponownych nagrań. - Inteligencja narracyjna – Opowiadanie historii to kwestia wyczucia czasu. Tagi takie jak
[pauza],[zachwyt], czy[dramatyczny ton]kontroluj rytm i akcenty, żeby - Dialog wielu postaci – Pisz nakładające się kwestie i szybkie dialogi z
[przerywa],[nakładające się głosy], albo zmianami tonu. Jeden model, wiele głosów — naturalna rozmowa za jednym podejściem. - Kontrola wypowiedzi – Dopracuj tempo i akcenty. Tagi jak
[pauza],[pośpiech], czy[przeciągnięte]pozwalają precyzyjnie sterować tempem i zamienić zwykły tekst w prawdziwe wykonanie. - Naśladowanie akcentów – Zmieniaj regiony w locie —
[amerykański akcent],[brytyjski akcent],[południowy akcent USA]i inne — dla bogatszej mowy bez zmiany modelu.








.webp&w=3840&q=80)
.webp&w=3840&q=80)
