Pomiń

Czym są tagi audio? Kompletny przewodnik po emocjonalnym TTS

Opublikowano
Ostatnia aktualizacja

PosłuchajPosłuchaj tego artykułu

Tagi audio to naturalne wskazówki w nawiasach, takie jak [śmiech], [westchnienie], [podekscytowany], [zmartwiony], które Eleven v3 traktuje jako instrukcje wykonania, a nie słowa do przeczytania. Gdy piszesz skrypt do modelu Text to Speech, dodając tagi audio, zyskujesz pełną kontrolę nad emocjami w nagraniu.Eleven v3, promptowanie audio stało się kluczową umiejętnością. Zamiast tylko wpisywać tekst, który ma przeczytać głos AI, możesz teraz użyć nowej funkcji — tagów audio — żeby sterować wszystkim: od emocji po sposób wypowiedzi.

Eleven v3 to wersja alfa podgląd badawczy nowego modelu. Wymaga więcej promptowania niż wcześniejsze modele — ale efekty są niesamowite.

Tagi audio ElevenLabs to słowa w nawiasach kwadratowych, które nowy model Eleven v3 rozumie i wykorzystuje do sterowania dźwiękiem. Mogą to być np. [excited], [whispers], [sighs], ale też [gunshot], [clapping] czy [explosion].

Tagi audio pozwalają ci kształtować, jak

W tym przewodniku znajdziesz wszystko o tagach audio: czym są, jak działają, jakie są ich kategorie i jak wypadają w porównaniu z SSML (Speech Synthesis Markup Language). Pokazujemy też najczęstsze zastosowania – każde z osobnym przewodnikiem.

Możesz wstawiać tagi audio w dowolnym miejscu skryptu, by na bieżąco zmieniać sposób wypowiedzi. Możesz też łączyć tagi w jednym skrypcie, a nawet zdaniu. Tagi dzielą się na główne kategorie:

Podsumowanie:

Te tagi pozwalają ustawić emocjonalny ton głosu — czy ma być poważny, intensywny czy radosny. Możesz użyć np. [sad], [angry], [happily] albo [sorrowful], osobno lub razem.

Background
Background

Tagi audio wpisujesz bezpośrednio w tekst, w kwadratowych nawiasach. Gdy chcesz zmienić sposób wypowiedzi, np. z normalnego na [zmartwiony], po prostu dodaj tag audio.

Te tagi dotyczą tonu i wykonania. Pozwalają zmienić głośność i energię w scenach wymagających ciszy lub siły. Przykłady: [whispers], [shouts], a nawet [x accent].

Background
Background

Reakcje ludzkie

Architektura Eleven v3 pozwala modelowi czytać kontekst głębiej niż wcześniejsze wersje, dzięki czemu rozpoznaje emocje, zmiany tonu, przejścia między postaciami i inne wskazówki bez dodatkowych ustawień. Po prostu napisz, czego oczekujesz, a model wykona to dokładnie tak, jak chcesz.

Background
Background

Eleven v3 radzi sobie też z dialogami wielu postaci, które brzmią naturalnie – z przerwami, zmianami nastroju i spontaniczną rozmową, wszystko dzięki tagom i strukturze skryptu.

Tagi audio vs. SSML

Jeśli korzystałeś z innych systemów TTS, pewnie spotkałeś się z Speech Synthesis Markup Language. Platformy jak Amazon Polly czy Microsoft Azure Speech używają tagów SSML, np. <break> czy <emphasis>, by dodać kontekst do skryptu TTS.dialogi z wieloma postaciami, które brzmią naturalnie — z przerwami, zmianami nastroju i niuansami rozmowy, bez skomplikowanego promptowania.

Dostępne już teraz

Eleven v3 nie obsługuje tagów SSML, takich jak break, ani innych tagów SSML. Zamiast tego rolę tę przejmują tagi audio, interpunkcja i sama struktura tekstu, dając ci pełną kontrolę nad nagraniem.

Eleven v3 jest dostępny w interfejsie ElevenLabs, a my oferujemy 80% zniżki do końca czerwca. Publiczne API dla Eleven v3 (alfa) też jest dostępne. Niezależnie czy testujesz, czy wdrażasz na większą skalę — teraz jest dobry moment, by sprawdzić nowe możliwości.

W tabeli poniżej możesz sprawdzić, jak zamienić popularne tagi SSML na odpowiedniki w Eleven v3.

Dla autora dodanie [szeptem] do zdania jest dużo prostsze niż ustawianie tempa prozodii.gra — a nie tylko czyta — to kwestia opanowania tagów audio. Przygotowaliśmy siedem krótkich, praktycznych przewodników, które pokazują, jak tagi takie jak [SZEPT], [CICHO SIĘ ŚMIEJE], czy [francuski akcent] pozwalają ci sterować kontekstem, emocjami, tempem, a nawet dialogiem wielu postaci jednym modelem.

Kategorie tagów audio w v3: Sterowanie nagraniem przez tagi audio

  • Reakcja na sytuację – Tagi takie jak [SZEPT], [KRZYK], czy [WESTCHNIENIE] pozwalają Eleven v3 reagować na sytuację — podkręcać napięcie, łagodzić ostrzeżenia czy robić pauzy dla efektu.
  • Gra aktorska postaci – Od [głos pirata] po [francuski akcent], tagi zamieniają narrację w odgrywanie ról. Możesz zmienić postać w trakcie zdania i reżyserować całe sceny bez zmiany modelu.
  • Kontekst emocjonalny – Wskazówki jak [westchnienie], [podekscytowany], czy [zmęczony] pozwalają sterować emocjami w każdej chwili — budować napięcie, ulgę czy humor, bez ponownych nagrań.
  • Inteligencja narracyjna – Opowiadanie historii to kwestia wyczucia czasu. Tagi takie jak [pauza], [zachwyt], czy [dramatyczny ton] kontroluj rytm i akcenty, żeby
  • Dialog wielu postaci – Pisz nakładające się kwestie i szybkie dialogi z [przerywa], [nakładające się głosy], albo zmianami tonu. Jeden model, wiele głosów — naturalna rozmowa za jednym podejściem.
  • Kontrola wypowiedzi – Dopracuj tempo i akcenty. Tagi jak [pauza], [pośpiech], czy [przeciągnięte] pozwalają precyzyjnie sterować tempem i zamienić zwykły tekst w prawdziwe wykonanie.
  • Naśladowanie akcentów – Zmieniaj regiony w locie — [amerykański akcent], [brytyjski akcent], [południowy akcent USA] i inne — dla bogatszej mowy bez zmiany modelu.

Podobne artykuły

Twórz z najwyższej jakości audio AI