ऑडियो टैग्स क्या हैं? इमोशनल टेक्स्ट टू स्पीच की पूरी गाइड
- लेखक
- Jack Limebear
- प्रकाशित
- आखिरी बार अपडेट किया गया
ऑडियो टैग्स ब्रैकेट में लिखे गए नैचुरल-लैंग्वेज संकेत होते हैं, जैसे [laughs], [gasps], [excited], और [worried], जिन्हें Eleven v3 शब्दों की तरह बोलने के बजाय परफॉर्मेंस डायरेक्शन के रूप में पढ़ता है। जब आप टेक्स्ट टू स्पीच मॉडल के लिए स्क्रिप्ट लिखते हैं, तो इन ऑडियो टैग्स को जोड़ने से आप अपनी राइटिंग की इमोशनल डिलीवरी पर पूरा कंट्रोल पा सकते हैं।Eleven v3 के रिलीज़ होने पर, ऑडियो प्रॉम्प्टिंग अब एक ज़रूरी स्किल बन गई है। अब आपको AI वॉइस से जो भी कहना है, उसे टाइप या पेस्ट करने की बजाय, आप एक नई सुविधा — ऑडियो टैग्स — का इस्तेमाल कर सकते हैं, जिससे आप भावना से लेकर डिलीवरी तक सब कंट्रोल कर सकते हैं।
Eleven v3 एक अल्फा रिलीज़ है रिसर्च प्रीव्यू नए मॉडल का। इसमें पिछले मॉडल्स के मुकाबले ज़्यादा प्रॉम्प्ट इंजीनियरिंग की ज़रूरत है — लेकिन रिजल्ट्स शानदार हैं।
ElevenLabs ऑडियो टैग्स वे शब्द होते हैं जिन्हें स्क्वायर ब्रैकेट्स में लिखा जाता है और नया Eleven v3 मॉडल इन्हें समझकर ऑडियो में इस्तेमाल करता है। ये कुछ भी हो सकते हैं जैसे [excited], [whispers], [sighs], [gunshot], [clapping], या [explosion]।
ऑडियो टैग्स आपको यह तय करने देते हैं कि
इस गाइड में बताया गया है कि ऑडियो टैग्स क्या हैं, ये कैसे काम करते हैं, कौन-कौन से टैग्स उपलब्ध हैं, और ये SSML (Speech Synthesis Markup Language) से कैसे अलग हैं। हम आमतौर पर इस्तेमाल होने वाले यूज़ केस भी बताएंगे, जिनके लिए अलग-अलग गाइड्स भी हैं।
आप अपने स्क्रिप्ट में कहीं भी ऑडियो टैग्स डाल सकते हैं और रियल टाइम में डिलीवरी को ढाल सकते हैं। आप एक ही स्क्रिप्ट या वाक्य में कई टैग्स भी इस्तेमाल कर सकते हैं। टैग्स मुख्य रूप से इन कैटेगरी में आते हैं:
सारांश:
इन टैग्स से आप वॉइस का इमोशनल टोन सेट कर सकते हैं — चाहे वो गंभीर हो, तेज़ हो या खुशमिज़ाज। उदाहरण के लिए आप [sad], [angry], [happily] और [sorrowful] जैसे टैग्स का एक साथ या अलग-अलग इस्तेमाल कर सकते हैं।
ऑडियो टैग्स आपकी ट्रांसक्रिप्ट में इनलाइन रहते हैं और स्क्वायर ब्रैकेट्स में लिखे जाते हैं। जब भी आप डिलीवरी बदलना चाहें, जैसे नॉर्मल से [worried] पर जाना हो, तो बस एक ऑडियो टैग जोड़ दें।
ये टैग्स टोन और परफॉर्मेंस से जुड़े होते हैं। आप इनसे वॉल्यूम और एनर्जी को एडजस्ट कर सकते हैं, खासकर उन सीन के लिए जहां संयम या जोश चाहिए। उदाहरण: [whispers], [shouts] या [x accent]।
मानव प्रतिक्रियाएँ
Eleven v3 की आर्किटेक्चर मॉडल को पहले के मुकाबले ज़्यादा गहराई से कॉन्टेक्स्ट पढ़ने देती है, जिससे ये इमोशनल संकेत, टोन शिफ्ट, स्पीकर ट्रांज़िशन और कॉन्टेक्स्ट क्लूज़ को बिना किसी अलग सेटिंग के फॉलो कर सकती है। बस मॉडल को बताएं कि आपको किस तरह की डिलीवरी चाहिए, और ये लाइन को वैसे ही परफॉर्म करेगा।
Eleven v3 मल्टी-स्पीकर डायलॉग को भी नैचुरल तरीके से हैंडल करता है, जिसमें इंटरप्शन, मूड शिफ्ट और असली बातचीत जैसा नैचुरल बैक-एंड-फोर्थ शामिल है—सिर्फ टैग्स और स्क्रिप्ट स्ट्रक्चर से।
ऑडियो टैग्स बनाम SSML
अगर आपने दूसरे TTS सिस्टम्स के साथ काम किया है, तो आपने शायद Speech Synthesis Markup Language देखा होगा। Amazon Polly और Microsoft Azure Speech जैसे प्लेटफॉर्म SSML टैग्स जैसे <break> या <emphasis> का इस्तेमाल TTS स्क्रिप्ट में एक्स्ट्रा कॉन्टेक्स्ट देने के लिए करते हैं।मल्टी-स्पीकर डायलॉग्स भी बना सकते हैं जो स्पॉन्टेनियस लगते हैं — इंटरप्शन, मूड शिफ्ट और कन्वर्सेशनल नूअंस को बहुत कम प्रॉम्प्टिंग में संभाल सकते हैं।
अब उपलब्ध
Eleven v3 SSML ब्रेक टैग्स या बाकी SSML टैग्स को सपोर्ट नहीं करता। इसकी जगह ऑडियो टैग्स, पंक्चुएशन और टेक्स्ट की स्ट्रक्चर ही ये रोल निभाते हैं, और आपको डिलीवरी पर पूरा कंट्रोल देते हैं।
Eleven v3 अब ElevenLabs UI में उपलब्ध है, और हम जून के अंत तक 80% की छूट दे रहे हैं। Eleven v3 (अल्फा) के लिए पब्लिक API भी उपलब्ध है। चाहे आप एक्सपेरिमेंट कर रहे हों या बड़े पैमाने पर डिप्लॉय, अभी नए फीचर्स आज़माने का सही समय है।
आप नीचे दी गई टेबल का इस्तेमाल करके आम SSML टैग्स को Eleven v3 के बराबर टैग्स से मैच कर सकते हैं।

राइटर के नज़रिए से देखें तो लाइन में [whispers] जोड़ना, प्रोसोदी रेट सेट करने से कहीं आसान है।सिर्फ पढ़ती नहीं, बल्कि परफॉर्म भी करती है ऑडियो टैग्स को अच्छे से समझने पर निर्भर करता है। हमने सात छोटे, प्रैक्टिकल गाइड्स बनाए हैं जो दिखाते हैं कि कैसे [धीरे से फुसफुसाते हुए], [हल्के से हँसते हुए], या [फ्रेंच लहजा] जैसे टैग्स से आप एक ही मॉडल में कॉन्टेक्स्ट, भावना, गति और मल्टी-कैरेक्टर डायलॉग्स को ढाल सकते हैं।
v3 में ऑडियो टैग्स की कैटेगरी: ऑडियो टैग्स से परफॉर्मेंस डायरेक्ट करना
- सिचुएशनल अवेयरनेस – जैसे टैग्स
[धीरे से फुसफुसाते हुए],[चिल्लाते हुए], और[आह भरते हुए]Eleven v3 को मौके के हिसाब से रिएक्ट करने देते हैं—कहीं इंटेंसिटी बढ़ाना, कहीं चेतावनी को सॉफ्ट करना या सस्पेंस के लिए पॉज़ लेना। - कैरेक्टर परफॉर्मेंस –
[समुद्री डाकू की आवाज़]से लेकर[फ्रेंच लहजा]तक, टैग्स नैरेशन को रोल-प्ले में बदल देते हैं। एक ही लाइन में पर्सोना बदलें और बिना मॉडल बदले फुल कैरेक्टर परफॉर्मेंस डायरेक्ट करें। - इमोशनल कॉन्टेक्स्ट – जैसे संकेत
[आह भरते हुए],[उत्साहित], या[थके हुए]हर पल की भावना को गाइड करते हैं, टेंशन, राहत या ह्यूमर जोड़ते हैं—फिर से रिकॉर्डिंग की ज़रूरत नहीं। - नैरेटिव इंटेलिजेंस – कहानी सुनाने में टाइमिंग ज़रूरी है। जैसे टैग्स
[रुकावट],[आश्चर्य], या[नाटकीय अंदाज़]रिदम और ज़ोर को कंट्रोल करें ताकि - मल्टी-कैरेक्टर डायलॉग – ओवरलैपिंग लाइन्स और तेज़ बातचीत लिखें
[बीच में टोकते हुए],[एक-दूसरे पर बोलते हुए], या टोन स्विच के साथ। एक ही मॉडल, कई आवाज़ें—एक ही टेक में नैचुरल कन्वर्सेशन। - डिलीवरी कंट्रोल – गति और इम्पहसिस को फाइन-ट्यून करें। जैसे टैग्स
[रुकावट],[जल्दी-जल्दी], या[खींचकर बोले हुए]से आप टेम्पो पर सटीक कंट्रोल पाते हैं, जिससे सिंपल टेक्स्ट भी परफॉर्मेंस बन जाता है। - एक्सेंट एमुलेशन – तुरंत रीजन बदलें—
[अमेरिकन लहजा],[ब्रिटिश लहजा],[साउदर्न US लहजा]और भी बहुत कुछ—कल्चरल टच के साथ स्पीच, बिना मॉडल बदले।










