什么是音频标签?情感 TTS 全面指南
- 发布时间
- 最近更新
音频标签是用中括号括起来的自然语言提示,如 [laughs]、[gasps]、[excited]、[worried],Eleven v3 会将其视为表演指令,而不是要朗读的内容。在为文本转语音模型编写脚本时,插入这些音频标签可以精细控制语音的情感表达。Eleven v3 发布,音频提示成为一项必备技能。现在不仅能输入或粘贴要让 AI 语音说的话,还能用全新功能——音频标签——来控制情感和表达方式。
Eleven v3 是一款 alpha 版本的 研究预览,基于全新模型。相比之前的模型,需要更多 提示词设计,但生成效果非常惊艳。
ElevenLabs 音频标签是用方括号包裹的词语,Eleven v3 新模型能识别并据此调整语音表现。例如 [excited]、[whispers]、[sighs],甚至 [gunshot]、[clapping]、[explosion] 等。
音频标签可自定义
本指南将介绍音频标签是什么、如何使用、所有可用标签类别,以及它们与 SSML(语音合成标记语言)的对比。还会介绍常见应用场景,并提供对应的详细指南。
可在脚本任意位置插入音频标签,实时调整语音表现。标签可组合使用,甚至一句话内也能混用。标签主要分为几类:
摘要:
这些标签可设定语音的情感基调,比如低落、激烈或愉快。可以单独或组合使用 [sad]、[angry]、[happily]、[sorrowful] 等。
音频标签直接插入在脚本文本中,并用中括号包裹。每当需要切换表达方式,比如从正常语气切换到 [worried],只需添加相应的音频标签即可。
这类标签主要调节语气和表现力。可用来调整音量和情绪强度,适合需要克制或强调的场景。例如:[whispers]、[shouts],甚至 [x accent]。
人类反应
Eleven v3 的架构让模型能比以往更深入理解上下文,无需额外参数或设置,就能根据情感提示、语调变化、说话人切换和上下文线索进行表达。只需告诉模型当前需要什么表现,它就能准确还原。
Eleven v3 还能自然处理多角色对话,包括打断、情绪变化和真实对话的来回互动,仅靠标签和脚本结构即可实现。
音频标签与 SSML 的区别
如果你用过其他 TTS 系统,应该见过语音合成标记语言(SSML)。像 Amazon Polly 和 Microsoft Azure Speech 这类平台会用 <break> 或 <emphasis> 等 SSML 标签,为 TTS 脚本增加更多上下文。多角色对话,让对话更自然,支持打断、情绪切换和细腻互动,只需简单提示即可实现。
现已上线
Eleven v3 不支持 SSML 的 break 标签及其他 SSML 标签集。取而代之的是音频标签、标点和文本结构本身,带来更细致的表达控制。
Eleven v3 已在 ElevenLabs UI 上线,现 6 月底前享受 8 折优惠。Eleven v3(alpha)公测 API 也已开放。无论是试用还是大规模部署,现在正是探索新可能的好时机。
可参考下表,将常见 SSML 标签与 Eleven v3 的用法进行对照。

对写作者来说,直接加一个 [whispers] 标签,比设置 prosody rate 要简单得多。标签,如 【低语】, 【轻声笑】,或 【法国口音】,灵活控制语境、情感、语速,甚至多角色对话。
v3 中的音频标签类别:用标签引导演绎
- 情境感知 – 通过标签如
【低语】,【喊叫】,以及【叹气】,Eleven v3 可根据场景调整表现,强化氛围、缓和警告或制造悬念。 - 角色演绎 – 从
【海盗语气】到【法国口音】,标签让旁白变成角色扮演。可随时切换角色,无需更换模型。 - 情感表达 – 用标签如
【叹气】,【兴奋】,或【疲惫】,实时调节情绪,叠加紧张、轻松或幽默,无需重新录制。 - 叙事节奏 – 讲故事讲究节奏。用标签如
【停顿】,【敬畏】,或【戏剧性语气】控制语速和重音, - 多角色对话 – 用
【打断】,【重叠】或语气切换,写出重叠台词和快速对话。一个模型,多种声音,一次完成自然对话。 - 表达控制 – 精细调节语速和重音。用标签如
【停顿】,【急促】,或【拉长】,精准把控节奏,让文本变成表演。 - 口音模拟 – 随时切换地区口音——
【美式口音】,【英式口音】,【美国南方口音】等,无需更换模型即可实现多元文化表达。







.webp&w=3840&q=80)


