Audio Tags 行内导演
在文稿写 [whispers]、[excited]、[laughs]、[sighs]、[sarcastically]。旁白/广告口播要具体情绪时,少靠「再生成碰运气」。
ElevenLabs 正式版最具表现力 TTS:行内 Audio Tags、多说话人对话、70+ 语言;错误率 4.9%。旁白、对戏、口播要情绪时默认用它。

正式版相对 Alpha:用户偏好 72%;数字、符号、专业记号错误率从 15.3% 降到 4.9%——配音读错金额、日期时少一轮返工。

行内 Audio Tags 控情绪、多说话人对戏、70+ 语言同一条工作流——旁白平、角色抢戏、多语串口音时,优先改标签与说话人,而不是整段盲抽。
在文稿写 [whispers]、[excited]、[laughs]、[sighs]、[sarcastically]。旁白/广告口播要具体情绪时,少靠「再生成碰运气」。
Text to Dialogue 管多角色轮替、打断与情绪衔接。播客对谈、游戏过场、剧情 demo:换人时少出现「同一条嗓子硬演两人」。
全球内容不必为语种换模型。本地化配音、多语广告:规格对齐后直接改文稿与标签,而不是重开一条产线。
从旁白到对戏到口播——交付物不同,失败代价都是重录与档期。
要呼吸感与情绪起伏时用标签控节奏。平读像机器、高潮没有力度 → 听众跳出;ElevenLabs v3 默认给叙事向表现力。
多说话人共享上下文。角色抢话、情绪错位会直接废过场;对话模式比单条 TTS 硬拼更稳。
兴奋、克制、调侃用标签点名。口播语气不对等于整条广告重配;先定标签再听,少靠盲抽。
进入 Audio,选择 ElevenLabs v3。
正文 + 小写英文方括号标签,例如 [whispers] Something’s coming… [sighs]。多角色用对话流程分说话人。
先听情绪与咬字;不对就改标签/措辞再出,别整段重写碰运气。
开干前先对齐:免费额度、型号名、标签写法、默认何时选它。
Audio Tags · 多说话人 · 70+ 语言——与图像/视频模型同屏,打开即可用。
免费使用 ElevenLabs v3无需 ElevenLabs API Key。