“话都说得挺对,但听着就是不像真人。”
这是刚接入 AI 电话客服的朋友们最常说的一句话。
大家好,我是 Sonetho。⚡
在看过第1篇(入门)与第2篇(房产中介)后尝试搭建 AI 电话客服的朋友中,我们反复听到大家提起同一个问题。
那就是:话术虽然挑不出毛病,但无论面对情绪激动的客户,还是在签单达成的那一刻,它都用同一种语调说话。
如果是真人,到了该有情绪起伏的地方自然会有所变化,而它却毫无波澜;听的人很快就会察觉“又是 AI”,瞬间关上了沟通的心门。
ElevenLabs 正是针对这一痛点推出了表现力模式(Expressive mode)。
⚠️ 需要先说明一点:这并不是近期刚推出的新功能。
按官方博客的记录,它早在 2026年2月 就已经公开了。
但因为官方文档页面没有标注发布日期,很多朋友直到现在才第一次看到,我们在写这个系列时被问得最多的也是这个问题。
因此,今天就为大家详细介绍 Expressive mode 的配置方法。
🎭 1. 表现力模式由两个模块联动生效
它并不是靠一个按钮简单注入情绪的功能,而是同时改变了对话技术栈中的两个核心部分。
① Eleven v3 Conversational(朗读端)
这是专为实时对话降低了延迟的 v3 模型。核心优势在于在多轮交互之间保持对话上下文。
如果用户的声音听起来焦虑担忧,它的语调就会变得更加平缓沉稳;在需要准确传达关键信息的节点,吐字则会更加清晰有力。
② 全新的话轮转换系统(倾听端)
何时开口说话、何时继续等待,均由 Scribe v2 Realtime 的实时信号进行判定。
它不仅看转写出来的文本内容,还会深入分析对方说话的方式(语调与语气)。
官方文档举的例子非常直观:
比如一句“嗯”,可能代表已经回答完毕,也可能是话还没说完、正准备往下接的过渡信号。
单看文字根本无法区分,但一听语气就能立见分晓。系统正是据此来精准拿捏接入对话的时机。
因此,开启表现力模式后,声音更加富有情感,以及插话打断明显减少,是同步带来的效果。
⚙️ 2. 开启方法:只需切换一个模型
并没有单独的开关。只要将 TTS 模型选择为 V3 Conversational,表现力模式就会默认自动开启。
在控制台中
打开你的 Agent,进入 Agent Voice 标签页,将 Text to Speech 模型切换为 V3 Conversational 并保存即可。
在 CLI 中
elevenlabs agents pull --agent "<智能体名称>"在拉取下来的 agent_configs/<智能体名称>.json 中,将 conversation_config.tts.model_id 修改如下:
{
"conversation_config": {
"tts": {
"model_id": "eleven_v3_conversational"
}
}
}elevenlabs agents push --agent "<智能体名称>"
在 API 中
from elevenlabs import ElevenLabs
elevenlabs = ElevenLabs()
elevenlabs.conversational_ai.agents.update(
agent_id="此处填写智能体ID",
conversation_config={
"tts": {"model_id": "eleven_v3_conversational"},
},
)
📝 3. 语气需要在系统提示词中进行指示
如果仅仅更换了模型,情绪的表现幅度虽然变大了,但在什么节点、以何种方式展现情绪,完全交由模型自主决定。
如果团队有明确的品牌调性或客服接待规范,就必须在系统提示词中写明要求,才能保持输出一致稳定。
方法 ①:仅给出宏观方向
你是一名客户支持专员。如果用户听起来感到沮丧或愤怒,
请用沉稳且让人安心的语气回答。传达好消息时,声音中请透露出真诚的
温暖感。整体上请保持专业且平易近人的语气。
方法 ②:按场景明确规范
语气指引:
- 用户表达不满时:采用沉着且富有同理心的语气
- 解释技术操作流程时:吐字清晰,保持匀速
- 用户分享好消息时:给予温暖且明快的回应
- 处理客诉时:保持冷静,以解决问题为导向
官方文档明确说明,并不需要为每种情况都打上标签。
像上面这样用自然语言写出要求,模型就会根据上下文自行匹配理解。
而在实际业务中,方法 ② 会更稳妥。对于有规范接待流程的行业,用明确文句把“什么场景下用什么语气”固定下来,后续质检审核时也会方便得多。
🏷️ 4. 关键节点用标签精准把控
在基于上下文自动调节的基础上,你还可以显式指定特定片段的情绪。
具体方式是让 LLM 在回复内容中直接输出对应标签。
[laughs]夹带笑意[whispers]压低声音轻声细语[sighs]带有叹气的感觉[slow]放慢语速[excited]带有兴奋雀跃的情绪
★这是最容易产生误解的地方。 单个标签并不会改变整句话的基调。
每个标签仅仅对其紧随其后的 4~5 个词产生影响,随后便会恢复原本的语调。
因此,如果以为“在句首放一个标签就行”,实际效果往往不及预期。
务必将标签添加在想要产生效果的位置正前方。
官方给出的示例如下:
"That's great to hear! [laughs] I'm glad we could sort that out for you."
如果你之前从未接触过标签,建议先阅读深度解析 v3 标签的ElevenLabs 提示词完整指南。
我们在那篇文章中系统整理了情绪与音效标签,以及发音和断句技巧。
⚠️ 5. 开启前务必确认的局限性
官方文档明确指出了三项局限,其中第一点尤为关键。
① 专业声音克隆(PVC)特征无法完整保留
如果你投入了资金与时间,定制了企业负责人或专业配音员的 PVC 声音,这一项将直接决定你是否该引入该功能。
Eleven v3 Conversational 目前尚无法很好地保留 PVC 的声音特质。
生成出来的音频听起来可能并不像原本的声音。
官方文档的建议也非常明确:如果保留 PVC 声音的辨识度至关重要,请继续使用 Flash v2。
换句话说,目前面临的是“要丰富的情感,还是要留住特定真人的声音”二选一的局面,二者尚无法兼得。
② 标签生效范围仅限 4~5 个词
正如前文所述,它并不适合用来直接通篇改变一整个长句。
③ 不同音色与不同语言之间存在差异
支持语言已达 70 种以上,相比 Flash 系列的约 32 种有了大幅提升。
官方文档特别提到,像日语这类以往在语调细微差别上较弱的语言,本次得到了明显改善。
但同一份文档中也指出,不同语言的表现力并不均衡。
如果你的 Agent 主要用于中文接待,务必选用实际要用的音色,亲自用中文多跑几遍测试后再做评估。英语 Demo 表现亮眼,并不代表中文效果也能完全一致。
💰 6. 费用并不会增加
问这个问题的朋友出奇得多,而官方 FAQ 给出的答案很明确:“不会”。
Eleven v3 Conversational 与 Agent 中的其他 TTS 模型保持相同的单价,均为每分钟 $0.08 起。开启表现力模式不会产生任何额外的附加费用。
如果想测算在实际通话量下每月大概会产生多少费用,可以在费用计算器中按分钟数进行估算。
✍️ 写在最后
简单总结一下:
如何开启:将 TTS 模型切换为 V3 Conversational,仅此一步
如何微调:在系统提示词中分场景用文字写明对应的语气要求
局部把控:在需要改变的位置正前方添加标签(影响范围仅限 4~5 个词)
如何取舍:如果你正在使用 PVC 声音,请务必先对比测试再做决定
感谢大家的阅读。⚡