[AI电话客服第3期] 告别死板机械音:ElevenLabs情感表达模式设置指南

如果您的AI电话客服在面对愤怒的客户或传达好消息时都是同一种冷冰冰的语调,不妨检查一下ElevenLabs的情感表达模式(Expressive Mode)。只需将TTS模型切换为V3 Conversational,该模式即可默认开启。本文全面整理了控制台仪表盘、CLI命令行及API的详细配置方法,教你如何通过系统提示词(System Prompt)精准引导AI的语气语调。同时,还深入解析了情感标签仅对后方4~5个词生效的实操细节,以及使用专业声音克隆(PVC)时必须提前知晓的功能限制与避坑指南,助你打造自然生动、富有人性温度的智能语音客服系统。

“话都说得挺对,但听着就是不像真人。”
这是刚接入 AI 电话客服的朋友们最常说的一句话。

大家好,我是 Sonetho。⚡

在看过第1篇(入门)第2篇(房产中介)后尝试搭建 AI 电话客服的朋友中,我们反复听到大家提起同一个问题。

那就是:话术虽然挑不出毛病,但无论面对情绪激动的客户,还是在签单达成的那一刻,它都用同一种语调说话。
如果是真人,到了该有情绪起伏的地方自然会有所变化,而它却毫无波澜;听的人很快就会察觉“又是 AI”,瞬间关上了沟通的心门。

 

ElevenLabs 正是针对这一痛点推出了表现力模式(Expressive mode)

⚠️ 需要先说明一点:这并不是近期刚推出的新功能。
按官方博客的记录,它早在 2026年2月 就已经公开了。
但因为官方文档页面没有标注发布日期,很多朋友直到现在才第一次看到,我们在写这个系列时被问得最多的也是这个问题。
因此,今天就为大家详细介绍 Expressive mode 的配置方法

 


🎭 1. 表现力模式由两个模块联动生效

 

它并不是靠一个按钮简单注入情绪的功能,而是同时改变了对话技术栈中的两个核心部分。

 

① Eleven v3 Conversational(朗读端)

这是专为实时对话降低了延迟的 v3 模型。核心优势在于在多轮交互之间保持对话上下文
如果用户的声音听起来焦虑担忧,它的语调就会变得更加平缓沉稳;在需要准确传达关键信息的节点,吐字则会更加清晰有力。

 

② 全新的话轮转换系统(倾听端)

何时开口说话、何时继续等待,均由 Scribe v2 Realtime 的实时信号进行判定。
它不仅看转写出来的文本内容,还会深入分析对方说话的方式(语调与语气)

官方文档举的例子非常直观:
比如一句“嗯”,可能代表已经回答完毕,也可能是话还没说完、正准备往下接的过渡信号
单看文字根本无法区分,但一听语气就能立见分晓。系统正是据此来精准拿捏接入对话的时机。

 

因此,开启表现力模式后,声音更加富有情感,以及插话打断明显减少,是同步带来的效果

 


⚙️ 2. 开启方法:只需切换一个模型

 

并没有单独的开关。只要将 TTS 模型选择为 V3 Conversational,表现力模式就会默认自动开启。

 

在控制台中

打开你的 Agent,进入 Agent Voice 标签页,将 Text to Speech 模型切换为 V3 Conversational 并保存即可。

 

在 CLI 中

elevenlabs agents pull --agent "<智能体名称>"

在拉取下来的 agent_configs/<智能体名称>.json 中,将 conversation_config.tts.model_id 修改如下:

{
  "conversation_config": {
    "tts": {
      "model_id": "eleven_v3_conversational"
    }
  }
}
elevenlabs agents push --agent "<智能体名称>"

 

在 API 中

from elevenlabs import ElevenLabs

elevenlabs = ElevenLabs()

elevenlabs.conversational_ai.agents.update(
    agent_id="此处填写智能体ID",
    conversation_config={
        "tts": {"model_id": "eleven_v3_conversational"},
    },
)

 

免费体验 ElevenAgents →

 


📝 3. 语气需要在系统提示词中进行指示

 

如果仅仅更换了模型,情绪的表现幅度虽然变大了,但在什么节点、以何种方式展现情绪,完全交由模型自主决定
如果团队有明确的品牌调性或客服接待规范,就必须在系统提示词中写明要求,才能保持输出一致稳定。

 

方法 ①:仅给出宏观方向

你是一名客户支持专员。如果用户听起来感到沮丧或愤怒,
请用沉稳且让人安心的语气回答。传达好消息时,声音中请透露出真诚的
温暖感。整体上请保持专业且平易近人的语气。

 

方法 ②:按场景明确规范

语气指引:
- 用户表达不满时:采用沉着且富有同理心的语气
- 解释技术操作流程时:吐字清晰,保持匀速
- 用户分享好消息时:给予温暖且明快的回应
- 处理客诉时:保持冷静,以解决问题为导向

 

官方文档明确说明,并不需要为每种情况都打上标签
像上面这样用自然语言写出要求,模型就会根据上下文自行匹配理解。
而在实际业务中,方法 ② 会更稳妥。对于有规范接待流程的行业,用明确文句把“什么场景下用什么语气”固定下来,后续质检审核时也会方便得多。

 


🏷️ 4. 关键节点用标签精准把控

 

在基于上下文自动调节的基础上,你还可以显式指定特定片段的情绪。
具体方式是让 LLM 在回复内容中直接输出对应标签。

  • [laughs] 夹带笑意

  • [whispers] 压低声音轻声细语

  • [sighs] 带有叹气的感觉

  • [slow] 放慢语速

  • [excited] 带有兴奋雀跃的情绪

 

这是最容易产生误解的地方。 单个标签并不会改变整句话的基调。
每个标签仅仅对其紧随其后的 4~5 个词产生影响,随后便会恢复原本的语调。

因此,如果以为“在句首放一个标签就行”,实际效果往往不及预期。
务必将标签添加在想要产生效果的位置正前方

 

官方给出的示例如下:

"That's great to hear! [laughs] I'm glad we could sort that out for you."

 

如果你之前从未接触过标签,建议先阅读深度解析 v3 标签的ElevenLabs 提示词完整指南
我们在那篇文章中系统整理了情绪与音效标签,以及发音和断句技巧。

 


⚠️ 5. 开启前务必确认的局限性

 

官方文档明确指出了三项局限,其中第一点尤为关键。

 

① 专业声音克隆(PVC)特征无法完整保留

如果你投入了资金与时间,定制了企业负责人或专业配音员的 PVC 声音,这一项将直接决定你是否该引入该功能。
Eleven v3 Conversational 目前尚无法很好地保留 PVC 的声音特质。
生成出来的音频听起来可能并不像原本的声音。

官方文档的建议也非常明确:如果保留 PVC 声音的辨识度至关重要,请继续使用 Flash v2。
换句话说,目前面临的是“要丰富的情感,还是要留住特定真人的声音”二选一的局面,二者尚无法兼得。

 

② 标签生效范围仅限 4~5 个词

正如前文所述,它并不适合用来直接通篇改变一整个长句。

 

③ 不同音色与不同语言之间存在差异

支持语言已达 70 种以上,相比 Flash 系列的约 32 种有了大幅提升。
官方文档特别提到,像日语这类以往在语调细微差别上较弱的语言,本次得到了明显改善。

但同一份文档中也指出,不同语言的表现力并不均衡
如果你的 Agent 主要用于中文接待,务必选用实际要用的音色,亲自用中文多跑几遍测试后再做评估。英语 Demo 表现亮眼,并不代表中文效果也能完全一致。

 


💰 6. 费用并不会增加

 

问这个问题的朋友出奇得多,而官方 FAQ 给出的答案很明确:“不会”

Eleven v3 Conversational 与 Agent 中的其他 TTS 模型保持相同的单价,均为每分钟 $0.08 起。开启表现力模式不会产生任何额外的附加费用。

如果想测算在实际通话量下每月大概会产生多少费用,可以在费用计算器中按分钟数进行估算。

 


✍️ 写在最后

 

简单总结一下:

  • 如何开启:将 TTS 模型切换为 V3 Conversational,仅此一步

  • 如何微调:在系统提示词中分场景用文字写明对应的语气要求

  • 局部把控:在需要改变的位置正前方添加标签(影响范围仅限 4~5 个词)

  • 如何取舍:如果你正在使用 PVC 声音,请务必先对比测试再做决定

 

感谢大家的阅读。⚡