Sửa giọng AI vô cảm: Bật Expressive Mode ElevenLabs (P3)

Nếu tổng đài AI vẫn nói một tông giọng khi gặp khách giận dữ hay báo tin vui, hãy kiểm tra Expressive Mode trên ElevenLabs. Chế độ này tự bật khi dùng mô hình TTS V3 Conversational. Hướng dẫn cài đặt qua Dashboard, CLI, API, cách chỉnh tông giọng bằng prompt, lưu ý thẻ tag 4-5 từ và giới hạn của Professional Voice Cloning (PVC).

"Nội dung thì hoàn toàn đúng, nhưng nghe chẳng giống người thật chút nào."
Đây là câu nói đầu tiên mà hầu hết những ai từng triển khai tổng đài viên AI đều phải thốt lên.

Xin chào các bạn, mình là Sonetho đây. ⚡

Sau khi xem Phần 1 (Nhập môn)Phần 2 (Văn phòng bất động sản) rồi bắt tay vào xây dựng tổng đài viên AI, rất nhiều bạn đã phản hồi lại cho chúng mình cùng một câu chuyện.

Đó là kịch bản thì hoàn hảo, nhưng dù khách hàng đang bực bội hay trong khoảnh khắc chốt hợp đồng thành công, giọng của AI vẫn giữ nguyên một tông đều đều.
Nếu là con người, tông giọng chắc chắn sẽ thay đổi ở những thời điểm đó; đằng này giọng AI lại không hề biến chuyển, khiến người nghe nhận ra ngay "Lại là AI rồi" và lập tức khép lòng lại.

 

Tính năng mà ElevenLabs phát triển nhằm giải quyết đúng điểm nghẽn này chính là Chế độ biểu cảm (Expressive mode).

⚠️ Trước tiên, mình cần làm rõ một điều: Đây không phải là tính năng mới ra mắt hôm nay.
Tính năng này đã được công bố từ tháng 2 năm 2026 trên blog chính thức của hãng.
Tuy nhiên, trang tài liệu chính thức lại không ghi rõ ngày tháng nên nhiều bạn đến giờ mới biết, và trong suốt chuỗi bài viết vừa qua, đây cũng là câu hỏi chúng mình nhận được nhiều nhất.
Vì vậy, bài viết này sẽ hướng dẫn chi tiết cách thiết lập Expressive mode nhé.

 


🎭 1. Chế độ biểu cảm vận hành dựa trên hai yếu tố kết hợp

 

Đây không đơn thuần là nút bấm thêm cảm xúc vào giọng đọc, mà là sự thay đổi đồng thời ở hai thành phần cốt lõi trong stack hội thoại.

 

① Eleven v3 Conversational (Phía phát âm / TTS)

Đây là mô hình v3 được tối ưu độ trễ thấp chuyên dành cho hội thoại theo thời gian thực. Điểm mấu chốt là nó giữ được ngữ cảnh hội thoại xuyên suốt giữa các lượt nói.
Nếu người dùng nói với giọng lo lắng, AI sẽ tự động chuyển sang tông điềm tĩnh hơn; ở những đoạn cần truyền đạt thông tin chuẩn xác, giọng nói sẽ rõ ràng, rành mạch hơn.

 

② Hệ thống luân phiên lượt nói mới (Turn-taking system - Phía lắng nghe)

Hệ thống xác định thời điểm nên nói và khi nào cần chờ đợi dựa trên tín hiệu thời gian thực từ Scribe v2 Realtime.
Nó không chỉ nhận diện văn bản chuyển đổi mà còn phân tích cả cách người dùng nói (ngữ điệu).

Ví dụ mà tài liệu chính thức đưa ra rất trực quan:
Một tiếng "Dạ" hay "Vâng" có thể là câu trả lời đã kết thúc, nhưng cũng có thể chỉ là tín hiệu đệm để nói tiếp.
Chỉ nhìn vào mặt chữ thì không thể phân biệt được, nhưng nghe ngữ điệu thì sẽ nhận ra ngay. Hệ thống dựa vào điều này để canh đúng thời điểm phản hồi.

 

Chính vì vậy, khi bật Expressive mode, giọng nói vừa có thêm cảm xúc tự nhiên, vừa giảm thiểu tình trạng chen ngang hay ngắt quãng khó chịu.

 


⚙️ 2. Cách bật: Chỉ cần đổi duy nhất một mô hình

 

Không có công tắc riêng biệt nào cả. Chỉ cần chọn mô hình TTS là V3 Conversational, chế độ biểu cảm sẽ tự động được kích hoạt mặc định.

 

Trên Dashboard

Mở Agent của bạn, chuyển sang tab Agent Voice, đổi mô hình Text to Speech thành V3 Conversational rồi nhấn lưu là xong.

 

Qua CLI

elevenlabs agents pull --agent "<ten-agent>"

Trong file agent_configs/<ten-agent>.json tải về, hãy sửa conversation_config.tts.model_id như sau:

{
  "conversation_config": {
    "tts": {
      "model_id": "eleven_v3_conversational"
    }
  }
}
elevenlabs agents push --agent "<ten-agent>"

 

Qua API

from elevenlabs import ElevenLabs

elevenlabs = ElevenLabs()

elevenlabs.conversational_ai.agents.update(
    agent_id="dien_agent_id_vao_day",
    conversation_config={
        "tts": {"model_id": "eleven_v3_conversational"},
    },
)

 

Bắt đầu miễn phí với ElevenAgents →

 


📝 3. Điều hướng tông giọng qua System Prompt

 

Nếu chỉ đổi mô hình rồi để đó, dải cảm xúc của AI sẽ phong phú hơn nhưng khi nào và thể hiện cảm xúc ra sao lại hoàn toàn do mô hình tự quyết định.
Với các doanh nghiệp có quy chuẩn giao tiếp hay tông giọng thương hiệu riêng, bạn bắt buộc phải quy định rõ trong System Prompt để giọng điệu luôn nhất quán.

 

Cách ①: Đưa ra định hướng chung

Bạn là nhân viên hỗ trợ khách hàng. Nếu nghe thấy người dùng có vẻ bực bội hoặc
khó chịu, hãy trả lời bằng tông giọng điềm tĩnh và mang tính trấn an. Khi thông báo
tin vui, hãy để giọng nói toát lên sự ấm áp chân thành. Nhìn chung, hãy duy trì phong thái
chuyên nghiệp nhưng vẫn gần gũi, dễ tiếp cận.

 

Cách ②: Quy định cụ thể theo từng tình huống

Hướng dẫn tông giọng:
- Khi người dùng bày tỏ sự không hài lòng: Dùng tông giọng bình tĩnh, thấu cảm
- Khi giải thích các bước kỹ thuật: Nói rõ ràng, tốc độ đều và chuẩn xác
- Khi người dùng chia sẻ tin vui: Phản hồi ấm áp, vui vẻ
- Khi xử lý khiếu nại: Điềm đạm, tập trung vào giải pháp

 

Tài liệu chính thức có nêu rõ rằng bạn không nhất thiết phải gắn thẻ cảm xúc cho mọi tình huống.
Chỉ cần diễn đạt bằng ngôn ngữ tự nhiên như trên, mô hình sẽ tự hiểu và áp dụng theo ngữ cảnh.
Tuy nhiên trong thực tế triển khai, cách ② luôn an toàn hơn. Nếu bạn làm việc trong lĩnh vực có quy trình chăm sóc khách hàng chặt chẽ, việc ghi rõ "tình huống nào đi với tông giọng nào" dưới dạng văn bản sẽ giúp khâu kiểm duyệt và đánh giá chất lượng sau này dễ dàng hơn nhiều.

 


🏷️ 4. Dùng thẻ (tag) để định hình từng khoảnh khắc cụ thể

 

Bên cạnh việc điều chỉnh dựa trên ngữ cảnh, bạn hoàn toàn có thể chỉ định biểu cảm rõ ràng cho một phân đoạn cụ thể.
Cách làm là để LLM trực tiếp xuất các thẻ (tags) này vào câu trả lời.

  • [laughs] Xen tiếng cười nhẹ

  • [whispers] Hạ giọng thì thầm

  • [sighs] Tạo cảm giác thở dài

  • [slow] Nói chậm lại

  • [excited] Tạo cảm giác hào hứng, phấn khởi

 

Đây là điểm bị hiểu lầm nhiều nhất. Một thẻ không làm thay đổi cảm xúc của toàn bộ câu nói.
Mỗi thẻ chỉ tác động tới khoảng 4~5 từ đi liền ngay sau nó, rồi giọng sẽ quay trở lại tông bình thường.

Do đó, nếu bạn nghĩ chỉ cần "đặt một thẻ ở đầu câu là xong" thì hiệu ứng mang lại sẽ không như kỳ vọng.
Bạn phải đặt thẻ ngay sát trước cụm từ mà bạn muốn tạo hiệu ứng.

 

Ví dụ mẫu từ tài liệu chính thức:

"That's great to hear! [laughs] I'm glad we could sort that out for you."

 

Nếu đây là lần đầu bạn tiếp cận với thẻ âm thanh, bạn nên xem qua bài viết chuyên sâu về hệ thống tag của v3: Hướng dẫn toàn diện về Prompt trên ElevenLabs.
Bài viết đó đã tổng hợp chi tiết từ các thẻ cảm xúc, hiệu ứng âm thanh cho đến cách ngắt câu và xử lý phát âm chuẩn xác.

 


⚠️ 5. Những giới hạn nhất định phải kiểm tra trước khi bật

 

Tài liệu chính thức chỉ ra ba điểm hạn chế cần lưu ý, trong đó điểm đầu tiên đặc biệt quan trọng.

 

① Không giữ được trọn vẹn đặc trưng của Sao chép giọng nói chuyên nghiệp (PVC)

Nếu bạn đã đầu tư nhiều công sức và ngân sách để tạo giọng PVC của người sáng lập hay diễn viên lồng tiếng chuyên nghiệp, thì đây chính là yếu tố mang tính quyết định.
Hiện tại, Eleven v3 Conversational vẫn chưa bảo toàn tốt các đặc tính riêng biệt của giọng PVC.
Kết quả đầu ra có thể nghe không giống với chất giọng nguyên bản ban đầu.

Khuyến nghị từ tài liệu chính thức cũng rất rõ ràng: Nếu bản sắc và độ nhận diện của giọng PVC là ưu tiên hàng đầu, hãy tiếp tục dùng Flash v2.
Nói cách khác, chúng ta đang ở tình thế phải chọn giữa "cảm xúc biểu cảm" hoặc "độ giống giọng thật". Hiện tại chưa thể có được cả hai cùng lúc.

 

② Hiệu ứng của thẻ chỉ kéo dài 4~5 từ

Như đã đề cập ở trên, tính năng gắn thẻ này không dùng để thay đổi toàn bộ một câu dài.

 

③ Độ chênh lệch giữa các giọng đọc và ngôn ngữ

Số ngôn ngữ được hỗ trợ hiện đã lên tới hơn 70 ngôn ngữ, tăng vượt bậc so với con số khoảng 32 ngôn ngữ của dòng Flash.
Tài liệu chính thức cũng nhấn mạnh rằng những ngôn ngữ trước đây có sắc thái biểu cảm còn hạn chế như tiếng Nhật nay đã được cải thiện đáng kể.

Tuy nhiên, tài liệu cũng chỉ rõ rằng khả năng biểu cảm vẫn chưa thực sự đồng đều giữa các ngôn ngữ.
Nếu bạn xây dựng agent phản hồi bằng tiếng Việt, hãy chạy thử nghiệm trực tiếp vài lần bằng chính giọng nói sẽ sử dụng và bằng tiếng Việt trước khi đưa ra quyết định. Bản demo tiếng Anh nghe rất mượt không có nghĩa là tiếng Việt cũng sẽ tự nhiên y như vậy.

 


💰 6. Chi phí hoàn toàn không tăng thêm

 

Khá bất ngờ là câu hỏi này lại xuất hiện rất nhiều, và câu trả lời trong FAQ chính thức là: "Không".

Eleven v3 Conversational có mức đơn giá tương đương với các mô hình TTS khác trên Agent, bắt đầu từ $0.08/phút. Bật chế độ biểu cảm không làm phát sinh thêm bất kỳ chi phí nào.

Để ước tính chi phí hàng tháng dựa trên lưu lượng cuộc gọi, bạn có thể nhập số phút thực tế vào Bảng tính chi phí để xem chi tiết.

 


✍️ Lời kết

 

Tóm tắt lại những điểm cốt lõi:

  • Cách bật: Đổi mô hình TTS sang V3 Conversational. Chỉ đơn giản vậy thôi

  • Cách tinh chỉnh: Mô tả tông giọng cho từng tình huống cụ thể bằng văn bản trong System Prompt

  • Cách nhấn điểm: Đặt thẻ ngay trước vị trí muốn tạo hiệu ứng (thẻ chỉ có tác dụng trong 4~5 từ)

  • Cách cân nhắc: Nếu bạn đang sử dụng giọng PVC, hãy thử nghiệm so sánh kỹ trước khi quyết định áp dụng

 

Cảm ơn các bạn đã theo dõi bài viết! ⚡