[AI Telepon #3] Atasi Suara Datar: Mode Ekspresif ElevenLabs

Jika agen telepon AI Anda berbicara dengan nada datar saat merespons pelanggan marah maupun kabar baik, periksa mode ekspresifnya. Fitur ini aktif otomatis saat beralih ke model TTS V3 Conversational. Simak panduan konfigurasi Dashboard, CLI, dan API, cara mengatur intonasi lewat system prompt, batas pengaruh tag (hanya 4-5 kata), hingga limitasi Professional Voice Cloning (PVC).

"Kata-katanya sudah tepat, tapi sama sekali tidak terdengar seperti manusia."
Ini adalah komentar pertama yang paling sering kami dengar dari mereka yang sudah mencoba agen telepon AI.

Halo, kami dari Sonetho. ⚡

Ada satu kendala yang terus-menerus kami dengar dari mereka yang telah mencoba membuat agen telepon AI setelah membaca Bagian 1 (Panduan Pemula) dan Bagian 2 (Kantor Properti).

Skripnya sudah sempurna, tetapi nada bicaranya sama persis, baik kepada pelanggan yang sedang marah maupun saat kesepakatan berhasil dicapai.
Di situasi saat manusia biasanya mengubah nada suara, AI justru tidak berubah sama sekali. Akibatnya, lawan bicara langsung merasa "Ah, AI lagi" dan seketika menutup diri.

 

Fitur yang dihadirkan ElevenLabs untuk mengatasi masalah inilah yang disebut Expressive mode.

⚠️ Perlu kami sampaikan terlebih dahulu: ini bukan fitur yang baru saja dirilis.
Fitur ini telah diumumkan di blog resmi pada Februari 2026.
Namun, karena di halaman dokumentasi resmi tidak tercantum tanggal rilis, banyak orang yang baru mengetahuinya sekarang, dan kami pun paling sering menerima pertanyaan ini selama menulis seri artikel ini.
Oleh karena itu, kami ingin membagikan cara mengatur Expressive mode.

 


🎭 1. Expressive Mode Menggerakkan Dua Bagian Sekaligus

 

Ini bukan fitur yang menambahkan emosi hanya dengan satu tombol, melainkan mengubah dua bagian dalam conversational stack secara bersamaan.

 

① Eleven v3 Conversational (Sisi Berbicara/Output)

Model v3 dengan latensi yang diperkecil untuk percakapan real-time. Kuncinya adalah kemampuannya membawa konteks percakapan di antara setiap pergantian giliran bicara (turn).
Jika suara pengguna terdengar cemas, responsnya akan lebih tenang. Pada bagian yang harus disampaikan dengan tepat, artikulasinya akan berubah menjadi lebih jelas.

 

② Sistem Turn-taking Baru (Sisi Mendengarkan)

Sistem menentukan kapan harus berbicara dan kapan harus menunggu berdasarkan sinyal real-time dari Scribe v2 Realtime.
AI tidak hanya membaca teks transkripsi saja, tetapi juga melihat bagaimana hal itu diucapkan (intonasi).

Contoh yang diberikan dalam dokumentasi resmi sangat intuitif.
Satu kata seperti "Ya" bisa berarti sudah selesai menjawab, atau bisa juga menjadi sinyal ingin melanjutkan pembicaraan.
Hanya melihat teksnya saja tidak bisa membedakannya, tetapi intonasi suara memperjelas perbedaan tersebut. Dari sinilah sistem menentukan waktu yang tepat untuk masuk berbicara.

 

Oleh karena itu, saat mengaktifkan Expressive mode, penambahan emosi pada suara dan berkurangnya interupsi bicara akan terjadi secara bersamaan.

 


⚙️ 2. Cara Mengaktifkannya: Cukup Ganti Satu Model

 

Tidak ada sakelar khusus. Cukup pilih model TTS ke V3 Conversational, dan Expressive mode akan aktif secara default.

 

Melalui Dashboard

Buka agen Anda, masuk ke tab Agent Voice, ubah model Text to Speech menjadi V3 Conversational, lalu simpan. Selesai.

 

Melalui CLI

elevenlabs agents pull --agent "<nama-agen>"

Pada file agent_configs/<nama-agen>.json yang diunduh, ubah conversation_config.tts.model_id seperti berikut:

{
  "conversation_config": {
    "tts": {
      "model_id": "eleven_v3_conversational"
    }
  }
}
elevenlabs agents push --agent "<nama-agen>"

 

Melalui API

from elevenlabs import ElevenLabs

elevenlabs = ElevenLabs()

elevenlabs.conversational_ai.agents.update(
    agent_id="ID_AGEN_DI_SINI",
    conversation_config={
        "tts": {"model_id": "eleven_v3_conversational"},
    },
)

 

Mulai Gunakan ElevenAgents Gratis →

 


📝 3. Atur Nada Bicara Lewat System Prompt

 

Jika hanya mengganti modelnya saja, rentang emosi memang melebar, tetapi kapan dan bagaimana menggunakannya sepenuhnya terserah pada model AI.
Jika brand Anda memiliki panduan persona atau SOP pelayanan, Anda perlu menuliskannya di system prompt agar nadanya tetap konsisten.

 

Metode ①: Memberikan arah secara umum

Anda adalah agen layanan pelanggan. Jika pengguna terdengar frustrasi atau kesal,
jawablah dengan nada yang tenang dan menenangkan. Saat menyampaikan kabar baik,
sertakan kehangatan yang tulus dalam suara Anda. Secara keseluruhan, pertahankan nada
bicara yang profesional namun tetap ramah dan mudah didekati.

 

Metode ②: Menetapkan aturan per situasi

Panduan nada bicara:
- Jika pengguna menyampaikan keluhan: gunakan nada yang tenang dan penuh empati
- Saat menjelaskan langkah teknis: bicaralah dengan artikulasi jelas dan tempo yang stabil
- Jika pengguna menyampaikan kabar baik: berikan respons yang hangat dan ceria
- Saat menangani komplain: tetap tenang dan fokus pada solusi

 

Dokumentasi resmi menyebutkan bahwa tidak perlu menyematkan tag di setiap situasi.
Jika dituliskan dalam bahasa alami seperti di atas, model akan menginterpretasikannya sesuai konteks percakapan.
Dalam praktik, Metode ② jauh lebih aman. Untuk industri yang memiliki SOP pelayanan, mendokumentasikan "nada apa dalam situasi apa" secara tertulis akan memudahkan proses evaluasi di kemudian hari.

 


🏷️ 4. Gunakan Tag Khusus untuk Momen Tertentu

 

Selain penyesuaian berbasis konteks, Anda juga dapat menentukan momen tertentu secara eksplisit.
Caranya adalah dengan membuat LLM menghasilkan tag langsung di dalam teks jawabannya.

  • [laughs] Menyelipkan tawa

  • [whispers] Mengecilkan suara menjadi bisikan

  • [sighs] Memberikan nuansa menghela napas

  • [slow] Memperlambat kecepatan bicara

  • [excited] Memberikan nada bicara antusias

 

Bagian ini adalah yang paling sering disalahpahami. Satu tag tidak akan mengubah keseluruhan kalimat.
Setiap tag hanya memengaruhi sekitar 4 hingga 5 kata setelahnya, lalu nada bicara akan kembali ke nada semula.

Oleh sebab itu, jika Anda berpikir "cukup taruh satu tag di awal kalimat saja", hasilnya tidak akan sesuai harapan.
Tag harus disematkan persis sebelum bagian yang ingin Anda beri efek.

 

Berikut adalah contoh resmi dari dokumentasinya:

"That's great to hear! [laughs] I'm glad we could sort that out for you."

 

Jika Anda baru pertama kali mengenal penggunaan tag, sebaiknya baca terlebih dahulu Panduan Lengkap Prompt ElevenLabs yang membahas tuntas penggunaan tag v3.
Mulai dari tag emosi dan efek suara hingga pelafalan serta jeda napas sudah dirangkum di sana.

 


⚠️ 5. Keterbatasan yang Wajib Diketahui Sebelum Mengaktifkannya

 

Dokumentasi resmi mencantumkan tiga keterbatasan, dan yang pertama adalah yang paling penting.

 

① Karakteristik Professional Voice Cloning (PVC) tidak dipertahankan dengan baik

Jika Anda telah meluangkan waktu dan biaya untuk membuat suara pimpinan perusahaan atau pengisi suara profesional lewat PVC, poin inilah yang menentukan keputusan penerapannya.
Saat ini Eleven v3 Conversational belum dapat mempertahankan karakteristik suara PVC dengan baik.
Hasil suaranya mungkin tidak terdengar seperti suara aslinya.

Rekomendasi dokumen resminya juga sangat jelas: jika identitas suara PVC penting bagi Anda, gunakan Flash v2.
Artinya, Anda berada dalam situasi harus memilih: "emosi atau suara orang tersebut?" Keduanya belum bisa didapatkan sekaligus saat ini.

 

② Efek tag hanya bertahan 4–5 kata

Seperti yang telah dibahas di atas, tag ini tidak ditujukan untuk mengubah keseluruhan kalimat panjang.

 

③ Terdapat variasi performa tergantung pada suara dan bahasa

Dukungan bahasa mencakup lebih dari 70 bahasa, meningkat signifikan dari seri Flash yang hanya mendukung sekitar 32 bahasa.
Dokumentasi resmi secara khusus menyebutkan bahwa bahasa seperti bahasa Jepang, yang sebelumnya memiliki nuansa intonasi agak lemah, kini telah membaik.

Namun, dokumen tersebut juga menyatakan bahwa daya ekspresi emosi tidak merata di setiap bahasa.
Jika agen Anda ditujukan untuk melayani dalam bahasa Indonesia, sebaiknya Anda mengujinya langsung beberapa kali menggunakan suara dan bahasa Indonesia yang sebenarnya sebelum mengambil keputusan akhir. Demo bahasa Inggris yang bagus tidak menjamin hasil yang sama dalam bahasa Indonesia.

 


💰 6. Biaya Tidak Mengalami Kenaikan

 

Banyak yang menanyakan hal ini, dan jawaban resmi di FAQ adalah "Tidak".

Eleven v3 Conversational memiliki biaya per unit yang sama dengan model TTS lainnya untuk agen, yaitu mulai dari $0.08 per menit. Tidak ada biaya tambahan yang dikenakan hanya karena Anda mengaktifkan Expressive mode.

Untuk memperkirakan biaya bulanan berdasarkan total durasi panggilan, Anda dapat memasukkan simulasi menit panggilan di kalkulator tarif.

 


✍️ Penutup

 

Ringkasannya adalah sebagai berikut:

  • Cara mengaktifkan: Cukup ubah model TTS ke V3 Conversational. Itu saja

  • Cara menyesuaikan: Tuliskan nada per situasi dalam bentuk kalimat di system prompt

  • Cara menandai: Sematkan tag persis sebelum bagian yang ingin diubah (hanya berpengaruh pada 4–5 kata)

  • Cara mempertimbangkan: Jika Anda menggunakan PVC, bandingkan terlebih dahulu sebelum memutuskan

 

Terima kasih telah membaca. ⚡