Halo, saya Sonetho. ⚡
"Untuk narasi YouTube, CLOVA Dubbing saja cukup, kan?"
Ini pertanyaan yang sering saya terima.
Jadi saya membandingkannya langsung.
Empat naskah Korea yang sama saya buat menjadi 9 suara, 5 dari CLOVA Voice dan 4 dari ElevenLabs, lalu mendengarkan seluruh 36 sampel.
🧪 Bagaimana saya membandingkannya
Naskahnya terbagi empat kategori.
Akting emosi (dialog yang gembira mendengar kabar lulus lalu tenggelam dalam penyesalan), pembacaan gaya berita, campuran bahasa Inggris dan angka (seperti ChatGPT, 22 dolar), dan konsistensi pada teks panjang.
Di sisi CLOVA, saya membuat 1 suara standar dan 4 suara Pro lewat CLOVA Voice API.
Dokumen resmi NAVER Cloud menyatakan bahwa CLOVA Dubbing memakai mesin CLOVA Voice ini juga, jadi perbandingan kualitasnya sahih.
Di sisi ElevenLabs, saya membuat 2 suara populer di komunitas Korea dengan dua model, v2 dan v3.
Di setiap kategori di bawah saya sertakan sampel aslinya. Silakan dengar sendiri dan nilai.
Semuanya rekaman asli yang dibuat untuk pengujian ini, dikutip untuk tujuan perbandingan.
🎧 Hasil setelah saya dengar sendiri
Kategori | TERBAIK | Komentar singkat |
|---|---|---|
Akting emosi | ElevenLabs | Jujur saja, CLOVA terdengar seperti TTS robot generasi pertama. |
Pelafalan Inggris dan angka | Eleven v3 | Hampir semua dibaca benar. Kejutannya: CLOVA lebih baik daripada Eleven v2 |
Momen "ini manusia, kan?" | ElevenLabs | PVC yang terlatih baik sulit dibedakan dari manusia asli |
Konsistensi suara | CLOVA dan Eleven v2 | v3 membaca dengan baik tapi nada suaranya berubah-ubah |
Berikut penjelasan hasilnya secara lebih rinci.
🎧 Dengar sendiri kategori emosi
Naskah: "Ha... lulus? Ini bukan mimpi, kan?"
CLOVA Voice (Ara Pro)
ElevenLabs (Hyuk, v3)
Untuk ekspresi emosi, perbandingannya bahkan tidak imbang.
CLOVA Voice, baik Pro maupun standar, membacakan dialog emosional seperti membaca berita.
Sejak awal CLOVA Dubbing memang tidak punya fitur untuk mengarahkan emosi sama sekali. Yang ada hanya kecepatan, pitch, dan efek khusus.
ElevenLabs benar-benar memerankan peralihan nada dari helaan napas ke kegembiraan, dan PVC (kloning suara saya sendiri) yang terlatih baik sudah sampai taraf sulit dibedakan antara manusia dan AI.
Pada campuran bahasa Inggris dan angka, ada kejutan yang menarik.
Yang membaca paling baik adalah Eleven v3. Ungkapan seperti ChatGPT, Gemini, dan 22 dolar hampir semuanya dilafalkan dengan tepat.
Tapi peringkat kedua bukan ElevenLabs Multilingual v2, melainkan CLOVA.
Begitu bertemu pola yang tidak ada di data latihnya, pelafalan v2 berantakan, sedangkan CLOVA membacanya lebih stabil.
Di dalam CLOVA sendiri pun ada perbedaan. Suara Pro jelas lebih baik membaca kata-kata Inggris daripada suara standar.
🎧 Dengar sendiri kategori Inggris dan angka
Naskahnya mengandung campuran ChatGPT, Gemini, dan 22 dolar
① ElevenLabs v2 (Hyuk): yang gagal membaca
② CLOVA Voice (Ara Pro): mengejutkan, cukup stabil
③ ElevenLabs v3 (Hyuk): hampir tepat
Perbedaan karakter antara v2 dan v3 juga jelas.
Karena berbasis data terlatih, v2 stabil pada kalimat yang familier tapi lemah pada pola yang baru pertama ditemuinya.
Sebaliknya, v3 membaca pola baru dengan baik, namun punya kelemahan konsistensi: nada suaranya goyah saat berganti paragraf.
Karakteristik ini saya bahas lebih rinci di tes Eleven v3 vs v2 di 4 kategori bahasa Korea.
🎙️ Mendengarkan kesembilan suara
Di atas, saya hanya menyertakan suara-suara utama.
Saya mengunggah kesembilan suara yang dibuat dengan skrip dialog emosional yang sama.
Dua suara yang didengar sebelumnya juga saya sertakan untuk perbandingan.
CLOVA Nara (Standar)
CLOVA Ara Pro
CLOVA Donghyun Pro
CLOVA Ian Pro
CLOVA Yuna Pro
ElevenLabs Hyuk (Multilingual v2)
ElevenLabs Hyuk (v3)
ElevenLabs Selly (Multilingual v2)
ElevenLabs Selly (v3)
Di dalam CLOVA sendiri, versi Standar dan Pro memiliki perbedaan.
Namun, di antara keempat versi Pro, hanya warna suaranya yang berbeda sedangkan cara pemrosesan emosinya sama.
Untuk ElevenLabs, meskipun suaranya sama, versi v2 dan v3 terdengar seperti aktor yang berbeda.
⏱️ Selain kualitas, saya juga mengukur kecepatannya
Jika Anda harus mengekstrak puluhan klip dari satu video, waktu pembuatan adalah waktu kerja Anda.
Oleh karena itu, saat membuat 36 sampel, saya mencatat waktu mulai dari panggilan API hingga audio selesai diterima.
| Suara | Waktu Pembuatan Rata-rata | Karakter per Detik |
|---|---|---|
| CLOVA Nara (Standar) | 918ms | 193 karakter |
| CLOVA Donghyun Pro | 1.391ms | 127 karakter |
| CLOVA Ian Pro | 1.568ms | 113 karakter |
| CLOVA Yuna Pro | 1.592ms | 111 karakter |
| CLOVA Ara Pro | 1.596ms | 111 karakter |
| ElevenLabs Selly (v2) | 4.104ms | 43 karakter |
| ElevenLabs Hyuk (v2) | 4.256ms | 42 karakter |
| ElevenLabs Selly (v3) | 6.855ms | 26 karakter |
| ElevenLabs Hyuk (v3) | 6.899ms | 26 karakter |
Angka yang paling dapat diandalkan adalah perbedaan antara v3 dan v2.
v3 rata-rata 65% lebih lambat dibandingkan v2 (6.877ms berbanding 4.180ms).
Karena saya memanggil kedua model secara bergantian untuk setiap suara, zona waktu atau kondisi server tidak mungkin menguntungkan satu pihak saja.
Tadi saya menyebutkan bahwa v3 memiliki pelafalan bahasa Inggris yang lebih baik, namun harganya adalah waktu.
Ini berarti jika Anda mengekstrak 100 klip, v2 membutuhkan 7 menit, sementara v3 membutuhkan 11 menit.
Kesenjangan antar mesin adalah 3,9 kali lipat.
Rata-rata CLOVA adalah 1.413ms, sedangkan rata-rata ElevenLabs adalah 5.529ms.
Jika dilihat dari karakter per detik, rasionya adalah 125 karakter berbanding 32 karakter.
Suara standar CLOVA adalah yang tercepat dengan 918ms, dan bahkan di dalam CLOVA sendiri, versi Pro lebih lambat daripada versi standar.
Saya juga mengakui keterbatasannya.
Pengukuran hanya dilakukan satu kali untuk setiap kombinasi dan sudah termasuk waktu tempuh jaringan.
Selain itu, perulangan pengukuran dilakukan per kategori. Karena panggilan dalam kategori yang sama dilakukan secara berurutan, tidak dapat dipastikan apakah kategori yang lambat disebabkan oleh karakteristik teks atau kondisi server pada saat itu.
Oleh karena itu, peringkat per kategori tidak saya gunakan sebagai kesimpulan.
Hanya kesenjangan antar mesin dan perbedaan antara v3 dan v2 yang dicantumkan di atas karena perbedaannya cukup besar untuk tidak dijelaskan sebagai bias.
Sebagai tambahan, angka-angka ini adalah hasil dari metode pengambilan Multilingual v2 dan v3 sekaligus.
ElevenLabs menyediakan model seri Flash yang ditujukan untuk latensi rendah dan metode streaming secara terpisah.
Jika Anda memilih untuk percakapan waktu nyata atau telepon, Anda harus melihat opsi tersebut, bukan tabel ini.
💰 Harga dan lisensi: di sinilah titik pisah sebenarnya
Kalau bukan soal kualitas melainkan syaratnya, perbedaannya justru lebih besar. Data per Juli 2026.
Item | CLOVA Dubbing | ElevenLabs |
|---|---|---|
Gratis | 15,000 karakter/bulan, 20 kali unduh | 10,000 kredit/bulan |
Syarat gratis | Watermark wajib + wajib cantumkan sumber + tidak boleh diunggah ke kanal berpenghasilan | Boleh dipakai komersial asalkan mencantumkan sumber |
Harga awal hak komersial | 19,900 won (tapi hanya untuk pribadi dan nirlaba) | $6 (sekitar 8,000 won, hak komersial penuh) |
Jual berbayar, iklan, siaran | Mulai Premium 89,900 won | Mulai $6 Starter |
Voice cloning | Tidak ada | Instant mulai $6, PVC mulai $22 |
Satu hal yang perlu diperhatikan.
Memakai CLOVA Dubbing gratis di YouTube yang menghasilkan uang berarti melanggar ketentuan layanan.
Sejak Desember 2023, paket gratis hanya diizinkan untuk "kanal yang sama sekali tidak menghasilkan pendapatan".
Artikel-artikel blog yang bilang "cukup cantumkan sumber, kanal AdSense pun gratis" mengacu pada kebijakan lama yang sudah dihapus.
Dan meski Anda membayar Standard (19,900 won), penjualan berbayar, pekerjaan pesanan, penyiaran, dan iklan tetap tidak diperbolehkan.
Itu wilayah Premium (89,900 won).
🤔 Jadi, mana yang sebaiknya dipakai
Kapan CLOVA Dubbing cocok
Saat membuat video untuk kanal yang tidak dimonetisasi atau koleksi pribadi.
Saat Anda butuh editor yang menyelesaikan semuanya dalam satu layar, dari unggah video, subtitle, efek suara, sampai dubbing.
Saat UI berbahasa Korea dan aplikasi mobile terasa lebih nyaman.
Kapan ElevenLabs cocok
Saat dipakai untuk konten yang menghasilkan uang. Mulai 8,000 won sudah hak komersial penuh, jadi tak perlu repot menghitung syarat.
Narasi yang butuh akting emosi, audiobook, dan pengisian dialog.
Saat Anda ingin membuat konten dengan mengkloning suara Anda sendiri (PVC).
Kalau Anda mendaftar baru di ElevenLabs lewat tautan di bawah, diskon 50% untuk bulan pertama paket Creator otomatis diterapkan.
Dapatkan diskon 50% bulan pertama ElevenLabs →
❓ Pertanyaan yang sering diajukan (FAQ)
Q. Bolehkah memakai CLOVA Dubbing gratis di YouTube yang menghasilkan uang?
Tidak boleh.
Sejak Desember 2023, paket gratis diubah menjadi hanya diizinkan untuk diunggah ke kanal yang tidak menghasilkan pendapatan.
Kalau kanal Anda mengaktifkan AdSense, Anda butuh paket berbayar, dan untuk penjualan berbayar atau video iklan baru bisa mulai dari Premium (89,900 won per bulan).
Q. Antara CLOVA Dubbing dan ElevenLabs, mana yang lebih natural?
Berdasarkan pendengaran langsung, untuk ekspresi emosi dan kenaturalan secara keseluruhan, ElevenLabs unggul, terutama v3 dan PVC yang terlatih baik.
Namun pada kalimat campur bahasa Inggris, ada juga kejutan bahwa CLOVA membacanya lebih stabil daripada ElevenLabs v2.
Q. Berapa harga CLOVA Dubbing?
Gratis (15,000 karakter per bulan), Standard 19,900 won per bulan, dan Premium 89,900 won per bulan.
Standard terbatas untuk penggunaan pribadi dan nirlaba, jadi kalau ingin dipakai untuk penjualan berbayar atau iklan, Anda perlu Premium.
Kalau penasaran dengan pertarungan tiga TTS bahasa Korea, simak juga perbandingan Typecast vs Vrew vs ElevenLabs.
Duel pengenalan suara (STT) berlanjut di uji nyata pengenalan suara CLOVA vs Scribe.
Sampai jumpa di artikel berikutnya. Ini Sonetho. ⚡