Uji Nyata Akurasi STT Bahasa Korea: CLOVA vs ElevenLabs Scribe, Hasil Menjalankan Audio yang Sama 24 Kali

Kami memasukkan 8 audio bahasa Korea yang sama ke Naver CLOVA Speech Recognition (CSR) serta ElevenLabs Scribe v1 dan v2, lalu mengukur Character Error Rate (CER). Untuk bahasa Korea murni hasilnya praktis seri; begitu tercampur bahasa Inggris, selisihnya mencapai 4 kali lipat. Data mentah kami publikasikan.

Halo, Sonetho di sini. ⚡

 

"Untuk speech-to-text bahasa Korea, bukankah Naver tetap yang terbaik?"
Kalimat ini sering sekali terdengar, tapi hampir tidak ada yang benar-benar mengukurnya.
Jadi kami ukur sendiri.
Kami memasukkan 8 audio bahasa Korea yang sama ke tiga mesin, lalu membandingkannya dengan naskah asli karakter demi karakter.

 

📊 Ringkasan Hasil (Character Error Rate CER, makin rendah makin akurat)

KategoriCLOVA CSRScribe v1Scribe v2
Dialog emosional3.2%1.1%1.1%
Pembacaan gaya berita0~0.8%0~0.8%0~0.8%
Campuran Inggris dan angka36.9~37.7%8.5~13.8%8.5~20.8%
Konsistensi teks panjang1.7~7.3%0%0%
Rata-rata11.4%3.2%4.0%

 

Mari kita bela CLOVA dulu.
Untuk bahasa Korea murni, CSR praktis mendapat nilai sempurna.
Pada pembacaan gaya berita, ketiga mesin sama-sama seri di kisaran 0%.
Kalau hanya melihat bagian ini, pakai yang mana pun tidak masalah.

 

🔬 Hasil pengukuran keseluruhan per bagian (8 kali)

Tabel ringkasan dikelompokkan berdasarkan kategori, jadi di sini saya jabarkan ke-8 hasil pengukurannya.
Naskah yang sama disintesis menggunakan dua jenis suara dan dimasukkan ke masing-masing kategori.

 

KategoriSumber SuaraCLOVA CSRScribe v1Scribe v2
Dialog EmosionalCLOVA Ara3.2%1.1%1.1%
Dialog EmosionalElevenLabs Hyuk3.2%1.1%1.1%
Pembacaan BeritaCLOVA Ara0%0%0%
Pembacaan BeritaElevenLabs Hyuk0.8%0.8%0.8%
Campuran Inggris-AngkaCLOVA Ara36.9%13.8%20.8%
Campuran Inggris-AngkaElevenLabs Hyuk37.7%8.5%8.5%
Konsistensi Teks PanjangCLOVA Ara7.3%0%0%
Konsistensi Teks PanjangElevenLabs Hyuk1.7%0%0%

 

💥 Penentu Kemenangannya: Campuran Bahasa Inggris

Begitu nama brand dan angka masuk ke kalimat bahasa Korea, jaraknya langsung melebar.
Berikut beberapa output asli CSR, kami salin apa adanya.

 

Teks asliOutput CLOVA CSR
ChatGPT"채취 pt"
Gemini"나재민이", "개 미니"
일레븐랩스 (ElevenLabs)"11 x"
약 15달러 수준 (artinya "sekitar 15 dolar")"약 시부터 여수 중"

 

Kalau audio Anda mengandung kata-kata Inggris seperti subtitle YouTube, konten IT, atau notulen rapat zaman sekarang, selisih ini langsung berubah menjadi beban kerja Anda.
Di bagian yang sama, Scribe mempertahankan ChatGPT, Gemini, dan API sepenuhnya dalam bentuk aslinya.

 

🎧 Audio yang Dimasukkan dan Transkrip Lengkap

Melihat angkanya saja tidak memberikan gambaran yang jelas.
Saya mengunggah audio yang benar-benar dimasukkan untuk bagian yang mencampur bahasa Inggris.
Silakan dengarkan sambil membandingkan dengan transkrip di bawah ini.

 

Audio yang dibacakan oleh CLOVA Ara

 

Naskah referensi
일레븐랩스의 Creator 플랜은 월 22달러지만, 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고, 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 sonetho.com에서 확인하세요.

 

CLOVA CSR (tingkat kesalahan 36.9%)
11 x의 크리에이터 플랜은 월 22 달라지는 첫달은 50% 할인된 11달러에 시작할 수 있습니다 채취 pt 나재민이 같은 ai 툴과 연동 하면 활용 폭이 넓어지고 2026년 7월 기준 api 요금은 100만장 약 시부터 여수 중입니다 자세한 내용은 선 투 닷컴에서 확인하세요

 

Scribe v1 (tingkat kesalahan 13.8%)
일레븐웹스의 크리에이터 플랜은 월 $22지만 첫 달은 50% 할인된 $11에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 $15 수준입니다. 자세한 내용은 son토.com에서 확인하세요.

 

Scribe v2 (tingkat kesalahan 20.8%)
일레븐랩스의 크리에이터 플랜은 월 22달러지만 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. 챗GPT나 제미니 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 소토닷컴에서 확인하세요.

 

Ada satu hal yang perlu diperhatikan di sini.
Meskipun skor v2 lebih buruk daripada v1, sebenarnya kinerjanya lebih akurat.
v1 salah menuliskan nama merek sebagai "일레븐웹스", sedangkan v2 berhasil menebaknya dengan benar sebagai "일레븐랩스".
Untuk nominal uang, v1 mengubahnya menjadi simbol $22, sementara v2 menuliskannya apa adanya sesuai teks asli sebagai "22달러".
Namun, v2 mengubah transliterasi ChatGPT menjadi "챗GPT" dan Gemini menjadi "제미니" dalam alfabet Korea.
Dalam penilaian berbasis karakter (CER), semua itu dianggap sebagai kesalahan sehingga mencapai 20.8%.
Jika Anda menyimpulkan v1 lebih baik hanya berdasarkan skor, itu adalah sebuah kekeliruan.

 

🎙️ Tingkat kesalahan berbeda 4 kali lipat tergantung pada suara, meski kalimatnya sama

Ada satu hasil yang tidak terduga.
Untuk bagian teks panjang, naskah yang digunakan benar-benar sama.
Namun, untuk audio yang dibacakan oleh suara CLOVA, tingkat kesalahan CSR mencapai 7,3%, sementara untuk sisi yang dibacakan oleh suara ElevenLabs hanya 1,7%.
Perbedaan 4 kali lipat ini disebabkan oleh suara yang membacakan, bukan karena mesin pengenal suaranya.
Scribe mencatatkan 0% pada kedua audio tersebut.

 

Teks panjang yang dibacakan CLOVA Ara

 

Teks panjang yang dibacakan ElevenLabs Hyuk

 

Bagian yang meleset adalah akhir kalimat.
Naskah yang benar adalah "어제보다 오늘 더 자연스러워지고 있다는 것만은 분명합니다".
Pada sisi suara CLOVA, CSR menulisnya sebagai "있다는것만 있는 영화".
Di titik yang sama, CSR untuk suara ElevenLabs menangkapnya dengan tepat sebagai "있다는것만은 분명합니다".
Selain itu, "있습니다" dari "근본적으로 바꾸고 있습니다" di tengah kalimat juga terlewat sepenuhnya hanya pada sisi suara CLOVA.

 

Inilah artinya dalam praktik di lapangan.
Jika Anda mengukur akurasi STT hanya dengan mengganti mesin pengenal, hasilnya tidak akan lengkap.
Pelafalan dan ritme napas pada audio input sangat memengaruhi hasil akhirnya.
Saat memilih alat untuk internal perusahaan, Anda harus melakukan pengujian menggunakan suara penutur yang akan digunakan secara nyata.

🧐 Scribe Juga Tidak Sempurna

Supaya adil, kesalahan Scribe pun kami buka.
Ia lemah terhadap nama diri yang baru pertama kali didengar.
"sonetho.com" ditulis sebagai "sonto.com", dan di satu sampel "11달러" (11 dolar) keliru terdengar sebagai "1달러" (1 dolar).
Kalau angka di dokumen Anda berhubungan langsung dengan uang, proofreading wajib, mesin apa pun yang dipakai.

 

Perbedaan v1 dan v2 juga menarik.
v2 otomatis menormalkan "22달러" (22 dolar) menjadi "$22".
Dalam metode penilaian kami (CER) itu terhitung sebagai kesalahan, padahal secara makna outputnya benar.
Kalau bentuk penulisan asli penting, pilih v1; kalau tujuannya subtitle atau dokumen yang enak dibaca, v2 jawabannya.
v2 juga punya versi streaming real-time.

 

💰 Bagaimana dengan Harganya

ElevenLabs Scribe: $0.22 per jam (basis batch).
Paket gratis pun sudah termasuk 4,5 jam per bulan.
Starter $6 mencakup 27 jam dan Creator $22 mencakup 100 jam, jadi kebanyakan pekerjaan pribadi selesai di dalam paket.

 

CLOVA Speech Recognition (CSR): model bayar sesuai pemakaian yang dibulatkan ke atas per 15 detik.
Tarif pastinya bisa dicek di kalkulator harga Naver Cloud.
Sebagai catatan, CSR adalah API untuk ucapan pendek dengan batas 60 detik.
Untuk rekaman panjang dan pemisahan pembicara, Anda perlu produk terpisah bernama CLOVA Speech.

 

🤔 Jadi, Mana yang Harus Dipakai

CLOVA CSR cocok kalau
Anda memproses ucapan pendek yang hampir seluruhnya bahasa Korea murni.
Proyek Anda mensyaratkan infrastruktur cloud domestik Korea.
Tim Anda sudah memakai ekosistem Naver Cloud.

 

ElevenLabs Scribe cocok kalau
Anda membuat subtitle atau notulen dari konten campuran Inggris-Korea.
Audio Anda penuh nama brand, khas konten IT dan marketing.
Dengan 4,5 jam gratis, Anda bisa menguji kualitasnya sendiri dulu sebelum memutuskan.

 

Coba ElevenLabs Scribe Gratis →

 

🧪 Metode Pengukuran (Bisa Direproduksi)

Kami menyusun naskah dalam 4 kategori (dialog emosional, gaya berita, campuran Inggris dan angka, teks panjang), lalu mensintesisnya dengan dua TTS berkualitas tinggi (CLOVA Ara Pro dan ElevenLabs Hyuk) menjadi 8 audio.
Setiap audio dimasukkan ke tiga mesin dan dibandingkan dengan naskah asli karakter demi karakter (CER).
Keterbatasannya juga kami akui.
Karena inputnya suara sintesis TTS, kondisinya ideal tanpa noise; dengan suara manusia asli atau lingkungan bising, angkanya bisa berbeda.
Sebagian kesalahan mungkin juga berasal dari pelafalan TTS itu sendiri.

 

❓ Pertanyaan yang Sering Diajukan (FAQ)

Q. STT mana yang paling akurat untuk bahasa Korea?
Dalam pengukuran ini, Scribe v1 mencatat rata-rata Character Error Rate terendah, yaitu 3.2%.
Namun untuk bahasa Korea formal murni, CLOVA CSR juga seri di kisaran 0%; jadi kriteria pemilihannya adalah ada tidaknya campuran bahasa Inggris di audio Anda.

 

Q. Apa bedanya CLOVA Speech Recognition (CSR) dan CLOVA Speech?
CSR adalah API untuk ucapan pendek di bawah 60 detik, sedangkan CLOVA Speech adalah produk terpisah yang mendukung file rekaman panjang dan pemisahan pembicara.
Pengujian kali ini memakai CSR.

 

Q. Pilih Scribe v1 atau v2?
Kalau mempertahankan bentuk penulisan asli itu penting, pilih v1; kalau Anda ingin output rapi yang otomatis membereskan simbol mata uang dan sejenisnya, pilih v2.
v2 juga mendukung streaming real-time ($0.39 per jam).

 

Praktik nyata transkripsi wawancara dan pemisahan pembicara berlanjut di perbandingan STT ElevenLabs vs Whisper vs Deepgram.
Sampai jumpa di artikel berikutnya. Salam, Sonetho. ⚡