Korece STT Doğruluğunu Gerçekten Ölçtük: CLOVA vs ElevenLabs Scribe, Aynı Sesi 24 Kez Çalıştırdık

Naver CLOVA Speech Recognition (CSR) ile ElevenLabs Scribe v1 ve v2'ye aynı 8 Korece ses dosyasını verip karakter hata oranını (CER) ölçtük. Saf Korecede sonuç fiilen berabere; İngilizce karıştığında fark 4 kata çıktı. Ham verileri açık şekilde paylaşıyoruz.

Merhaba, Sonetho burada. ⚡

 

"Korece konuşma tanımada Naver daha iyidir, değil mi?"
Bu cümleyi çok duyuyoruz ama gerçekten ölçen neredeyse yok.
Biz de oturup ölçtük.
Aynı 8 Korece ses dosyasını üç motora verdik ve doğru metinle karakter karakter karşılaştırdık.

 

📊 Sonuç Özeti (Karakter Hata Oranı CER, ne kadar düşükse o kadar doğru)

KategoriCLOVA CSRScribe v1Scribe v2
Duygusal replikler3.2%1.1%1.1%
Haber tarzı okuma0~0.8%0~0.8%0~0.8%
İngilizce ve rakam karışımı36.9~37.7%8.5~13.8%8.5~20.8%
Uzun metin tutarlılığı1.7~7.3%0%0%
Ortalama11.4%3.2%4.0%

 

Önce CLOVA'nın hakkını verelim.
Saf Korecede CSR de fiilen tam puan alıyor.
Haber tarzı okumada üç motor da %0 bandında berabere kaldı.
Sadece bu bölüme bakarsanız hangisini kullansanız olur.

 

🔬 Tüm ölçüm değerleri (8 tekrar)

Özet tabloyu aralıklara göre gruplandırdığım için 8 tekrarın tamamını burada paylaşıyorum.
Aynı metni iki farklı seslendirme ile sentezleyerek ayrı ayrı ekledim.

 

KategoriKaynak SesCLOVA CSRScribe v1Scribe v2
Duygusal İfadeCLOVA Ara3.2%1.1%1.1%
Duygusal İfadeElevenLabs Hyuk3.2%1.1%1.1%
Haber OkumaCLOVA Ara0%0%0%
Haber OkumaElevenLabs Hyuk0.8%0.8%0.8%
İngilizce ve Sayı KarışıkCLOVA Ara36.9%13.8%20.8%
İngilizce ve Sayı KarışıkElevenLabs Hyuk37.7%8.5%8.5%
Uzun Metin TutarlılığıCLOVA Ara7.3%0%0%
Uzun Metin TutarlılığıElevenLabs Hyuk1.7%0%0%

 

💥 Farkı Yaratan Nokta: İngilizce Karışımı

Korece cümleye marka adları ve rakamlar karıştığı anda makas açıldı.
CSR'nin gerçek çıktılarından birkaçını olduğu gibi aktarıyoruz.

 

Doğru metinCLOVA CSR çıktısı
ChatGPT"채취 pt"
Gemini"나재민이", "개 미니"
일레븐랩스 (ElevenLabs)"11 x"
약 15달러 수준 (yani "yaklaşık 15 dolar")"약 시부터 여수 중"

 

YouTube altyazıları, IT içerikleri veya günümüz toplantı notları gibi İngilizce kelimelerin karıştığı seslerde bu fark doğrudan iş yükünüze dönüşüyor.
Aynı bölümde Scribe; ChatGPT, Gemini ve API'yi tamamen orijinal haliyle korudu.

 

🎧 Test edilen ses dosyaları ve dökümler

Sadece rakamlara bakarak durumu anlamak zordur.
İngilizce ifadelerin yer aldığı bölümlerde kullanılan orijinal ses dosyalarını aşağıya ekliyorum.
Sesi dinlerken aşağıdaki dökümlerle karşılaştırın.

 

CLOVA Ara tarafından seslendirilen metin

 

Orijinal metin (Ground-truth)
일레븐랩스의 Creator 플랜은 월 22달러지만, 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고, 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 sonetho.com에서 확인하세요.

 

CLOVA CSR (Hata oranı 36.9%)
11 x의 크리에이터 플랜은 월 22 달라지는 첫달은 50% 할인된 11달러에 시작할 수 있습니다 채취 pt 나재민이 같은 ai 툴과 연동 하면 활용 폭이 넓어지고 2026년 7월 기준 api 요금은 100만장 약 시부터 여수 중입니다 자세한 내용은 선 투 닷컴에서 확인하세요

 

Scribe v1 (Hata oranı 13.8%)
일레븐웹스의 크리에이터 플랜은 월 $22지만 첫 달은 50% 할인된 $11에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 $15 수준입니다. 자세한 내용은 son토.com에서 확인하세요.

 

Scribe v2 (Hata oranı 20.8%)
일레븐랩스의 크리에이터 플랜은 월 22달러지만 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. 챗GPT나 제미니 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 소토닷컴에서 확인하세요.

 

Burada dikkat edilmesi gereken bir nokta var.
v2 modeli v1'e göre puan olarak daha düşük kalsa da aslında konuşulanları daha iyi anladı.
v1 marka ismini "일레븐웹스" şeklinde hatalı yazarken, v2 bunu "일레븐랩스" olarak doğru tahmin etti.
Fiyat konusunda v1 22 dolar işaretini $22 şeklinde değiştirdi, v2 ise "22달러" olarak orijinal haliyle bıraktı.
Ancak v2, ChatGPT ifadesini "챗GPT" ve Gemini ifadesini "제미니" şeklinde Korece transkripsiyonla yazdı.
Karakter bazlı puanlamada (CER) bunların tamamı hata olarak hesaplandığı için sonuç 20.8% oldu.
Sadece puanlara bakarak v1'in daha başarılı olduğunu düşünmek yanıltıcı olabilir.

 

🎙️ Aynı cümlede ses tonuna göre 4 kat hata payı farkı

Beklenmedik bir sonuçla karşılaştım.
Uzun metin bölümlerinde orijinal metin tamamen aynıdır.
Ancak CLOVA sesiyle okunan ses kaydında CSR hata oranı %7.3, ElevenLabs sesiyle okunan tarafta ise %1.7 çıktı.
Tanıyıcıdan değil, metni okuyan ses tonundan kaynaklanan 4 katlık bir fark oluştu.
Scribe ise her iki ses kaydında da %0 hata oranı gösterdi.

 

CLOVA Ara tarafından okunan uzun metin

 

ElevenLabs Hyuk tarafından okunan uzun metin

 

Hata yapılan nokta cümle sonuydu.
Doğru metin "어제보다 오늘 더 자연스러워지고 있다는 것만은 분명합니다" şeklindedir.
CLOVA sesinde CSR bunu "있다는것만 있는 영화" olarak yazıya döktü.
Aynı noktada ElevenLabs sesini kullanan CSR ise "있다는것만은 분명합니다" şeklinde doğru olarak algıladı.
Ayrıca aradaki "근본적으로 바꾸고 있습니다" ifadesinin "있습니다" kısmı da sadece CLOVA sesinde tamamen kayboldu.

 

Bu durum pratik uygulamada şunu ifade eder:
STT doğruluğunu ölçerken yalnızca tanıma motorunu değiştirmek yeterli değildir.
Giriş sesindeki telaffuz ve nefes aralıkları sonuçları ciddi ölçüde etkiler.
Şirket içi araçları seçerken mutlaka gerçekte kullanılacak konuşmacının sesiyle test yapmalısınız.

 

🧐 Scribe da Kusursuz Değildi

Dürüst olalım, Scribe'ın hatalarını da paylaşıyoruz.
İlk kez duyduğu özel isimlerde zayıf.
"sonetho.com"u "sonto.com" diye yazdı; bir örnekte de "11달러" (11 dolar) ifadesini "1달러" (1 dolar) olarak duydu.
Rakamların doğrudan parayla ilgili olduğu belgelerde, motor hangisi olursa olsun kontrol şart.

 

v1 ile v2 arasındaki fark da ilginçti.
v2, "22달러" (22 dolar) ifadesini kendiliğinden "$22" olarak normalize ediyor.
Bizim puanlama yöntemimizde (CER) bu hata sayılıyor ama anlam olarak doğru bir çıktı.
Yazımın orijinal hali önemliyse v1, okunması kolay altyazı ve belge hedefliyorsanız v2 doğru seçim.
v2'nin gerçek zamanlı streaming sürümü de var.

 

💰 Fiyatlar Nasıl Farklılaşıyor

ElevenLabs Scribe: saat başı $0.22 (batch bazında).
Ücretsiz plana bile ayda 4,5 saat dahil.
$6'lık Starter 27 saat, $22'lik Creator 100 saat içeriyor; yani çoğu bireysel iş plan sınırları içinde bitiyor.

 

CLOVA Speech Recognition (CSR): 15 saniyelik dilimlere yukarı yuvarlanan, kullandıkça öde modeli.
Net birim fiyatı Naver Cloud fiyat hesaplayıcısından kontrol edin.
Not: CSR kısa konuşmalar için bir API ve 60 saniye sınırı var.
Uzun kayıtlar ve konuşmacı ayrımı gerekiyorsa ayrı bir ürün olan CLOVA Speech kullanmanız gerekiyor.

 

🤔 Peki Hangisini Kullanmalı

CLOVA CSR şu durumlarda doğru seçim
Ağırlıklı olarak saf Korece kısa konuşmalar işliyorsanız.
Projenizde Kore yerel bulut altyapısı şartı varsa.
Ekibiniz zaten Naver Cloud ekosistemini kullanıyorsa.

 

ElevenLabs Scribe şu durumlarda doğru seçim
İngilizce ile Korecenin karıştığı içeriklere altyazı veya toplantı notu hazırlıyorsanız.
IT ve pazarlama seslerinde marka adları sık geçiyorsa.
Ücretsiz 4,5 saatle kaliteyi önce kendiniz test edip sonra karar verebilirsiniz.

 

ElevenLabs Scribe'ı Ücretsiz Deneyin →

 

🧪 Ölçüm Yöntemi (Tekrarlanabilir)

4 kategorideki senaryoları (duygusal replikler, haber tarzı, İngilizce ve rakam karışımı, uzun metin) iki yüksek kaliteli TTS ile (CLOVA Ara Pro ve ElevenLabs Hyuk) sentezleyip 8 ses dosyası oluşturduk.
Her sesi üç motora verip doğru metinle karakter karakter karşılaştırdık (CER).
Sınırlılıkları da açıkça belirtelim.
Girdi TTS sentez sesi olduğu için gürültüsüz, ideal koşullar geçerli; gerçek insan konuşmasında veya gürültülü ortamlarda rakamlar değişebilir.
Bazı hatalar TTS'in telaffuzundan kaynaklanmış da olabilir.

 

❓ Sık Sorulan Sorular (FAQ)

Q. Korece için en doğru STT hangisi?
Bu ölçümde ortalama karakter hata oranında en düşük değer 3.2% ile Scribe v1'e ait.
Ancak saf ve resmi Korecede CLOVA CSR de %0 bandında berabere; yani seçim kriteri, sesinizde İngilizce olup olmadığı.

 

Q. CLOVA Speech Recognition (CSR) ile CLOVA Speech arasındaki fark ne?
CSR, 60 saniyenin altındaki kısa konuşmalar için bir API; CLOVA Speech ise uzun kayıt dosyalarını ve konuşmacı ayrımını destekleyen ayrı bir ürün.
Bu test CSR üzerinden yapıldı.

 

Q. Scribe v1 mi v2 mi?
Yazımın orijinal halini korumak önemliyse v1; para birimi sembolleri gibi yazımları kendiliğinden düzenleyen, okuması kolay çıktı istiyorsanız v2.
v2 ayrıca gerçek zamanlı streaming'i de destekliyor (saat başı $0.39).

 

Röportaj transkripsiyonu ve konuşmacı ayrımının pratiği ElevenLabs vs Whisper vs Deepgram STT karşılaştırması yazısında devam ediyor.
Bir sonraki yazıda görüşmek üzere. Sevgiler, Sonetho. ⚡