Koreański STT pod lupą: rozpoznawanie mowy Clova vs ElevenLabs Scribe, to samo audio przepuszczone 24 razy

Do rozpoznawania mowy Naver Clova (CSR) oraz ElevenLabs Scribe v1 i v2 wrzuciliśmy ten sam zestaw 8 koreańskich nagrań i zmierzyliśmy współczynnik błędów znakowych (CER). Na czystym koreańskim praktycznie remis, przy wtrąceniach angielskiego różnica aż 4-krotna. Publikujemy surowe dane.

Cześć, z tej strony Sonetho. ⚡

 

„Koreańskie rozpoznawanie mowy? Przecież Naver robi to najlepiej.”
Słyszymy to często, ale mało kto naprawdę to sprawdził.
Więc zmierzyliśmy sami.
Ten sam zestaw 8 koreańskich nagrań trafił do trzech silników i został porównany znak po znaku z wzorcowym skryptem.

 

📊 Wyniki w skrócie (współczynnik błędów znakowych CER, im niżej, tym dokładniej)

KategoriaClova CSRScribe v1Scribe v2
Kwestie z emocjami3.2%1.1%1.1%
Czytanie w stylu serwisu informacyjnego0~0.8%0~0.8%0~0.8%
Mieszanka angielskiego i liczb36.9~37.7%8.5~13.8%8.5~20.8%
Spójność długiego tekstu1.7~7.3%0%0%
Średnia11.4%3.2%4.0%

 

Najpierw słowo w obronie Clovy.
Na czystym koreańskim CSR też jest praktycznie bezbłędny.
Przy czytaniu w stylu serwisu informacyjnego wszystkie trzy silniki szły łeb w łeb, w okolicach 0%.
Jeśli wasz przypadek kończy się tutaj, można wziąć cokolwiek.

 

🔬 Całkowite wyniki pomiarów (8 prób)

Podsumowanie zostało pogrupowane według zakresów, jednak poniżej przedstawiam szczegółowe zestawienie wszystkich 8 prób.
Ten sam tekst źródłowy został użyty do syntezy dwóch głosów i poddany testom.

 

KategoriaGłos źródłowyCLOVA CSRScribe v1Scribe v2
Dialogi emocjonalneCLOVA Ara3.2%1.1%1.1%
Dialogi emocjonalneElevenLabs Hyuk3.2%1.1%1.1%
Czytanie wiadomościCLOVA Ara0%0%0%
Czytanie wiadomościElevenLabs Hyuk0.8%0.8%0.8%
Mieszany ang. i liczbyCLOVA Ara36.9%13.8%20.8%
Mieszany ang. i liczbyElevenLabs Hyuk37.7%8.5%8.5%
Spójność dłuższego tekstuCLOVA Ara7.3%0%0%
Spójność dłuższego tekstuElevenLabs Hyuk1.7%0%0%

 

💥 O wszystkim zdecydowały wtrącenia angielskiego

Gdy w koreańskim zdaniu pojawiają się nazwy marek i liczby, przepaść zaczyna rosnąć.
Oto kilka prawdziwych wyników CSR, przepisanych jeden do jednego.

 

WzorzecWynik Clova CSR
ChatGPT"채취 pt"
Gemini"나재민이", "개 미니"
일레븐랩스 (ElevenLabs po koreańsku)"11 x"
약 15달러 수준 (około 15 dolarów)"약 시부터 여수 중"

 

Napisy na YouTube, treści IT, dzisiejsze notatki ze spotkań: jeśli w nagraniu mieszają się angielskie słowa, ta różnica zamienia się wprost w godziny poprawek.
Scribe w tych samych fragmentach zachował ChatGPT, Gemini i API w nienaruszonej formie.

 

🎧 Przesłane pliki audio i pełne transkrypcje

Same liczby nie dają pełnego obrazu sytuacji.
Poniżej udostępniam oryginalne pliki audio zawierające fragmenty z mieszanką języka angielskiego.
Zachęcam do odsłuchania i porównania poniższych transkrypcji.

 

Audio odczytane przez CLOVA Ara

 

Prawidłowy scenariusz
일레븐랩스의 Creator 플랜은 월 22달러지만, 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고, 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 sonetho.com에서 확인하세요.

 

CLOVA CSR (błąd 36.9%)
11 x의 크리에이터 플랜은 월 22 달라지는 첫달은 50% 할인된 11달러에 시작할 수 있습니다 채취 pt 나재민이 같은 ai 툴과 연동 하면 활용 폭이 넓어지고 2026년 7월 기준 api 요금은 100만장 약 시부터 여수 중입니다 자세한 내용은 선 투 닷컴에서 확인하세요

 

Scribe v1 (błąd 13.8%)
일레븐웹스의 크리에이터 플랜은 월 $22지만 첫 달은 50% 할인된 $11에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 $15 수준입니다. 자세한 내용은 son토.com에서 확인하세요.

 

Scribe v2 (błąd 20.8%)
일레븐랩스의 크리에이터 플랜은 월 22달러지만 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. 챗GPT나 제미니 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 소토닷컴에서 확인하세요.

 

Należy tutaj zwrócić uwagę na ważny szczegół.
Chociaż v2 ma gorszy wynik niż v1, w rzeczywistości poradził sobie lepiej.
Model v1 błędnie zapisał nazwę marki jako "일레븐웹스", podczas gdy v2 podał poprawnie "일레븐랩스".
Jeśli chodzi o kwotę, v1 zamienił ją na symbol $22, a v2 zachował oryginalny zapis "22달러".
Jednakże v2 dokonał transkrypcji fonetycznej nazw ChatGPT na "챗GPT" oraz Gemini na "제미니".
W obliczeniach CER każdy z tych przypadków został uznany za błąd, co przełożyło się na wynik 20.8%.
Sugerowanie się wyłącznie wynikiem liczbowym i uznanie v1 za lepszy model byłoby błędem.

 

🎙️ Ten sam tekst, a błąd różni się nawet czterokrotnie

Napotkałem pewien nieoczekiwany wynik.
W przypadku dłuższego fragmentu skrypt źródłowy pozostaje identyczny.
Mimo to w nagraniu głosu CLOVA wskaźnik błędu CER wyniósł 7,3%, podczas gdy dla głosu ElevenLabs było to 1,7%.
Różnica czterokrotna wynika nie z samej technologii rozpoznawania, lecz z głosu lektora.
Scribe poradził sobie bezbłędnie w obu przypadkach, osiągając 0%.

 

Dłuższy tekst odczytany przez CLOVA Ara

 

Dłuższy tekst odczytany przez ElevenLabs Hyuk

 

Problemy pojawiły się na końcu zdania.
Prawidłowy skrypt to "어제보다 오늘 더 자연스러워지고 있다는 것만은 분명합니다".
W przypadku głosu CLOVA silnik CSR zapisał to jako "있다는것만 있는 영화".
W tym samym miejscu silnik CSR dla głosu ElevenLabs poprawnie zarejestrował "있다는것만은 분명합니다".
Ponadto w sekcji "근본적으로 바꾸고 있습니다", "있습니다" zostało całkowicie pominięte wyłącznie przy głosie CLOVA.

 

W praktyce oznacza to następującą rzecz.
Jeśli oceniasz dokładność STT zmieniając tylko silnik rozpoznawania, uzyskasz jedynie połowiczne dane.
Wymowa i intonacja w nagraniu wejściowym mają ogromny wpływ na wynik.
Wybierając narzędzia do firmy, musisz przetestować je z wykorzystaniem głosu, który będzie faktycznie używany.

 

🧐 Scribe też nie jest idealny

Uczciwie pokazujemy również błędy Scribe.
Słabo radzi sobie z nazwami własnymi, które widzi pierwszy raz.
„sonetho.com” zapisał jako „sonto.com”, a w jednej próbce usłyszał „1 dolar” zamiast „11 dolarów”.
Jeśli liczby dotyczą pieniędzy, korekta jest obowiązkowa przy każdym silniku.

 

Ciekawa okazała się też różnica między v1 a v2.
Wersja v2 sama porządkuje zapis: „22 dolary” zamienia na „$22”.
W naszej metodzie oceny (CER) liczy się to jako błąd, choć znaczenie jest w pełni poprawne.
Jeśli liczy się oryginalny zapis, wybierzcie v1; jeśli celem są czytelne napisy i dokumenty, v2.
Wersja v2 ma też wariant strumieniowy działający w czasie rzeczywistym.

 

💰 Ile to kosztuje

ElevenLabs Scribe: $0.22 za godzinę (w trybie wsadowym).
Nawet darmowy plan zawiera 4,5 godziny miesięcznie.
Starter za $6 daje 27 godzin, a Creator za $22 aż 100, więc większość osobistych projektów mieści się w planie.

 

Rozpoznawanie mowy Clova (CSR): rozliczenie za zużycie, zaokrąglane w górę co 15 sekund.
Dokładną stawkę sprawdzicie w kalkulatorze cen Naver Cloud.
Uwaga: CSR to API do krótkich wypowiedzi, z limitem 60 sekund.
Do długich nagrań i rozdzielania mówców służy osobny produkt, CLOVA Speech.

 

🤔 Więc co wybrać

Clova CSR sprawdzi się, gdy
Przetwarzacie krótkie wypowiedzi, niemal wyłącznie w czystym koreańskim.
Projekt wymaga infrastruktury chmurowej w Korei.
Zespół korzysta już z ekosystemu Naver Cloud.

 

ElevenLabs Scribe sprawdzi się, gdy
Robicie napisy i notatki do treści, w których angielski miesza się z koreańskim.
Pracujecie na nagraniach IT i marketingowych pełnych nazw marek.
Darmowe 4,5 godziny pozwala najpierw samemu sprawdzić jakość i dopiero potem decydować.

 

Wypróbuj ElevenLabs Scribe za darmo →

 

🧪 Jak mierzyliśmy (do odtworzenia)

Skrypty w 4 kategoriach (kwestie z emocjami, styl serwisu informacyjnego, mieszanka angielskiego i liczb, długi tekst) zsyntetyzowaliśmy dwoma wysokiej klasy silnikami TTS (Clova Ara Pro i ElevenLabs Hyuk), uzyskując 8 nagrań.
Każde nagranie trafiło do trzech silników i zostało porównane znak po znaku ze wzorcem (CER).
Ograniczenia też wykładamy na stół.
Wejściem była mowa syntetyczna, czyli idealne warunki bez szumów; przy prawdziwych ludzkich głosach i w hałasie wyniki mogą się różnić.
Część błędów mogła też wynikać z wymowy samego TTS.

 

❓ Najczęstsze pytania (FAQ)

Q. Który STT jest najdokładniejszy dla języka koreańskiego?
W naszym pomiarze najniższy średni współczynnik błędów znakowych, 3.2%, osiągnął Scribe v1.
Na czystym, formalnym koreańskim Clova CSR idzie jednak łeb w łeb w okolicach 0%, więc kryterium wyboru jest to, czy w nagraniu pojawia się angielski.

 

Q. Czym różni się rozpoznawanie mowy Clova (CSR) od CLOVA Speech?
CSR to API do krótkich wypowiedzi do 60 sekund, a CLOVA Speech to osobny produkt obsługujący długie nagrania i rozdzielanie mówców.
Ten test dotyczy CSR.

 

Q. Scribe v1 czy v2, co wybrać?
Wybierzcie v1, gdy liczy się zachowanie oryginalnego zapisu; v2, gdy chcecie czytelny wynik z zapisem, na przykład symbolami walut, uporządkowanym automatycznie.
Wersja v2 obsługuje też streaming w czasie rzeczywistym ($0.39 za godzinę).

 

Praktyczny ciąg dalszy o transkrypcji wywiadów i rozdzielaniu mówców czeka w porównaniu STT: ElevenLabs vs Whisper vs Deepgram.
Do zobaczenia przy kolejnym wpisie. Tu Sonetho. ⚡