Hallo, hier ist Sonetho. ⚡
"Für Koreanisch ist die Spracherkennung von Naver doch besser, oder?"
Das hört man ständig, aber kaum jemand hat es wirklich nachgemessen.
Also haben wir selbst gemessen.
Dieselben 8 koreanischen Audios gingen in drei Engines, abgeglichen Zeichen für Zeichen mit dem Originalskript.
📊 Ergebnisse im Überblick (Zeichenfehlerrate CER, niedriger ist besser)
| Kategorie | CLOVA CSR | Scribe v1 | Scribe v2 |
|---|---|---|---|
| Emotionale Dialoge | 3.2% | 1.1% | 1.1% |
| Vorlesen im Nachrichtenstil | 0~0.8% | 0~0.8% | 0~0.8% |
| Mix aus Englisch und Zahlen | 36.9~37.7% | 8.5~13.8% | 8.5~20.8% |
| Konsistenz bei langen Texten | 1.7~7.3% | 0% | 0% |
| Durchschnitt | 11.4% | 3.2% | 4.0% |
Zuerst ein Wort zugunsten von CLOVA.
Bei reinem Koreanisch liefert auch CSR praktisch die volle Punktzahl.
Beim Vorlesen im Nachrichtenstil lagen alle drei Engines gleichauf im 0%-Bereich.
Wer nur dieses Szenario braucht, kann jede der drei nehmen.
🔬 Gesamtmesswerte nach Segmenten (8 Durchläufe)
Die Zusammenfassung ist nach Bereichen gruppiert, daher lege ich hier alle 8 Durchläufe offen.
Dafür wurde das gleiche Skript mit zwei Stimmen synthetisiert und jeweils eingefügt.
| Kategorie | Quellstimme | CLOVA CSR | Scribe v1 | Scribe v2 |
|---|---|---|---|---|
| Emotionale Sprache | CLOVA Ara | 3.2% | 1.1% | 1.1% |
| Emotionale Sprache | ElevenLabs Hyuk | 3.2% | 1.1% | 1.1% |
| Nachrichtensprecher | CLOVA Ara | 0% | 0% | 0% |
| Nachrichtensprecher | ElevenLabs Hyuk | 0.8% | 0.8% | 0.8% |
| Gemischt (Englisch/Zahlen) | CLOVA Ara | 36.9% | 13.8% | 20.8% |
| Gemischt (Englisch/Zahlen) | ElevenLabs Hyuk | 37.7% | 8.5% | 8.5% |
| Lange Texte (Konsistenz) | CLOVA Ara | 7.3% | 0% | 0% |
| Lange Texte (Konsistenz) | ElevenLabs Hyuk | 1.7% | 0% | 0% |
💥 Entschieden wurde das Duell beim Englisch-Mix
Sobald Markennamen und Zahlen in koreanischen Sätzen auftauchen, geht die Schere weit auf.
Hier einige echte CSR-Ausgaben, unverändert übernommen.
| Soll | Ausgabe von CLOVA CSR |
|---|---|
| ChatGPT | "채취 pt" (sinnfreie koreanische Silben plus "pt") |
| Gemini | "나재민이", "개 미니" (klingt wie ein koreanischer Name; "Mini-Hund") |
| 일레븐랩스 (ElevenLabs auf Koreanisch) | "11 x" |
| 약 15달러 수준 ("etwa 15 Dollar" auf Koreanisch) | "약 시부터 여수 중" (sinnfreie koreanische Wortfolge) |
Bei YouTube-Untertiteln, IT-Content oder heutigen Meeting-Protokollen mit eingestreutem Englisch wird genau dieser Unterschied direkt zu Korrekturaufwand.
Scribe hat in denselben Passagen ChatGPT, Gemini und API komplett originalgetreu erhalten.
🎧 Das Audio und die Transkripte im Detail
Die nackten Zahlen allein vermitteln kaum einen Eindruck.
Hier ist das Audio, das ich tatsächlich für den Test mit englischen Begriffen verwendet habe.
Hören Sie es sich an und vergleichen Sie es mit den untenstehenden Transkripten.
Von CLOVA Ara gesprochenes Audio
Das korrekte Skript
일레븐랩스의 Creator 플랜은 월 22달러지만, 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고, 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 sonetho.com에서 확인하세요.
CLOVA CSR (Fehlerrate 36.9%)
11 x의 크리에이터 플랜은 월 22 달라지는 첫달은 50% 할인된 11달러에 시작할 수 있습니다 채취 pt 나재민이 같은 ai 툴과 연동 하면 활용 폭이 넓어지고 2026년 7월 기준 api 요금은 100만장 약 시부터 여수 중입니다 자세한 내용은 선 투 닷컴에서 확인하세요
Scribe v1 (Fehlerrate 13.8%)
일레븐웹스의 크리에이터 플랜은 월 $22지만 첫 달은 50% 할인된 $11에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 $15 수준입니다. 자세한 내용은 son토.com에서 확인하세요.
Scribe v2 (Fehlerrate 20.8%)
일레븐랩스의 크리에이터 플랜은 월 22달러지만 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. 챗GPT나 제미니 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 소토닷컴에서 확인하세요.
An dieser Stelle muss ich eine Anmerkung machen.
Obwohl v2 einen schlechteren Wert als v1 hat, hat es den Inhalt tatsächlich besser verstanden.
v1 schrieb den Markennamen falsch als "일레븐웹스", während v2 ihn korrekt als "일레븐랩스" erkannte.
Auch bei den Beträgen wandelte v1 den Wert in $22 um, während v2 ihn originalgetreu als "22달러" beibehielt.
Allerdings hat v2 die Begriffe ChatGPT als "챗GPT" und Gemini als "제미니" ins Koreanische übertragen.
Da die zeichenbasierte Bewertung (CER) dies als Fehler wertet, stieg die Rate auf 20.8%.
Man darf also nicht allein aufgrund der Punktzahl schlussfolgern, dass v1 besser ist.
🎙️ Derselbe Satz, doch die Fehlerrate variiert je nach Stimme um das Vierfache
Ein Ergebnis war völlig unerwartet.
Bei der Passage mit dem langen Text ist das Skript absolut identisch.
Dennoch lag die CSR-Fehlerrate bei der mit der CLOVA-Stimme gelesenen Audiodatei bei 7.3%, während sie bei der von ElevenLabs gesprochenen Version nur 1.7% betrug.
Die Abweichung um den Faktor 4 liegt also nicht am Erkennungssystem, sondern an der gelesenen Stimme.
Scribe erzielte bei beiden Audiodateien jeweils 0%.
Von CLOVA Ara gelesener Langtext
Von ElevenLabs Hyuk gelesener Langtext
Der Fehler trat jeweils am Satzende auf.
Das korrekte Skript lautet "어제보다 오늘 더 자연스러워지고 있다는 것만은 분명합니다".
Bei der CLOVA-Stimme transkribierte CSR dies fälschlicherweise als "있다는것만 있는 영화".
An derselben Stelle erkannte CSR bei der ElevenLabs-Stimme den korrekten Ausdruck "있다는것만은 분명합니다".
Auch der Abschnitt "근본적으로 바꾸고 있습니다" mit "있습니다" wurde ausschließlich bei der CLOVA-Stimme komplett ausgelassen.
Was bedeutet das für die Praxis?
Wenn man die Genauigkeit von STT misst, reicht es nicht aus, nur die Erkennungs-Engine zu vergleichen.
Aussprache und Sprechrhythmus des Eingabe-Audios beeinflussen das Ergebnis in erheblichem Maße.
Bei der Auswahl unternehmenseigener Tools sollten Sie die Messungen daher immer mit der Stimme des tatsächlichen Sprechers durchführen.
🧐 Auch Scribe war nicht perfekt
Der Ehrlichkeit halber legen wir auch die Fehler von Scribe offen.
Bei Eigennamen, die es zum ersten Mal sieht, schwächelt es.
Aus "sonetho.com" wurde "sonto.com", und in einem Sample verstand es "11 Dollar" als "1 Dollar".
Wenn Zahlen direkt Geld bedeuten, ist die Prüfung bei jeder Engine Pflicht.
Auch der Unterschied zwischen v1 und v2 war spannend.
v2 normalisiert die Schreibweise von sich aus: aus "22 Dollar" wird "$22".
In unserer Bewertung (CER) zählt das als Fehler, inhaltlich ist die Ausgabe aber korrekt.
Wer die wörtliche Form braucht, nimmt v1; wer gut lesbare Untertitel und Dokumente will, nimmt v2.
v2 gibt es auch als Echtzeit-Streaming-Version.
💰 Was kostet das Ganze?
ElevenLabs Scribe: $0.22 pro Stunde (im Batch-Modus).
Schon der Gratis-Plan enthält 4.5 Stunden pro Monat.
Der Starter für $6 bringt 27 Stunden mit, der Creator für $22 sogar 100 Stunden, damit sind die meisten privaten Projekte im Plan abgedeckt.
CLOVA Speech Recognition (CSR): nutzungsbasierte Abrechnung, aufgerundet in 15-Sekunden-Blöcken.
Den genauen Preis zeigt der Kostenrechner von Naver Cloud.
Wichtig: CSR ist eine API für kurze Sprachaufnahmen mit einem 60-Sekunden-Limit.
Für lange Aufnahmen und Sprechertrennung braucht es das separate Produkt CLOVA Speech.
🤔 Was soll ich also nehmen?
CLOVA CSR passt, wenn
kurze, fast rein koreanische Sprachaufnahmen verarbeitet werden.
das Projekt eine Cloud-Infrastruktur in Korea vorschreibt.
das Team ohnehin schon im Naver-Cloud-Ökosystem arbeitet.
ElevenLabs Scribe passt, wenn
Untertitel oder Protokolle für Content mit Englisch-Koreanisch-Mix entstehen.
IT- oder Marketing-Audio voller Markennamen transkribiert wird.
Mit den 4.5 Gratis-Stunden lässt sich die Qualität erst einmal selbst prüfen, bevor man sich entscheidet.
ElevenLabs Scribe kostenlos testen →
🧪 Messmethode (reproduzierbar)
Skripte aus 4 Kategorien (emotionale Dialoge, Nachrichtenstil, Englisch-Zahlen-Mix, Langtext) wurden mit zwei hochwertigen TTS-Stimmen (Ara Pro von CLOVA und Hyuk von ElevenLabs) zu 8 Audios synthetisiert.
Jedes Audio lief durch alle drei Engines und wurde Zeichen für Zeichen mit dem Skript abgeglichen (CER).
Die Grenzen nennen wir ebenfalls.
Der Input ist rauschfreie TTS-Synthese, also Idealbedingungen; mit echten Sprechern oder Störgeräuschen können die Werte abweichen.
Einzelne Fehler könnten auch aus der Aussprache des TTS stammen.
❓ Häufige Fragen (FAQ)
Q. Welches STT ist für Koreanisch am genauesten?
In diesem Test hatte Scribe v1 mit 3.2% die niedrigste durchschnittliche Zeichenfehlerrate.
Bei rein koreanischer Standardsprache liegt aber auch CLOVA CSR gleichauf im 0%-Bereich; entscheidend ist, ob im Audio Englisch vorkommt.
Q. Was unterscheidet CLOVA Speech Recognition (CSR) von CLOVA Speech?
CSR ist eine API für kurze Sprachaufnahmen bis 60 Sekunden, CLOVA Speech ein separates Produkt für lange Aufnahmen inklusive Sprechertrennung.
Getestet wurde hier CSR.
Q. Scribe v1 oder v2?
Wenn die wörtliche Schreibweise erhalten bleiben soll, v1; wenn eine gut lesbare Ausgabe mit automatisch normalisierten Angaben wie Währungssymbolen gewünscht ist, v2.
v2 unterstützt außerdem Echtzeit-Streaming ($0.39 pro Stunde).
Wie sich Interview-Transkription und Sprechertrennung in der Praxis schlagen, zeigt der STT-Vergleich: ElevenLabs vs Whisper vs Deepgram.
Bis zum nächsten Artikel. Das war Sonetho. ⚡