Koreansk STT-precision uppmätt på riktigt: CLOVA vs ElevenLabs Scribe efter 24 körningar av samma ljud

Vi körde samma åtta koreanska ljudklipp genom Naver CLOVA Speech Recognition (CSR) och ElevenLabs Scribe v1 och v2 och mätte teckenfelfrekvensen (CER). På ren koreanska var det i praktiken oavgjort, men med engelska inslag blev skillnaden fyra gånger. All rådata publicerad.

Hej, det här är Sonetho. ⚡

 

"Koreansk taligenkänning, där är väl ändå Naver bäst?"
Det hör man ofta, men få har faktiskt mätt saken.
Så vi gjorde det själva.
Samma åtta koreanska ljudklipp kördes genom tre motorer och jämfördes tecken för tecken mot facit.

 

📊 Resultat i korthet (teckenfelfrekvens CER, lägre är mer träffsäkert)

KategoriCLOVA CSRScribe v1Scribe v2
Känslosamma repliker3.2%1.1%1.1%
Nyhetsuppläsning0~0.8%0~0.8%0~0.8%
Engelska och siffror blandat36.9~37.7%8.5~13.8%8.5~20.8%
Konsekvens i långa texter1.7~7.3%0%0%
Genomsnitt11.4%3.2%4.0%

 

Först ett gott ord för CLOVA.
På ren koreanska är även CSR i praktiken felfri.
I nyhetsuppläsningen låg alla tre motorer kring 0% och gick helt jämnt.
Tittar man bara på den delen spelar valet ingen roll.

 

🔬 Totala mätvärden per segment (8 omgångar)

Sammanfattningen har grupperats per intervall, så här redovisar vi alla 8 omgångar.
Samma grundmanus har syntetiserats med två röster för att inkluderas här.

 

KategoriKällröstCLOVA CSRScribe v1Scribe v2
Emotionellt talCLOVA Ara3.2%1.1%1.1%
Emotionellt talElevenLabs Hyuk3.2%1.1%1.1%
NyhetsuppläsningCLOVA Ara0%0%0%
NyhetsuppläsningElevenLabs Hyuk0.8%0.8%0.8%
Blandad engelska/siffrorCLOVA Ara36.9%13.8%20.8%
Blandad engelska/siffrorElevenLabs Hyuk37.7%8.5%8.5%
Lång textkonsekvensCLOVA Ara7.3%0%0%
Lång textkonsekvensElevenLabs Hyuk1.7%0%0%

 

💥 Avgörandet kom när engelskan blandades in

I samma stund som varumärkesnamn och siffror dök upp i de koreanska meningarna drog fältet isär.
Här är några av CSR:s faktiska utskrifter, ordagrant återgivna.

 

FacitCLOVA CSR:s utskrift
ChatGPT"채취 pt"
Gemini"나재민이", "개 미니"
일레븐랩스 (ElevenLabs på koreanska)"11 x"
약 15달러 수준 ("cirka 15 dollar")"약 시부터 여수 중"

 

För YouTube-undertexter, IT-innehåll och dagens mötesprotokoll, där engelska ord ständigt smyger sig in, blir den här skillnaden ren arbetstid.
Scribe bevarade ChatGPT, Gemini och API helt intakta i samma avsnitt.

 

🎧 Ljudfilerna och transkriberingarna i sin helhet

Siffror ger inte hela bilden.
Här är de faktiska ljudklippen med engelska inslag som jag använde.
Lyssna gärna och jämför med transkriberingarna nedan.

 

Ljudfil uppläst av CLOVA Ara

 

Faktiskt manus
일레븐랩스의 Creator 플랜은 월 22달러지만, 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고, 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 sonetho.com에서 확인하세요.

 

CLOVA CSR (CER 36.9%)
11 x의 크리에이터 플랜은 월 22 달라지는 첫달은 50% 할인된 11달러에 시작할 수 있습니다 채취 pt 나재민이 같은 ai 툴과 연동 하면 활용 폭이 넓어지고 2026년 7월 기준 api 요금은 100만장 약 시부터 여수 중입니다 자세한 내용은 선 투 닷컴에서 확인하세요

 

Scribe v1 (CER 13.8%)
일레븐웹스의 크리에이터 플랜은 월 $22지만 첫 달은 50% 할인된 $11에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 $15 수준입니다. 자세한 내용은 son토.com에서 확인하세요.

 

Scribe v2 (CER 20.8%)
일레븐랩스의 크리에이터 플랜은 월 22달러지만 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. 챗GPT나 제미니 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 소토닷컴에서 확인하세요.

 

Här är en viktig detalj att notera.
V2 har sämre poäng än v1, men är faktiskt bättre på att förstå innehållet.
V1 stavade fel på varumärket som "일레븐웹스", medan v2 fick det rätt som "일레븐랩스".
Vad gäller beloppet konverterade v1 det till $22, medan v2 behöll originalet som "22달러".
Däremot transkriberade v2 ChatGPT till "챗GPT" och Gemini till "제미니" med koreanska tecken.
Vid teckenbaserad poängsättning (CER) räknas detta som fel, vilket gav resultatet 20.8%.
Man begår ett misstag om man bara tittar på poängen och drar slutsatsen att v1 är bäst.

 

🎙️ Samma mening, men felmarginalen skiljer sig fyra gånger beroende på rösten

Jag stötte på ett oväntat resultat.
I de långa textavsnitten är grundmanuset identiskt.
Trots detta låg CSR-felmarginalen på 7,3 % för ljudet med CLOVA-rösten, medan den var 1,7 % för rösten från ElevenLabs.
Det är inte igenkänningsverktyget, utan själva rösten som läser upp texten, som skapar en skillnad på fyra gånger.
Scribe uppnådde 0 % på båda ljudfilerna.

 

Långt avsnitt uppläst av CLOVA Ara

 

Långt avsnitt uppläst av ElevenLabs Hyuk

 

Problemen uppstod vid slutet av meningarna.
Det korrekta manuset är "어제보다 오늘 더 자연스러워지고 있다는 것만은 분명합니다".
Med CLOVA-rösten transkriberade CSR detta som "있다는것만 있는 영화".
Vid samma punkt fångade CSR med ElevenLabs-rösten upp det korrekt som "있다는것만은 분명합니다".
Även "있습니다" i "근본적으로 바꾸고 있습니다" utelämnades helt och hållet, men bara i fallet med CLOVA-rösten.

 

I praktiken innebär detta följande.
När du mäter STT-noggrannhet är det inte tillräckligt att bara byta ut igenkänningsmotorn.
Indatljudets uttal och andning påverkar resultatet lika mycket.
När du väljer interna verktyg bör du därför testa dem med rösten från den talare som faktiskt ska användas.

 

🧐 Scribe var inte heller perfekt

I ärlighetens namn redovisar vi även Scribes fel.
Motorn är svag på egennamn den aldrig har sett.
Den skrev "sonetho.com" som "sonto.com", och i ett prov hörde den "11달러" (11 dollar) som "1달러" (1 dollar).
Om siffrorna i dokumentet är direkt kopplade till pengar är korrekturläsning ett måste, oavsett motor.

 

Skillnaden mellan v1 och v2 var också intressant.
v2 normaliserar skrivsättet på egen hand och gör "22달러" till "$22".
I vår poängsättning (CER) räknas det som ett fel, men innebörden är helt korrekt.
Är den exakta ursprungsformen viktig väljer du v1, vill du ha lättlästa undertexter och dokument är v2 rätt val.
v2 finns dessutom i en version för strömning i realtid.

 

💰 Vad kostar det

ElevenLabs Scribe: $0.22 per timme (batch).
Även gratisplanen inkluderar 4,5 timmar per månad.
Starter för $6 ger 27 timmar och Creator för $22 ger 100 timmar, så de flesta egna projekt ryms gott och väl i planen.

 

CLOVA Speech Recognition (CSR): betalning per användning, avrundad uppåt i block om 15 sekunder.
Exakta priser hittar du i Naver Clouds priskalkylator.
Notera att CSR är ett API för korta yttranden med en gräns på 60 sekunder.
Behöver du långa inspelningar och talarseparering krävs den separata produkten CLOVA Speech.

 

🤔 Så vad ska du välja

CLOVA CSR passar när
du hanterar korta yttranden på i huvudsak ren koreanska.
projektet kräver molninfrastruktur i Sydkorea.
teamet redan använder Naver Cloud-ekosystemet.

 

ElevenLabs Scribe passar när
du textar eller protokollför innehåll där engelska och koreanska blandas.
ljudet är IT- eller marknadsföringsmaterial fullt av varumärkesnamn.
Med de 4,5 gratistimmarna kan du dessutom testa kvaliteten själv innan du bestämmer dig.

 

Prova ElevenLabs Scribe gratis →

 

🧪 Så mätte vi (reproducerbart)

Fyra manuskategorier (känslosamma repliker, nyhetsstil, engelska och siffror blandat, långa texter) syntetiserades med två högkvalitativa TTS-röster (CLOVA Ara Pro och ElevenLabs Hyuk) till åtta ljudfiler.
Varje fil kördes genom de tre motorerna och jämfördes tecken för tecken mot facit (CER).
Vi vill också vara öppna med begränsningarna.
Indata är TTS-syntes, alltså brusfria idealförhållanden, och siffrorna kan bli andra med verkligt mänskligt tal eller bakgrundsljud.
Vissa fel kan dessutom ha sitt ursprung i TTS-rösternas uttal.

 

❓ Vanliga frågor (FAQ)

Q. Vilken STT är mest träffsäker på koreanska?
I vår mätning hade Scribe v1 lägst genomsnittlig teckenfelfrekvens med 3.2%.
På ren formell koreanska låg dock även CLOVA CSR kring 0% och gick jämnt, så avgörandet är om ljudet innehåller engelska.

 

Q. Vad är skillnaden mellan CLOVA Speech Recognition (CSR) och CLOVA Speech?
CSR är ett API för korta yttranden på högst 60 sekunder, medan CLOVA Speech är en separat produkt som stöder långa inspelningar och talarseparering.
Det här testet gäller CSR.

 

Q. Ska jag använda Scribe v1 eller v2?
v1 om det är viktigt att bevara texten exakt som den yttrades, v2 om du vill ha lättläst utdata där sådant som valutasymboler städas upp automatiskt.
v2 stöder även strömning i realtid ($0.39 per timme).

 

Fortsättningen om intervjutranskribering och talarseparering i praktiken hittar du i jämförelsen ElevenLabs vs Whisper vs Deepgram STT.
Vi ses i nästa inlägg. Det här var Sonetho. ⚡