韩语STT准确率实测:CLOVA语音识别 vs ElevenLabs Scribe,同一批音频跑了24次的结果

我们把同样的8段韩语音频分别输入NAVER CLOVA语音识别(CSR)和ElevenLabs Scribe v1、v2,测量字符错误率(CER)。纯韩语场景几乎打平,夹杂英语的场景差距达4倍。原始数据全部公开。

大家好,这里是Sonetho。⚡

 

"韩语语音识别,还得是NAVER吧?"
这话经常听到,但真正动手测过的人很少。
所以我们自己测了。
把同样的8段韩语音频输入三个引擎,再和标准文稿逐字比对。

 

📊 结果速览(字符错误率CER,越低越准)

项目CLOVA CSRScribe v1Scribe v2
情感台词3.2%1.1%1.1%
新闻体朗读0~0.8%0~0.8%0~0.8%
英语·数字混杂36.9~37.7%8.5~13.8%8.5~20.8%
长文一致性1.7~7.3%0%0%
平均11.4%3.2%4.0%

 

先替CLOVA说句公道话。
在纯韩语场景下,CSR也几乎是满分。
新闻体朗读三个引擎全部落在0%档,不分胜负。
如果只看这一段,用哪个都行。

 

🔬 各区段整体测量数据(8次测试)

由于摘要表已将数据归纳为范围,此处展示全部8次测试的详细结果。
我们将同一份正文脚本分别由两种声音合成,并将其输入到模型中。

 

类别源语音CLOVA CSRScribe v1Scribe v2
情感台词CLOVA Ara3.2%1.1%1.1%
情感台词ElevenLabs Hyuk3.2%1.1%1.1%
新闻播报CLOVA Ara0%0%0%
新闻播报ElevenLabs Hyuk0.8%0.8%0.8%
中英数字混用CLOVA Ara36.9%13.8%20.8%
中英数字混用ElevenLabs Hyuk37.7%8.5%8.5%
长文一致性CLOVA Ara7.3%0%0%
长文一致性ElevenLabs Hyuk1.7%0%0%

 

💥 胜负手在英语混杂

韩语句子里一旦混入品牌名和数字,差距立刻拉开。
下面是CSR的几条真实输出,原样照搬。

 

标准答案CLOVA CSR输出
ChatGPT"채취 pt"(一串无意义的韩文)
Gemini"나재민이", "개 미니"(均为不相干的韩文)
일레븐랩스(ElevenLabs)"11 x"
약 15달러 수준(约15美元左右)"약 시부터 여수 중"(不知所云)

 

如果你的音频像YouTube字幕、IT内容、如今的会议记录那样夹杂英文单词,这个差距就会原封不动地变成你的工作量。
在同样的段落里,Scribe把ChatGPT、Gemini、API全部原样保留。

 

🎧 输入的音频与转写原文

只看数字可能很难有直观感受。
我上传了包含中英混杂句段的原始音频。
请一边收听,一边比对下方的转写结果。

 

CLOVA Ara 朗读的音频

 

正解台本
일레븐랩스의 Creator 플랜은 월 22달러지만, 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고, 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 sonetho.com에서 확인하세요.

 

CLOVA CSR (错误率 36.9%)
11 x의 크리에이터 플랜은 월 22 달라지는 첫달은 50% 할인된 11달러에 시작할 수 있습니다 채취 pt 나재민이 같은 ai 툴과 연동 하면 활용 폭이 넓어지고 2026년 7월 기준 api 요금은 100만장 약 시부터 여수 중입니다 자세한 내용은 선 투 닷컴에서 확인하세요

 

Scribe v1 (错误率 13.8%)
일레븐웹스의 크리에이터 플랜은 월 $22지만 첫 달은 50% 할인된 $11에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 $15 수준입니다. 자세한 내용은 son토.com에서 확인하세요.

 

Scribe v2 (错误率 20.8%)
일레븐랩스의 크리에이터 플랜은 월 22달러지만 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. 챗GPT나 제미니 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 소토닷컴에서 확인하세요.

 

在此需要说明一点。
虽然 v2 的分数比 v1 差,但实际上它听得更准确。
v1 将品牌名误写为 "일레븐웹스",而 v2 正确识别为 "일레븐랩스"。
在金额方面,v1 将其转换为 $22 符号,而 v2 则按原文记作 "22달러"。
不过,v2 将 ChatGPT 译为 "챗GPT",将 Gemini 译为 "제미니",进行了韩语拼音化处理。
在字符级评分 (CER) 中,这些都被判定为错误,导致错误率达到了 20.8%。
如果仅凭分数判定 v1 表现更好,那是错误的结论。

 

🎙️ 同一句子,不同音色带来的错误率差异竟达4倍

我发现了一个出乎意料的结果。
长文本片段的原始参考文本完全一致。
然而,使用CLOVA音色朗读的音频中,CSR的错误率(CER)为7.3%,而使用ElevenLabs音色朗读的音频中,错误率仅为1.7%。
导致差异高达4倍的原因并非识别器本身,而是朗读的音色。
Scribe在两段音频中的错误率均为0%。

 

CLOVA Ara朗读的长文本

 

ElevenLabs Hyuk朗读的长文本

 

识别出错的环节在句尾。
正对的脚本为"어제보다 오늘 더 자연스러워지고 있다는 것만은 분명합니다"。
在CLOVA音色中,CSR将其识别为"있다는것만 있는 영화"。
而在同样的位置,ElevenLabs音色下的CSR将其准确识别为"있다는것만은 분명합니다"。
此外,中间部分"근본적으로 바꾸고 있습니다"的"있습니다"也仅在CLOVA音色版本中完全缺失。

 

这在实际应用中意味着:
衡量STT准确率时,仅更换识别引擎是不够的。
输入音频的发音与语速呼吸会对结果产生显著影响。
在选择内部工具时,请务必使用实际应用场景中的说话人音色进行测试。

 

🧐 Scribe也并非完美

出于诚实,Scribe的错误也一并公开。
它对第一次见到的专有名词比较吃力。
它把"sonetho.com"写成了"sonto.com",在一个样本里还把"11달러"(11美元)听成了"1달러"(1美元)。
如果文档里的数字直接关系到钱,无论用哪个引擎,人工校对都是必须的。

 

v1和v2的差异也很有意思。
v2会把"22달러"(22美元)自动规范成"$22"。
在我们的评分方式(CER)里这会被算作错误,但语义上是完全正确的输出。
看重原文写法就选v1,想要易读的字幕和文档就选v2。
v2还有实时流式版本。

 

💰 价格差在哪里

ElevenLabs Scribe:每小时$0.22(批量转写)。
免费套餐每月也包含4.5小时。
$6的Starter含27小时,$22的Creator含100小时,大多数个人项目在套餐内就能搞定。

 

CLOVA语音识别(CSR):按15秒为单位向上取整的按量计费。
准确单价请在NAVER Cloud的价格计算器里确认。
另外CSR是面向短语音的API,有60秒的时长限制。
需要长录音和说话人分离的话,得用另一款产品CLOVA Speech。

 

🤔 那到底该用哪个

适合CLOVA CSR的情况
以纯韩语为主的短语音处理。
有韩国本土云基础设施要求的项目。
已经在用NAVER Cloud生态的团队。

 

适合ElevenLabs Scribe的情况
韩英混杂内容的字幕和会议记录。
品牌名频繁出现的IT、营销类音频。
可以先用免费的4.5小时亲自验证质量,再做决定。

 

免费开始用ElevenLabs Scribe →

 

🧪 测量方法(可复现)

我们把4类文稿(情感台词、新闻体、英语·数字混杂、长文)用两款高品质TTS(CLOVA的Ara Pro、ElevenLabs的Hyuk)合成,得到8段音频。
每段音频输入三个引擎,与标准文稿逐字比对(CER)。
局限性也说清楚。
输入是TTS合成音,属于无噪声的理想条件,真人语音或嘈杂环境下数值可能不同。
部分错误也可能源自TTS本身的发音。

 

❓ 常见问题(FAQ)

Q. 韩语STT哪个最准?
本次实测中,按平均字符错误率计,Scribe v1以3.2%最低。
不过在纯韩语正式文体下,CLOVA CSR同样在0%档打平,所以音频里是否夹杂英语才是真正的选择标准。

 

Q. CLOVA语音识别(CSR)和CLOVA Speech有什么区别?
CSR是面向60秒以内短语音的API,CLOVA Speech是支持长录音文件和说话人分离的另一款产品。
本次测试以CSR为准。

 

Q. Scribe v1和v2该用哪个?
看重保留原文写法就用v1,想要自动整理货币符号等写法、便于阅读的输出就用v2。
v2还支持实时流式转写(每小时$0.39)。

 

访谈转写与说话人分离的实战篇,请看ElevenLabs vs Whisper vs Deepgram STT对比
下篇文章再见,这里是Sonetho。⚡