大家好,我是Sonetho。⚡
「做YouTube旁白,用CLOVA Dubbing不就够了吗?」
这是我常被问到的问题。
于是我亲自做了对比。
我把同样的4段韩语脚本,交给CLOVA Voice的5个声音和ElevenLabs的4个声音,一共9个声音来生成,把36个样本全部听了一遍。
🧪 我是怎么对比的
脚本分为4个部门。
情感演绎(一句从得知考试合格的喜悦、转入悔恨的台词)、新闻腔朗读、英语·数字混读(比如ChatGPT、$22),以及长文的一致性。
CLOVA这边,我用CLOVA Voice API生成了1个标准声音和4个Pro声音。
Naver Cloud官方文档明确写着CLOVA Dubbing用的正是这套CLOVA Voice引擎,所以作为音质对比是成立的。
ElevenLabs这边,我把在韩语社区人气很高的2个声音,用v2和v3两个模型分别生成。
下面每个部门我都放了实际样本。请你亲自听一听,自己判断。
它们都是本次测试生成的原始音频,为对比目的做了节选。
🎧 亲自试听的结果
部门 | BEST | 一句话点评 |
|---|---|---|
情感演绎 | ElevenLabs | 说句实话,CLOVA是第一代机器人TTS。 |
英语·数字发音 | Eleven v3 | 几乎全都读对了。反转:CLOVA比Eleven v2还强 |
「这是真人吧?」的瞬间 | ElevenLabs | 尤其是训练得好的PVC,很难分辨是不是真人 |
声音一致性 | CLOVA·Eleven v2 | v3读得好,但缺点是声音会变 |
把结果展开来说,是这样的。
🎧 情感部门亲自试听
脚本:「哈…竟然合格了,这不是在做梦吧?」
CLOVA Voice (Ara Pro)
ElevenLabs (Hyuk, v3)
在情感表现上,这根本不成对比。
CLOVA Voice无论Pro还是标准,都把情感台词当成新闻来念。
CLOVA Dubbing本身就没有任何指示情感的调节功能,只有语速、音高和特殊效果。
ElevenLabs真的把叹息与喜悦之间的语气转换演了出来,而训练得好的PVC(克隆你自己的声音)已经到了难以分辨是真人还是AI的程度。
在英语·数字混读上,出现了有趣的反转。
读得最好的是Eleven v3,ChatGPT、Gemini、$22这类表达几乎都发音准确。
但第二名不是ElevenLabs Multilingual v2,而是CLOVA。
v2一旦遇到训练数据里没有的模式,发音就会崩,而CLOVA读得比它更稳。
CLOVA内部也有差别:Pro声音明显比标准声音更会读英文单词。
🎧 英语·数字部门亲自试听
脚本里混入了ChatGPT、Gemini、$22
① ElevenLabs v2 (Hyuk):读不好的一方
② CLOVA Voice (Ara Pro):意外地稳
③ ElevenLabs v3 (Hyuk):几乎准确
v2和v3的性格差异也很明显。
v2基于训练数据,熟悉的句子很稳,但对没见过的模式很弱。
v3连没见过的模式也能读好,代价是段落切换时声音语气会飘,存在一致性上的缺点。
关于这个特性,我在Eleven v3 vs v2 韩语4部门测试里讲得更细。
🎙️ 试听全部 9 款语音
上方仅展示了具有代表性的语音。
以下是使用同一段情感台词脚本制作的全部 9 个音频样本。
为了方便对比,我保留了之前听过的两个样本。
CLOVA Nara (标准)
CLOVA Ara Pro
CLOVA Donghyun Pro
CLOVA Ian Pro
CLOVA Yuna Pro
ElevenLabs Hyuk (Multilingual v2)
ElevenLabs Hyuk (v3)
ElevenLabs Selly (Multilingual v2)
ElevenLabs Selly (v3)
在 CLOVA 内部,标准版和 Pro 版也存在差异。
不过,四款 Pro 语音之间仅音色不同,情感处理方式是一致的。
对于 ElevenLabs 而言,即使是同一款语音,v2 和 v3 版本听起来也像是不同的配音演员。
⏱️ 除了质量,我还测试了速度
如果一个视频需要截取几十个片段,生成时间就是工作时间。
因此,在制作 36 个样本时,我记录了从 API 调用到接收音频的全过程。
| 声音 | 平均生成时间 | 每秒处理字符数 |
|---|---|---|
| CLOVA Nara (标准) | 918ms | 193字 |
| CLOVA Donghyun Pro | 1,391ms | 127字 |
| CLOVA Ian Pro | 1,568ms | 113字 |
| CLOVA Yuna Pro | 1,592ms | 111字 |
| CLOVA Ara Pro | 1,596ms | 111字 |
| ElevenLabs Selly (v2) | 4,104ms | 43字 |
| ElevenLabs Hyuk (v2) | 4,256ms | 42字 |
| ElevenLabs Selly (v3) | 6,855ms | 26字 |
| ElevenLabs Hyuk (v3) | 6,899ms | 26字 |
最可信的数据是 v3 与 v2 之间的差距。
v3 比 v2 平均慢了 65%(6,877ms 对 4,180ms)。
由于两种模型是针对每种声音交替调用的,因此时间段或服务器状态不会对某一方产生偏向性。
前面提到 v3 的英语发音更好,这就是它付出的时间代价。
这意味着如果制作 100 个片段,使用 v2 需要 7 分钟,而 v3 则需要 11 分钟。
引擎之间的差距为 3.9 倍。
CLOVA 平均为 1,413ms,ElevenLabs 平均为 5,529ms。
从每秒处理字符数来看,是 125 字对 32 字。
CLOVA 标准语音以 918ms 的速度最快,即使在同一 CLOVA 引擎内,Pro 版也比标准版慢。
我也公开此次测试的局限性。
每种组合仅测试了 1 次,且包含了网络往返时间。
此外,测试循环是按类别进行的,由于同一类别的调用是连续发出的,因此无法区分某个类别较慢是因为文本特性还是当时的服务器状态。
所以,我没有将类别排名作为结论。
仅有引擎间的差距以及 v3 与 v2 的差异大到足以排除偏见,因此我将其记录在上方。
补充一点,这些数值是采用同时接收 Multilingual v2 和 v3 的方式得出的结果。
ElevenLabs 另外提供了以低延迟为目标的 Flash 系列模型和流式传输方式。
在选择用于实时对话或通话的服务时,应参考那些方案,而非本表。
💰 价格与授权:这里才是真正的分水岭
抛开音质,看条件的话,差距更大。以下是2026年7月的情况。
项目 | CLOVA Dubbing | ElevenLabs |
|---|---|---|
免费 | 每月15,000字,下载20次 | 每月10,000积分 |
免费条件 | 强制水印+标注出处+不可发布到营利频道 | 标注出处即可商用 |
商用授权起步价 | 19,900韩元(但仅限个人·非营利) | $6(约8,000韩元,完整商用授权) |
付费销售·广告·广播 | Premium 89,900韩元起 | $6 Starter起 |
声音克隆 | 无 | $6起即时克隆,$22起PVC |
有一点要注意。
把CLOVA Dubbing的免费方案用在有收益的YouTube上,属于违反条款。
从2023年12月起,免费方案只允许用于「完全不产生任何收益的频道」。
那些说「只要标注出处,连AdSense频道也免费」的博客文章,讲的是已被废止的旧政策。
而且就算你买了Standard(19,900韩元),付费销售、外包制作、广播、广告依然不行。
那属于Premium(89,900韩元)的范畴。
🤔 那到底该用哪个
适合用CLOVA Dubbing的情况
为不做变现的频道,或个人收藏用的视频制作时。
需要一个从上传视频到字幕、音效、配音都能在一个界面里完成的编辑器时。
习惯韩语界面和移动App时。
适合用ElevenLabs的情况
用在有收益的内容上时。约8,000韩元起就是完整商用授权,不用再算条件。
需要情感演绎的旁白、有声书、台词类工作。
想克隆自己的声音(PVC)来做内容时。
通过下面的链接新注册ElevenLabs,Creator方案首月5折会自动生效。
❓ 常见问题(FAQ)
Q. CLOVA Dubbing免费版能用在有收益的YouTube上吗?
不能。
从2023年12月起,免费方案改为只允许发布到不产生收益的频道。
如果频道开了AdSense,就需要付费方案,而付费销售或广告视频要从Premium(每月89,900韩元)起才能做。
Q. CLOVA Dubbing和ElevenLabs哪个更自然?
以我亲自试听为准,情感表现和整体自然度上ElevenLabs更强,尤其是v3和训练得好的PVC。
不过在英语混读的句子上,也出现了CLOVA比ElevenLabs v2读得更稳的反转。
Q. CLOVA Dubbing的价格是多少?
免费(每月15,000字)、Standard 每月19,900韩元、Premium 每月89,900韩元。
Standard仅限个人·非营利用途,所以要用于付费销售或广告,就需要Premium。
如果你想了解韩语TTS的三方大战,也可以一起看看Typecast vs Vrew vs ElevenLabs对比。
语音识别(STT)的对决在CLOVA语音识别 vs Scribe实测里继续。
下一篇再见。我是Sonetho。⚡