韓国語STTの精度を実測:CLOVA音声認識 vs ElevenLabs Scribe、同じ音声で24回検証した結果

NAVER CLOVA音声認識(CSR)とElevenLabs Scribe v1・v2に同じ韓国語音声8本を入力し、文字誤り率(CER)を測定しました。純粋な韓国語では事実上互角、英語混じりでは4倍の差が出ました。生データも公開します。

こんにちは、Sonethoです。⚡

 

「韓国語の音声認識なら、やっぱりNAVERが強いんじゃない?」
よく聞く話ですが、実際に測った人はほとんどいません。
だから自分たちで測りました。
同じ韓国語音声8本を3つのエンジンに入力し、正解台本と文字単位で照合しました。

 

📊 結果まとめ(文字誤り率CER、低いほど正確)

部門CLOVA CSRScribe v1Scribe v2
感情セリフ3.2%1.1%1.1%
ニュース調の朗読0~0.8%0~0.8%0~0.8%
英語・数字混じり36.9~37.7%8.5~13.8%8.5~20.8%
長文の一貫性1.7~7.3%0%0%
平均11.4%3.2%4.0%

 

まずCLOVAを擁護しておくと。
純粋な韓国語ならCSRも事実上満点です。
ニュース調の朗読は3エンジンとも0%台で横並びでした。
この領域だけ見れば、どれを使っても構いません。

 

🔬 セクション別の全体測定値(8回分)

要約表では範囲ごとにまとめましたが、全8回の測定結果を以下にすべて展開します。
同じ正解大本を2種類の音声で合成し、それぞれ入力しました。

 

部門ソース音声CLOVA CSRScribe v1Scribe v2
感情表現CLOVA Ara3.2%1.1%1.1%
感情表現ElevenLabs Hyuk3.2%1.1%1.1%
ニュース朗読CLOVA Ara0%0%0%
ニュース朗読ElevenLabs Hyuk0.8%0.8%0.8%
英語・数字混在CLOVA Ara36.9%13.8%20.8%
英語・数字混在ElevenLabs Hyuk37.7%8.5%8.5%
長文の一貫性CLOVA Ara7.3%0%0%
長文の一貫性ElevenLabs Hyuk1.7%0%0%

 

💥 勝負を分けたのは英語混じりでした

韓国語の文にブランド名や数字が混ざった瞬間、差が一気に開きました。
CSRの実際の出力をいくつか、そのまま載せます。

 

正解CLOVA CSRの出力
ChatGPT"채취 pt"(意味をなさない韓国語)
Gemini"나재민이", "개 미니"(いずれも無関係な韓国語)
일레븐랩스(ElevenLabs)"11 x"
약 15달러 수준(約15ドル程度)"약 시부터 여수 중"(意味不明)

 

YouTube字幕、ITコンテンツ、最近の議事録のように英単語が混ざる音声なら、この差はそのまま作業量になります。
Scribeは同じ区間でChatGPT、Gemini、APIをすべて原形のまま保持しました。

 

🎧 入力音声と文字起こし全文

数値だけでは実感が湧きにくいかもしれません。
英語混じりの区間で実際に使用した音声をそのまま公開します。
聴きながら下の文字起こしと照らし合わせてみてください。

 

CLOVA Araによる読み上げ音声

 

正解スクリプト
일레븐랩스의 Creator 플랜은 월 22달러지만, 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고, 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 sonetho.com에서 확인하세요.

 

CLOVA CSR (エラー率 36.9%)
11 x의 크리에이터 플랜은 월 22 달라지는 첫달은 50% 할인된 11달러에 시작할 수 있습니다 채취 pt 나재민이 같은 ai 툴과 연동 하면 활용 폭이 넓어지고 2026년 7월 기준 api 요금은 100만장 약 시부터 여수 중입니다 자세한 내용은 선 투 닷컴에서 확인하세요

 

Scribe v1 (エラー率 13.8%)
일레븐웹스의 크리에이터 플랜은 월 $22지만 첫 달은 50% 할인된 $11에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 $15 수준입니다. 자세한 내용은 son토.com에서 확인하세요.

 

Scribe v2 (エラー率 20.8%)
일레븐랩스의 크리에이터 플랜은 월 22달러지만 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. 챗GPT나 제미니 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 소토닷컴에서 확인하세요.

 

ここで指摘しておきたい点があります。
v2の方がスコアは低いですが、実際にはより正確に認識しています。
v1はブランド名を "일레븐웹스" と誤変換しましたが、v2は "일레븐랩스" と正しく認識しました。
金額についても、v1は $22 に変換してしまいましたが、v2は "22달러" と原文通りに出力しました。
しかしv2は ChatGPT を "챗GPT" 、Gemini を "제미니" とハングルで音写しました。
文字単位の評価(CER)ではそれらすべてがエラーと判定され、結果的に20.8%となりました。
スコアだけで判断して v1 の方が優れていると結論付けるのは早計です。

 

🎙️ 同じ文章でも音声によってエラー率が4倍に

予想外の結果が一つありました。
長文の区間は台本が完全に同じです。
ところが、CLOVAの音声で読み上げたオーディオではCSRのエラー率が7.3%、ElevenLabsの音声で読み上げた方は1.7%でした。
認識エンジンではなく、読み上げた音声のせいで4倍の差が出ました。
Scribeは同じ二つのオーディオでどちらも0%でした。

 

CLOVA Araが読み上げた長文

 

ElevenLabs Hyukが読み上げた長文

 

崩れた箇所は文末でした。
正解の台本は "어제보다 오늘 더 자연스러워지고 있다는 것만은 분명합니다" です。
CLOVAの音声では、CSRがこれを "있다는것만 있는 영화" と書き起こしました。
同じ箇所で、ElevenLabsの音声を使ったCSRは "있다는것만은 분명합니다" と正確に認識しました。
途中の "근본적으로 바꾸고 있습니다" の "있습니다" も、CLOVAの音声の側でだけ丸ごと抜け落ちていました。

 

実務においては、次のような意味を持ちます。
STTの精度を測定する際、認識エンジンだけを入れ替えても半分しか検証できていません。
入力オーディオの発音や呼吸が、それほどまでに結果を左右します。
社内ツールを選ぶ際は、実際に使用する話者の音声で測定しなければなりません。

 

🧐 Scribeも完璧ではありませんでした

公平を期して、Scribeの誤りも公開します。
初見の固有名詞に弱いです。
"sonetho.com"を"sonto.com"と書き、あるサンプルでは"11달러"(11ドル)を"1달러"(1ドル)と聞き間違えました。
数字がお金に直結する文書なら、どのエンジンでも検収は必須です。

 

v1とv2の違いも興味深いものでした。
v2は"22달러"(22ドル)を"$22"へ自動で表記正規化します。
私たちの採点方式(CER)では誤りとして集計されますが、意味としては正確な出力です。
表記の原形が重要ならv1、読みやすい字幕・文書が目的ならv2が正解です。
v2にはリアルタイムストリーミング版もあります。

 

💰 料金はどう違うのか

ElevenLabs Scribe:1時間あたり$0.22(バッチ基準)。
無料プランにも月4.5時間が含まれます。
$6のStarterは27時間、$22のCreatorは100時間込みなので、たいていの個人作業はプラン内で完結します。

 

CLOVA音声認識(CSR):15秒単位で切り上げ計算される従量課金制です。
正確な単価はNAVERクラウドの料金計算機で確認してください。
なおCSRは短い発話向けのAPIで、60秒の制限があります。
長い録音と話者分離が必要なら、別商品のCLOVA Speechを使う必要があります。

 

🤔 結局どちらを使えばいいのか

CLOVA CSRが合うケース
純粋な韓国語中心の短い発話処理。
韓国国内のクラウドインフラ要件があるプロジェクト。
すでにNAVERクラウドのエコシステムを使っているチーム。

 

ElevenLabs Scribeが合うケース
英語と韓国語が混ざるコンテンツの字幕・議事録。
ブランド名が頻出するIT・マーケティング音声。
まず無料の4.5時間で品質を自分の目で確かめてから決められます。

 

ElevenLabs Scribeを無料で始める →

 

🧪 測定方法(再現可能)

台本4部門(感情セリフ、ニュース調、英語・数字混じり、長文)を高品質TTS 2種(CLOVAのAra Pro、ElevenLabsのHyuk)で合成し、音声8本を作りました。
各音声を3エンジンに入力し、正解台本と文字単位で照合(CER)しました。
限界も明かしておきます。
入力がTTS合成音のためノイズのない理想条件であり、実際の人間の発話や騒音環境では数値が変わる可能性があります。
一部の誤りはTTS側の発音に起因する可能性もあります。

 

❓ よくある質問(FAQ)

Q. 韓国語STTで一番正確なのはどれですか?
今回の実測では、平均文字誤り率でScribe v1が3.2%と最も低い結果でした。
ただし純粋な韓国語のフォーマルな文体ではCLOVA CSRも0%台で互角なので、音声に英語が混ざるかどうかが選択基準になります。

 

Q. CLOVA音声認識(CSR)とCLOVA Speechは何が違いますか?
CSRは60秒以下の短い発話向けAPIで、CLOVA Speechは長い録音ファイルと話者分離に対応する別商品です。
今回のテストはCSR基準です。

 

Q. Scribe v1とv2、どちらを使うべきですか?
表記の原形保持が重要ならv1、通貨記号などの表記を自動で整えた読みやすい出力が目的ならv2です。
v2はリアルタイムストリーミング(1時間あたり$0.39)にも対応しています。

 

インタビュー文字起こしと話者分離の実戦編はElevenLabs vs Whisper vs Deepgram STT比較に続きます。
次の記事でまたお会いしましょう。Sonethoでした。⚡