こんにちは、Sonethoです。⚡
「韓国語の音声認識なら、やっぱりNAVERが強いんじゃない?」
よく聞く話ですが、実際に測った人はほとんどいません。
だから自分たちで測りました。
同じ韓国語音声8本を3つのエンジンに入力し、正解台本と文字単位で照合しました。
📊 結果まとめ(文字誤り率CER、低いほど正確)
| 部門 | CLOVA CSR | Scribe v1 | Scribe v2 |
|---|---|---|---|
| 感情セリフ | 3.2% | 1.1% | 1.1% |
| ニュース調の朗読 | 0~0.8% | 0~0.8% | 0~0.8% |
| 英語・数字混じり | 36.9~37.7% | 8.5~13.8% | 8.5~20.8% |
| 長文の一貫性 | 1.7~7.3% | 0% | 0% |
| 平均 | 11.4% | 3.2% | 4.0% |
まずCLOVAを擁護しておくと。
純粋な韓国語ならCSRも事実上満点です。
ニュース調の朗読は3エンジンとも0%台で横並びでした。
この領域だけ見れば、どれを使っても構いません。
🔬 セクション別の全体測定値(8回分)
要約表では範囲ごとにまとめましたが、全8回の測定結果を以下にすべて展開します。
同じ正解大本を2種類の音声で合成し、それぞれ入力しました。
| 部門 | ソース音声 | CLOVA CSR | Scribe v1 | Scribe v2 |
|---|---|---|---|---|
| 感情表現 | CLOVA Ara | 3.2% | 1.1% | 1.1% |
| 感情表現 | ElevenLabs Hyuk | 3.2% | 1.1% | 1.1% |
| ニュース朗読 | CLOVA Ara | 0% | 0% | 0% |
| ニュース朗読 | ElevenLabs Hyuk | 0.8% | 0.8% | 0.8% |
| 英語・数字混在 | CLOVA Ara | 36.9% | 13.8% | 20.8% |
| 英語・数字混在 | ElevenLabs Hyuk | 37.7% | 8.5% | 8.5% |
| 長文の一貫性 | CLOVA Ara | 7.3% | 0% | 0% |
| 長文の一貫性 | ElevenLabs Hyuk | 1.7% | 0% | 0% |
💥 勝負を分けたのは英語混じりでした
韓国語の文にブランド名や数字が混ざった瞬間、差が一気に開きました。
CSRの実際の出力をいくつか、そのまま載せます。
| 正解 | CLOVA CSRの出力 |
|---|---|
| ChatGPT | "채취 pt"(意味をなさない韓国語) |
| Gemini | "나재민이", "개 미니"(いずれも無関係な韓国語) |
| 일레븐랩스(ElevenLabs) | "11 x" |
| 약 15달러 수준(約15ドル程度) | "약 시부터 여수 중"(意味不明) |
YouTube字幕、ITコンテンツ、最近の議事録のように英単語が混ざる音声なら、この差はそのまま作業量になります。
Scribeは同じ区間でChatGPT、Gemini、APIをすべて原形のまま保持しました。
🎧 入力音声と文字起こし全文
数値だけでは実感が湧きにくいかもしれません。
英語混じりの区間で実際に使用した音声をそのまま公開します。
聴きながら下の文字起こしと照らし合わせてみてください。
CLOVA Araによる読み上げ音声
正解スクリプト
일레븐랩스의 Creator 플랜은 월 22달러지만, 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고, 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 sonetho.com에서 확인하세요.
CLOVA CSR (エラー率 36.9%)
11 x의 크리에이터 플랜은 월 22 달라지는 첫달은 50% 할인된 11달러에 시작할 수 있습니다 채취 pt 나재민이 같은 ai 툴과 연동 하면 활용 폭이 넓어지고 2026년 7월 기준 api 요금은 100만장 약 시부터 여수 중입니다 자세한 내용은 선 투 닷컴에서 확인하세요
Scribe v1 (エラー率 13.8%)
일레븐웹스의 크리에이터 플랜은 월 $22지만 첫 달은 50% 할인된 $11에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 $15 수준입니다. 자세한 내용은 son토.com에서 확인하세요.
Scribe v2 (エラー率 20.8%)
일레븐랩스의 크리에이터 플랜은 월 22달러지만 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. 챗GPT나 제미니 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 소토닷컴에서 확인하세요.
ここで指摘しておきたい点があります。
v2の方がスコアは低いですが、実際にはより正確に認識しています。
v1はブランド名を "일레븐웹스" と誤変換しましたが、v2は "일레븐랩스" と正しく認識しました。
金額についても、v1は $22 に変換してしまいましたが、v2は "22달러" と原文通りに出力しました。
しかしv2は ChatGPT を "챗GPT" 、Gemini を "제미니" とハングルで音写しました。
文字単位の評価(CER)ではそれらすべてがエラーと判定され、結果的に20.8%となりました。
スコアだけで判断して v1 の方が優れていると結論付けるのは早計です。
🎙️ 同じ文章でも音声によってエラー率が4倍に
予想外の結果が一つありました。
長文の区間は台本が完全に同じです。
ところが、CLOVAの音声で読み上げたオーディオではCSRのエラー率が7.3%、ElevenLabsの音声で読み上げた方は1.7%でした。
認識エンジンではなく、読み上げた音声のせいで4倍の差が出ました。
Scribeは同じ二つのオーディオでどちらも0%でした。
CLOVA Araが読み上げた長文
ElevenLabs Hyukが読み上げた長文
崩れた箇所は文末でした。
正解の台本は "어제보다 오늘 더 자연스러워지고 있다는 것만은 분명합니다" です。
CLOVAの音声では、CSRがこれを "있다는것만 있는 영화" と書き起こしました。
同じ箇所で、ElevenLabsの音声を使ったCSRは "있다는것만은 분명합니다" と正確に認識しました。
途中の "근본적으로 바꾸고 있습니다" の "있습니다" も、CLOVAの音声の側でだけ丸ごと抜け落ちていました。
実務においては、次のような意味を持ちます。
STTの精度を測定する際、認識エンジンだけを入れ替えても半分しか検証できていません。
入力オーディオの発音や呼吸が、それほどまでに結果を左右します。
社内ツールを選ぶ際は、実際に使用する話者の音声で測定しなければなりません。
🧐 Scribeも完璧ではありませんでした
公平を期して、Scribeの誤りも公開します。
初見の固有名詞に弱いです。
"sonetho.com"を"sonto.com"と書き、あるサンプルでは"11달러"(11ドル)を"1달러"(1ドル)と聞き間違えました。
数字がお金に直結する文書なら、どのエンジンでも検収は必須です。
v1とv2の違いも興味深いものでした。
v2は"22달러"(22ドル)を"$22"へ自動で表記正規化します。
私たちの採点方式(CER)では誤りとして集計されますが、意味としては正確な出力です。
表記の原形が重要ならv1、読みやすい字幕・文書が目的ならv2が正解です。
v2にはリアルタイムストリーミング版もあります。
💰 料金はどう違うのか
ElevenLabs Scribe:1時間あたり$0.22(バッチ基準)。
無料プランにも月4.5時間が含まれます。
$6のStarterは27時間、$22のCreatorは100時間込みなので、たいていの個人作業はプラン内で完結します。
CLOVA音声認識(CSR):15秒単位で切り上げ計算される従量課金制です。
正確な単価はNAVERクラウドの料金計算機で確認してください。
なおCSRは短い発話向けのAPIで、60秒の制限があります。
長い録音と話者分離が必要なら、別商品のCLOVA Speechを使う必要があります。
🤔 結局どちらを使えばいいのか
CLOVA CSRが合うケース
純粋な韓国語中心の短い発話処理。
韓国国内のクラウドインフラ要件があるプロジェクト。
すでにNAVERクラウドのエコシステムを使っているチーム。
ElevenLabs Scribeが合うケース
英語と韓国語が混ざるコンテンツの字幕・議事録。
ブランド名が頻出するIT・マーケティング音声。
まず無料の4.5時間で品質を自分の目で確かめてから決められます。
ElevenLabs Scribeを無料で始める →
🧪 測定方法(再現可能)
台本4部門(感情セリフ、ニュース調、英語・数字混じり、長文)を高品質TTS 2種(CLOVAのAra Pro、ElevenLabsのHyuk)で合成し、音声8本を作りました。
各音声を3エンジンに入力し、正解台本と文字単位で照合(CER)しました。
限界も明かしておきます。
入力がTTS合成音のためノイズのない理想条件であり、実際の人間の発話や騒音環境では数値が変わる可能性があります。
一部の誤りはTTS側の発音に起因する可能性もあります。
❓ よくある質問(FAQ)
Q. 韓国語STTで一番正確なのはどれですか?
今回の実測では、平均文字誤り率でScribe v1が3.2%と最も低い結果でした。
ただし純粋な韓国語のフォーマルな文体ではCLOVA CSRも0%台で互角なので、音声に英語が混ざるかどうかが選択基準になります。
Q. CLOVA音声認識(CSR)とCLOVA Speechは何が違いますか?
CSRは60秒以下の短い発話向けAPIで、CLOVA Speechは長い録音ファイルと話者分離に対応する別商品です。
今回のテストはCSR基準です。
Q. Scribe v1とv2、どちらを使うべきですか?
表記の原形保持が重要ならv1、通貨記号などの表記を自動で整えた読みやすい出力が目的ならv2です。
v2はリアルタイムストリーミング(1時間あたり$0.39)にも対応しています。
インタビュー文字起こしと話者分離の実戦編はElevenLabs vs Whisper vs Deepgram STT比較に続きます。
次の記事でまたお会いしましょう。Sonethoでした。⚡