Точность корейского STT в реальном тесте: CLOVA против ElevenLabs Scribe, 24 прогона одних и тех же аудио

Мы прогнали одни и те же 8 корейских аудиозаписей через Naver CLOVA Speech Recognition (CSR) и ElevenLabs Scribe v1 и v2 и измерили посимвольную ошибку (CER). На чистом корейском практически ничья, а на смеси с английским разница в 4 раза. Исходные данные открыты.

Здравствуйте, это Sonetho. ⚡

 

"Корейскую речь всё-таки лучше распознаёт Naver, разве нет?"
Слышим это постоянно, но мало кто проверял на практике.
Поэтому мы измерили сами.
Одни и те же 8 корейских аудиозаписей прогнали через три движка и посимвольно сверили с эталонным текстом.

 

📊 Итоги вкратце (посимвольная ошибка CER, чем ниже, тем точнее)

КатегорияCLOVA CSRScribe v1Scribe v2
Эмоциональные реплики3.2%1.1%1.1%
Чтение в новостном стиле0~0.8%0~0.8%0~0.8%
Смесь английского и цифр36.9~37.7%8.5~13.8%8.5~20.8%
Стабильность на длинных текстах1.7~7.3%0%0%
В среднем11.4%3.2%4.0%

 

Начнём со слова в защиту CLOVA.
На чистом корейском CSR тоже показывает практически идеальный результат.
В новостном чтении все три движка держались около 0% и шли вровень.
Если смотреть только на этот участок, подойдёт любой из них.

 

🔬 Общие показатели по секторам (8 замеров)

Сводная таблица сгруппирована по диапазонам, поэтому здесь я привожу все 8 результатов.
Один и тот же текст был синтезирован двумя голосами для каждого теста.

 

КатегорияИсходный голосCLOVA CSRScribe v1Scribe v2
Эмоциональная речьCLOVA Ara3.2%1.1%1.1%
Эмоциональная речьElevenLabs Hyuk3.2%1.1%1.1%
Новостной стильCLOVA Ara0%0%0%
Новостной стильElevenLabs Hyuk0.8%0.8%0.8%
Смесь английского и цифрCLOVA Ara36.9%13.8%20.8%
Смесь английского и цифрElevenLabs Hyuk37.7%8.5%8.5%
Связность длинных текстовCLOVA Ara7.3%0%0%
Связность длинных текстовElevenLabs Hyuk1.7%0%0%

 

💥 Всё решила смесь с английским

Стоило в корейских фразах появиться названиям брендов и цифрам, как разрыв резко вырос.
Вот несколько реальных выводов CSR, приводим их без правок.

 

ЭталонВывод CLOVA CSR
ChatGPT"채취 pt"
Gemini"나재민이", "개 미니"
일레븐랩스 (ElevenLabs по-корейски)"11 x"
약 15달러 수준 ("примерно 15 долларов")"약 시부터 여수 중"

 

Для субтитров YouTube, IT-контента и современных протоколов встреч, где постоянно мелькают английские слова, эта разница напрямую превращается в объём ручной работы.
Scribe на тех же участках сохранил ChatGPT, Gemini и API в исходном виде.

 

🎧 Исходный аудиофайл и расшифровка

Одни лишь цифры не дают полной картины.
Я выкладываю аудио, содержащее смешанную английскую речь, чтобы вы могли послушать.
Сравните его с расшифровками ниже.

 

Аудио, прочитанное CLOVA Ara

 

Эталонный текст
일레븐랩스의 Creator 플랜은 월 22달러지만, 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고, 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 sonetho.com에서 확인하세요.

 

CLOVA CSR (ошибка 36.9%)
11 x의 크리에이터 플랜은 월 22 달라지는 첫달은 50% 할인된 11달러에 시작할 수 있습니다 채취 pt 나재민이 같은 ai 툴과 연동 하면 활용 폭이 넓어지고 2026년 7월 기준 api 요금은 100만장 약 시부터 여수 중입니다 자세한 내용은 선 투 닷컴에서 확인하세요

 

Scribe v1 (ошибка 13.8%)
일레븐웹스의 크리에이터 플랜은 월 $22지만 첫 달은 50% 할인된 $11에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 $15 수준입니다. 자세한 내용은 son토.com에서 확인하세요.

 

Scribe v2 (ошибка 20.8%)
일레븐랩스의 크리에이터 플랜은 월 22달러지만 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. 챗GPT나 제미니 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 소토닷컴에서 확인하세요.

 

Здесь важно сделать уточнение.
У v2 показатель хуже, чем у v1, хотя фактически модель справилась лучше.
v1 ошиблась в названии бренда, написав "일레븐웹스", а v2 верно указала "일레븐랩스".
В сумме v1 преобразовала символ в $22, а v2 корректно сохранила оригинал "22달러".
Однако v2 записала ChatGPT как "챗GPT", а Gemini как "제미니", транслитерировав их на хангыль.
При оценке посимвольной точности (CER) это засчиталось как ошибка, что привело к 20.8%.
Вывод о превосходстве v1 только на основе оценки был бы ошибочным.

 

🎙️ Уровень ошибок различается в 4 раза в зависимости от голоса при чтении одной и той же фразы

Я столкнулся с неожиданным результатом.
Для длинных фрагментов текста исходный сценарий был идентичен.
Однако частота ошибок CER при использовании голоса CLOVA составила 7.3%, а при использовании голоса ElevenLabs , 1.7%.
Разница в 4 раза возникла не из-за распознавателя, а из-за самого голоса диктора.
Scribe в обоих случаях показал результат 0%.

 

Длинный фрагмент в исполнении CLOVA Ara

 

Длинный фрагмент в исполнении ElevenLabs Hyuk

 

Проблемы возникли в конце предложения.
Правильный текст выглядит так: "어제보다 오늘 더 자연스러워지고 있다는 것만은 분명합니다".
В случае с голосом CLOVA система CSR распознала его как "있다는것만 있는 영화".
При тех же условиях для голоса ElevenLabs система CSR точно определила текст: "있다는것만은 분명합니다".
Фрагмент "근본적으로 바꾸고 있습니다", содержащий "있습니다", был полностью пропущен только при обработке записи с голосом CLOVA.

 

Вот что это означает для реальной работы:
Оценка точности STT только лишь заменой движка распознавания дает лишь частичную картину.
Произношение и интонации во входном аудио сильно влияют на результат.
При выборе внутреннего инструмента тестируйте его на голосах тех спикеров, которые будут использоваться в реальности.

 

🧐 Scribe тоже оказался не идеален

Честно покажем и ошибки Scribe.
Он слаб на именах собственных, которые видит впервые.
"sonetho.com" он записал как "sonto.com", а в одном сэмпле расслышал "11달러" (11 долларов) как "1달러" (1 доллар).
Если цифры в документе напрямую связаны с деньгами, вычитка обязательна при любом движке.

 

Разница между v1 и v2 тоже оказалась любопытной.
v2 сам нормализует запись: "22달러" превращается в "$22".
По нашей методике подсчёта (CER) это засчитывается как ошибка, хотя по смыслу вывод точный.
Если важна исходная форма записи, выбирайте v1; если нужны удобочитаемые субтитры и документы, берите v2.
У v2 есть и версия с потоковым распознаванием в реальном времени.

 

💰 Сколько это стоит

ElevenLabs Scribe: $0.22 за час (в пакетном режиме).
Даже бесплатный план включает 4,5 часа в месяц.
Starter за $6 даёт 27 часов, Creator за $22 даёт 100 часов, так что большинство личных задач укладывается в рамки плана.

 

CLOVA Speech Recognition (CSR): оплата по факту использования, тарификация блоками по 15 секунд с округлением вверх.
Точные расценки смотрите в калькуляторе стоимости Naver Cloud.
Учтите, что CSR рассчитан на короткие фразы: у API действует лимит в 60 секунд.
Для длинных записей и разделения спикеров понадобится отдельный продукт CLOVA Speech.

 

🤔 Так что же выбрать

CLOVA CSR подойдёт, если
вы обрабатываете короткие фразы преимущественно на чистом корейском.
проекту нужна облачная инфраструктура на территории Кореи.
команда уже работает в экосистеме Naver Cloud.

 

ElevenLabs Scribe подойдёт, если
вы делаете субтитры или протоколы для контента со смесью английского и корейского.
в аудио часто звучат названия брендов: IT, маркетинг и подобные темы.
Бесплатные 4,5 часа позволяют сначала самому проверить качество и только потом решать.

 

Попробовать ElevenLabs Scribe бесплатно →

 

🧪 Как мы измеряли (воспроизводимо)

Четыре категории сценариев (эмоциональные реплики, новостной стиль, смесь английского и цифр, длинные тексты) мы озвучили двумя качественными TTS-голосами (CLOVA Ara Pro и ElevenLabs Hyuk) и получили 8 аудиофайлов.
Каждый файл прогнали через три движка и посимвольно сверили с эталонным текстом (CER).
Честно скажем и об ограничениях.
На входе синтезированная TTS-речь, то есть идеальные условия без шума; на живой человеческой речи и в шумной обстановке цифры могут отличаться.
Часть ошибок могла возникнуть и из-за произношения самих TTS-голосов.

 

❓ Частые вопросы (FAQ)

Q. Какой STT самый точный для корейского языка?
В нашем замере лучший средний результат показал Scribe v1: 3.2% посимвольной ошибки.
Однако на чистом формальном корейском CLOVA CSR тоже держится около 0% и идёт вровень, так что главный критерий выбора: есть ли в аудио английский.

 

Q. Чем CLOVA Speech Recognition (CSR) отличается от CLOVA Speech?
CSR предназначен для коротких фраз до 60 секунд, а CLOVA Speech продаётся отдельно и поддерживает длинные записи и разделение спикеров.
Этот тест проводился на CSR.

 

Q. Что выбрать: Scribe v1 или v2?
v1, если важно сохранить написание в исходном виде; v2, если нужен удобочитаемый вывод, где обозначения вроде валютных символов приводятся в порядок автоматически.
v2 также поддерживает потоковое распознавание в реальном времени ($0.39 за час).

 

Практика расшифровки интервью и разделения спикеров продолжается в сравнении STT: ElevenLabs vs Whisper vs Deepgram.
До встречи в следующей статье. С вами был Sonetho. ⚡