Здравствуйте, это Sonetho. ⚡
"Корейскую речь всё-таки лучше распознаёт Naver, разве нет?"
Слышим это постоянно, но мало кто проверял на практике.
Поэтому мы измерили сами.
Одни и те же 8 корейских аудиозаписей прогнали через три движка и посимвольно сверили с эталонным текстом.
📊 Итоги вкратце (посимвольная ошибка CER, чем ниже, тем точнее)
| Категория | CLOVA CSR | Scribe v1 | Scribe v2 |
|---|---|---|---|
| Эмоциональные реплики | 3.2% | 1.1% | 1.1% |
| Чтение в новостном стиле | 0~0.8% | 0~0.8% | 0~0.8% |
| Смесь английского и цифр | 36.9~37.7% | 8.5~13.8% | 8.5~20.8% |
| Стабильность на длинных текстах | 1.7~7.3% | 0% | 0% |
| В среднем | 11.4% | 3.2% | 4.0% |
Начнём со слова в защиту CLOVA.
На чистом корейском CSR тоже показывает практически идеальный результат.
В новостном чтении все три движка держались около 0% и шли вровень.
Если смотреть только на этот участок, подойдёт любой из них.
🔬 Общие показатели по секторам (8 замеров)
Сводная таблица сгруппирована по диапазонам, поэтому здесь я привожу все 8 результатов.
Один и тот же текст был синтезирован двумя голосами для каждого теста.
| Категория | Исходный голос | CLOVA CSR | Scribe v1 | Scribe v2 |
|---|---|---|---|---|
| Эмоциональная речь | CLOVA Ara | 3.2% | 1.1% | 1.1% |
| Эмоциональная речь | ElevenLabs Hyuk | 3.2% | 1.1% | 1.1% |
| Новостной стиль | CLOVA Ara | 0% | 0% | 0% |
| Новостной стиль | ElevenLabs Hyuk | 0.8% | 0.8% | 0.8% |
| Смесь английского и цифр | CLOVA Ara | 36.9% | 13.8% | 20.8% |
| Смесь английского и цифр | ElevenLabs Hyuk | 37.7% | 8.5% | 8.5% |
| Связность длинных текстов | CLOVA Ara | 7.3% | 0% | 0% |
| Связность длинных текстов | ElevenLabs Hyuk | 1.7% | 0% | 0% |
💥 Всё решила смесь с английским
Стоило в корейских фразах появиться названиям брендов и цифрам, как разрыв резко вырос.
Вот несколько реальных выводов CSR, приводим их без правок.
| Эталон | Вывод CLOVA CSR |
|---|---|
| ChatGPT | "채취 pt" |
| Gemini | "나재민이", "개 미니" |
| 일레븐랩스 (ElevenLabs по-корейски) | "11 x" |
| 약 15달러 수준 ("примерно 15 долларов") | "약 시부터 여수 중" |
Для субтитров YouTube, IT-контента и современных протоколов встреч, где постоянно мелькают английские слова, эта разница напрямую превращается в объём ручной работы.
Scribe на тех же участках сохранил ChatGPT, Gemini и API в исходном виде.
🎧 Исходный аудиофайл и расшифровка
Одни лишь цифры не дают полной картины.
Я выкладываю аудио, содержащее смешанную английскую речь, чтобы вы могли послушать.
Сравните его с расшифровками ниже.
Аудио, прочитанное CLOVA Ara
Эталонный текст
일레븐랩스의 Creator 플랜은 월 22달러지만, 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고, 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 sonetho.com에서 확인하세요.
CLOVA CSR (ошибка 36.9%)
11 x의 크리에이터 플랜은 월 22 달라지는 첫달은 50% 할인된 11달러에 시작할 수 있습니다 채취 pt 나재민이 같은 ai 툴과 연동 하면 활용 폭이 넓어지고 2026년 7월 기준 api 요금은 100만장 약 시부터 여수 중입니다 자세한 내용은 선 투 닷컴에서 확인하세요
Scribe v1 (ошибка 13.8%)
일레븐웹스의 크리에이터 플랜은 월 $22지만 첫 달은 50% 할인된 $11에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 $15 수준입니다. 자세한 내용은 son토.com에서 확인하세요.
Scribe v2 (ошибка 20.8%)
일레븐랩스의 크리에이터 플랜은 월 22달러지만 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. 챗GPT나 제미니 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 소토닷컴에서 확인하세요.
Здесь важно сделать уточнение.
У v2 показатель хуже, чем у v1, хотя фактически модель справилась лучше.
v1 ошиблась в названии бренда, написав "일레븐웹스", а v2 верно указала "일레븐랩스".
В сумме v1 преобразовала символ в $22, а v2 корректно сохранила оригинал "22달러".
Однако v2 записала ChatGPT как "챗GPT", а Gemini как "제미니", транслитерировав их на хангыль.
При оценке посимвольной точности (CER) это засчиталось как ошибка, что привело к 20.8%.
Вывод о превосходстве v1 только на основе оценки был бы ошибочным.
🎙️ Уровень ошибок различается в 4 раза в зависимости от голоса при чтении одной и той же фразы
Я столкнулся с неожиданным результатом.
Для длинных фрагментов текста исходный сценарий был идентичен.
Однако частота ошибок CER при использовании голоса CLOVA составила 7.3%, а при использовании голоса ElevenLabs , 1.7%.
Разница в 4 раза возникла не из-за распознавателя, а из-за самого голоса диктора.
Scribe в обоих случаях показал результат 0%.
Длинный фрагмент в исполнении CLOVA Ara
Длинный фрагмент в исполнении ElevenLabs Hyuk
Проблемы возникли в конце предложения.
Правильный текст выглядит так: "어제보다 오늘 더 자연스러워지고 있다는 것만은 분명합니다".
В случае с голосом CLOVA система CSR распознала его как "있다는것만 있는 영화".
При тех же условиях для голоса ElevenLabs система CSR точно определила текст: "있다는것만은 분명합니다".
Фрагмент "근본적으로 바꾸고 있습니다", содержащий "있습니다", был полностью пропущен только при обработке записи с голосом CLOVA.
Вот что это означает для реальной работы:
Оценка точности STT только лишь заменой движка распознавания дает лишь частичную картину.
Произношение и интонации во входном аудио сильно влияют на результат.
При выборе внутреннего инструмента тестируйте его на голосах тех спикеров, которые будут использоваться в реальности.
🧐 Scribe тоже оказался не идеален
Честно покажем и ошибки Scribe.
Он слаб на именах собственных, которые видит впервые.
"sonetho.com" он записал как "sonto.com", а в одном сэмпле расслышал "11달러" (11 долларов) как "1달러" (1 доллар).
Если цифры в документе напрямую связаны с деньгами, вычитка обязательна при любом движке.
Разница между v1 и v2 тоже оказалась любопытной.
v2 сам нормализует запись: "22달러" превращается в "$22".
По нашей методике подсчёта (CER) это засчитывается как ошибка, хотя по смыслу вывод точный.
Если важна исходная форма записи, выбирайте v1; если нужны удобочитаемые субтитры и документы, берите v2.
У v2 есть и версия с потоковым распознаванием в реальном времени.
💰 Сколько это стоит
ElevenLabs Scribe: $0.22 за час (в пакетном режиме).
Даже бесплатный план включает 4,5 часа в месяц.
Starter за $6 даёт 27 часов, Creator за $22 даёт 100 часов, так что большинство личных задач укладывается в рамки плана.
CLOVA Speech Recognition (CSR): оплата по факту использования, тарификация блоками по 15 секунд с округлением вверх.
Точные расценки смотрите в калькуляторе стоимости Naver Cloud.
Учтите, что CSR рассчитан на короткие фразы: у API действует лимит в 60 секунд.
Для длинных записей и разделения спикеров понадобится отдельный продукт CLOVA Speech.
🤔 Так что же выбрать
CLOVA CSR подойдёт, если
вы обрабатываете короткие фразы преимущественно на чистом корейском.
проекту нужна облачная инфраструктура на территории Кореи.
команда уже работает в экосистеме Naver Cloud.
ElevenLabs Scribe подойдёт, если
вы делаете субтитры или протоколы для контента со смесью английского и корейского.
в аудио часто звучат названия брендов: IT, маркетинг и подобные темы.
Бесплатные 4,5 часа позволяют сначала самому проверить качество и только потом решать.
Попробовать ElevenLabs Scribe бесплатно →
🧪 Как мы измеряли (воспроизводимо)
Четыре категории сценариев (эмоциональные реплики, новостной стиль, смесь английского и цифр, длинные тексты) мы озвучили двумя качественными TTS-голосами (CLOVA Ara Pro и ElevenLabs Hyuk) и получили 8 аудиофайлов.
Каждый файл прогнали через три движка и посимвольно сверили с эталонным текстом (CER).
Честно скажем и об ограничениях.
На входе синтезированная TTS-речь, то есть идеальные условия без шума; на живой человеческой речи и в шумной обстановке цифры могут отличаться.
Часть ошибок могла возникнуть и из-за произношения самих TTS-голосов.
❓ Частые вопросы (FAQ)
Q. Какой STT самый точный для корейского языка?
В нашем замере лучший средний результат показал Scribe v1: 3.2% посимвольной ошибки.
Однако на чистом формальном корейском CLOVA CSR тоже держится около 0% и идёт вровень, так что главный критерий выбора: есть ли в аудио английский.
Q. Чем CLOVA Speech Recognition (CSR) отличается от CLOVA Speech?
CSR предназначен для коротких фраз до 60 секунд, а CLOVA Speech продаётся отдельно и поддерживает длинные записи и разделение спикеров.
Этот тест проводился на CSR.
Q. Что выбрать: Scribe v1 или v2?
v1, если важно сохранить написание в исходном виде; v2, если нужен удобочитаемый вывод, где обозначения вроде валютных символов приводятся в порядок автоматически.
v2 также поддерживает потоковое распознавание в реальном времени ($0.39 за час).
Практика расшифровки интервью и разделения спикеров продолжается в сравнении STT: ElevenLabs vs Whisper vs Deepgram.
До встречи в следующей статье. С вами был Sonetho. ⚡