STT en coreano puesto a prueba: CLOVA de Naver vs ElevenLabs Scribe, el mismo audio 24 veces

Metimos los mismos 8 audios en coreano en el reconocimiento de voz CLOVA de Naver (CSR) y en Scribe v1 y v2 de ElevenLabs, y medimos la tasa de error de caracteres (CER). En coreano puro, empate técnico; con inglés mezclado, una diferencia de 4x. Datos en bruto incluidos.

Hola, aquí Sonetho. ⚡

 

"Para el coreano, el reconocimiento de voz de Naver es mejor, ¿no?"
Se dice mucho, pero casi nadie lo ha medido de verdad.
Así que lo medimos nosotros.
Metimos los mismos 8 audios en coreano en tres motores y comparamos el resultado carácter a carácter con el guion original.

 

📊 Resumen de resultados (tasa de error de caracteres CER, menor es mejor)

CategoríaCLOVA CSRScribe v1Scribe v2
Diálogo emocional3.2%1.1%1.1%
Lectura estilo noticiero0~0.8%0~0.8%0~0.8%
Mezcla de inglés y números36.9~37.7%8.5~13.8%8.5~20.8%
Consistencia en textos largos1.7~7.3%0%0%
Promedio11.4%3.2%4.0%

 

Primero, algo a favor de CLOVA.
En coreano puro, CSR también roza la nota perfecta.
En la lectura estilo noticiero, los tres motores empataron con cifras en la franja del 0%.
Si solo necesitas ese escenario, cualquiera te sirve.

 

🔬 Mediciones globales por sección (8 pruebas)

He agrupado los resultados en rangos, así que aquí presento las 8 pruebas al completo.
Cada guion fue sintetizado con dos voces distintas para cada caso.

 

CategoríaVoz de origenCLOVA CSRScribe v1Scribe v2
Diálogo emocionalCLOVA Ara3.2%1.1%1.1%
Diálogo emocionalElevenLabs Hyuk3.2%1.1%1.1%
Lectura estilo noticiasCLOVA Ara0%0%0%
Lectura estilo noticiasElevenLabs Hyuk0.8%0.8%0.8%
Mezcla de inglés y númerosCLOVA Ara36.9%13.8%20.8%
Mezcla de inglés y númerosElevenLabs Hyuk37.7%8.5%8.5%
Consistencia en textos largosCLOVA Ara7.3%0%0%
Consistencia en textos largosElevenLabs Hyuk1.7%0%0%

 

💥 La batalla se decidió en la mezcla con inglés

En cuanto aparecen marcas y números dentro de frases en coreano, la brecha se dispara.
Copiamos tal cual algunas salidas reales de CSR.

 

Texto correctoSalida de CLOVA CSR
ChatGPT"채취 pt" (sílabas coreanas sin sentido más "pt")
Gemini"나재민이", "개 미니" (suena a nombre coreano; "mini perro")
일레븐랩스 (ElevenLabs en coreano)"11 x"
약 15달러 수준 ("unos 15 dólares" en coreano)"약 시부터 여수 중" (secuencia coreana sin sentido)

 

Si trabajas con subtítulos de YouTube, contenido tech o actas de reuniones de hoy en día, donde el inglés se cuela constantemente, esa diferencia se convierte directamente en horas de corrección.
Scribe conservó intactos ChatGPT, Gemini y API en esos mismos tramos.

 

🎧 Audio original y transcripción completa

Los números por sí solos no dicen mucho.
Aquí comparto el audio real que incluía inglés mezclado.
Escúchenlo y compárenlo con las transcripciones que aparecen debajo.

 

Audio leído por CLOVA Ara

 

Script original (referencia)
일레븐랩스의 Creator 플랜은 월 22달러지만, 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고, 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 sonetho.com에서 확인하세요.

 

CLOVA CSR (CER 36.9%)
11 x의 크리에이터 플랜은 월 22 달라지는 첫달은 50% 할인된 11달러에 시작할 수 있습니다 채취 pt 나재민이 같은 ai 툴과 연동 하면 활용 폭이 넓어지고 2026년 7월 기준 api 요금은 100만장 약 시부터 여수 중입니다 자세한 내용은 선 투 닷컴에서 확인하세요

 

Scribe v1 (CER 13.8%)
일레븐웹스의 크리에이터 플랜은 월 $22지만 첫 달은 50% 할인된 $11에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 $15 수준입니다. 자세한 내용은 son토.com에서 확인하세요.

 

Scribe v2 (CER 20.8%)
일레븐랩스의 크리에이터 플랜은 월 22달러지만 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. 챗GPT나 제미니 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 소토닷컴에서 확인하세요.

 

Hay algo importante que señalar aquí.
Aunque la v2 tiene peor puntuación que la v1, en realidad comprendió mejor el contexto.
La v1 se equivocó con el nombre de la marca como "일레븐웹스", mientras que la v2 acertó al escribir "일레븐랩스".
Respecto al importe, la v1 convirtió el símbolo a $22, pero la v2 lo mantuvo tal cual, "22달러".
Sin embargo, la v2 transcribió fonéticamente ChatGPT como "챗GPT" y Gemini como "제미니".
Como el cálculo de CER se basa en caracteres, todo eso se registró como error, resultando en un 20.8%.
No sería correcto concluir que la v1 es mejor basándose únicamente en la puntuación.

 

🎙️ La tasa de error varía 4 veces según la voz, incluso con el mismo texto

Hubo un resultado inesperado.
El guion es exactamente el mismo en las secciones de formato largo.
Sin embargo, en el audio leído con la voz de CLOVA, la tasa de error CER de CSR fue del 7.3%, mientras que en el lado leído con la voz de ElevenLabs fue del 1.7%.
La diferencia de 4 veces no se debió al reconocedor, sino a la voz utilizada para la lectura.
Scribe obtuvo un 0% en ambos audios.

 

Texto largo leído por CLOVA Ara

 

Texto largo leído por ElevenLabs Hyuk

 

El fallo ocurrió al final de la oración.
El guion correcto es "어제보다 오늘 더 자연스러워지고 있다는 것만은 분명합니다".
En la voz de CLOVA, el CSR transcribió esto como "있다는것만 있는 영화".
En la misma posición, el CSR con la voz de ElevenLabs lo registró correctamente como "있다는것만은 분명합니다".
Además, "있습니다" de "근본적으로 바꾸고 있습니다" en el medio también se omitió por completo solo en la voz de CLOVA.

 

Esto es lo que significa en la práctica:
Al medir la precisión de STT, solo evaluar el motor de reconocimiento es insuficiente.
La pronunciación y la respiración del audio de entrada alteran los resultados considerablemente.
Al elegir herramientas internas, debe realizar las mediciones con la voz del hablante que se utilizará realmente.

 

🧐 Scribe tampoco fue perfecto

Siendo honestos, publicamos también los fallos de Scribe.
Flaquea con nombres propios que ve por primera vez.
Escribió "sonetho.com" como "sonto.com" y, en una muestra, entendió "11 dólares" como "1 dólar".
Si los números tocan dinero, la revisión es obligatoria con cualquier motor.

 

La diferencia entre v1 y v2 también dio que hablar.
v2 normaliza la escritura por su cuenta: "22 dólares" pasa a "$22".
Con nuestro método de puntuación (CER) cuenta como error, pero el significado es correcto.
Si te importa la forma literal, v1; si buscas subtítulos y documentos fáciles de leer, v2.
v2 además tiene versión de streaming en tiempo real.

 

💰 ¿Y los precios?

ElevenLabs Scribe: $0.22 por hora (en modo batch).
El plan gratuito ya incluye 4.5 horas al mes.
El Starter de $6 incluye 27 horas y el Creator de $22, 100 horas, así que la mayoría de los proyectos personales caben dentro del plan.

 

CLOVA Speech Recognition (CSR): pago por uso, facturado en bloques de 15 segundos redondeados hacia arriba.
Consulta la tarifa exacta en la calculadora de precios de Naver Cloud.
Ojo: CSR es una API para locuciones cortas y tiene un límite de 60 segundos.
Para grabaciones largas y separación de hablantes necesitas otro producto, CLOVA Speech.

 

🤔 Entonces, ¿cuál elijo?

CLOVA CSR encaja si
Procesas locuciones cortas casi 100% en coreano.
Tu proyecto exige infraestructura cloud en Corea.
Tu equipo ya vive en el ecosistema de Naver Cloud.

 

ElevenLabs Scribe encaja si
Haces subtítulos o actas de contenido que mezcla inglés y coreano.
Trabajas con audio de IT o marketing lleno de nombres de marca.
Con las 4.5 horas gratis puedes comprobar la calidad tú mismo antes de decidir.

 

Probar ElevenLabs Scribe gratis →

 

🧪 Metodología (reproducible)

Sintetizamos guiones de 4 categorías (diálogo emocional, estilo noticiero, mezcla de inglés y números, texto largo) con dos TTS de alta calidad (Ara Pro de CLOVA y Hyuk de ElevenLabs) para crear 8 audios.
Cada audio pasó por los tres motores y se comparó carácter a carácter con el guion original (CER).
También contamos las limitaciones.
La entrada es voz sintética sin ruido, condiciones ideales, así que con voces humanas reales o entornos ruidosos las cifras pueden variar.
Algunos errores podrían venir de la propia pronunciación del TTS.

 

❓ Preguntas frecuentes (FAQ)

Q. ¿Cuál es el STT más preciso para coreano?
En esta medición, Scribe v1 tuvo la tasa media de error de caracteres más baja: 3.2%.
Eso sí, en coreano puro y formal CLOVA CSR empata en la franja del 0%, así que el criterio real es si tu audio mezcla inglés.

 

Q. ¿En qué se diferencian CLOVA Speech Recognition (CSR) y CLOVA Speech?
CSR es una API para locuciones cortas de hasta 60 segundos; CLOVA Speech es un producto aparte que admite grabaciones largas y separación de hablantes.
Este test se hizo con CSR.

 

Q. ¿Scribe v1 o v2?
Si necesitas conservar la forma literal del texto, v1; si buscas una salida legible que normaliza por sí sola cosas como los símbolos de moneda, v2.
v2 también admite streaming en tiempo real ($0.39 por hora).

 

La parte práctica de transcripción de entrevistas y separación de hablantes continúa en la comparativa de STT: ElevenLabs vs Whisper vs Deepgram.
Nos vemos en el próximo artículo. Aquí Sonetho. ⚡