Bonjour, ici Sonetho. ⚡
« Pour le coréen, la reconnaissance vocale de Naver reste la meilleure, non ? »
On entend souvent cette phrase, mais rares sont ceux qui ont vraiment vérifié.
Alors nous avons mesuré nous-mêmes.
Les mêmes 8 audios coréens dans trois moteurs, comparés caractère par caractère à la transcription de référence.
📊 Résultats en bref (taux d'erreur caractère CER, plus c'est bas, plus c'est précis)
| Catégorie | Clova CSR | Scribe v1 | Scribe v2 |
|---|---|---|---|
| Répliques émotionnelles | 3.2% | 1.1% | 1.1% |
| Lecture style journal télévisé | 0~0.8% | 0~0.8% | 0~0.8% |
| Mélange anglais et chiffres | 36.9~37.7% | 8.5~13.8% | 8.5~20.8% |
| Cohérence sur texte long | 1.7~7.3% | 0% | 0% |
| Moyenne | 11.4% | 3.2% | 4.0% |
Commençons par rendre justice à Clova.
Sur du coréen pur, le CSR frôle lui aussi le sans-faute.
En lecture style journal télévisé, les trois moteurs étaient à égalité, autour de 0%.
Si votre usage s'arrête là, n'importe lequel fera l'affaire.
🔬 Mesures globales par segment (8 essais)
Le tableau récapitulatif ayant regroupé les plages, voici les 8 essais détaillés.
Le même script a été synthétisé avec deux voix distinctes, intégrées ici.
| Catégorie | Voix source | CLOVA CSR | Scribe v1 | Scribe v2 |
|---|---|---|---|---|
| Dialogues émotionnels | CLOVA Ara | 3.2% | 1.1% | 1.1% |
| Dialogues émotionnels | ElevenLabs Hyuk | 3.2% | 1.1% | 1.1% |
| Lecture type journal | CLOVA Ara | 0% | 0% | 0% |
| Lecture type journal | ElevenLabs Hyuk | 0.8% | 0.8% | 0.8% |
| Mélange anglais/chiffres | CLOVA Ara | 36.9% | 13.8% | 20.8% |
| Mélange anglais/chiffres | ElevenLabs Hyuk | 37.7% | 8.5% | 8.5% |
| Cohérence long format | CLOVA Ara | 7.3% | 0% | 0% |
| Cohérence long format | ElevenLabs Hyuk | 1.7% | 0% | 0% |
💥 Le match s'est joué sur le mélange avec l'anglais
Dès qu'une phrase coréenne contient des noms de marques et des chiffres, l'écart se creuse.
Voici quelques sorties réelles du CSR, reproduites telles quelles.
| Référence | Sortie Clova CSR |
|---|---|
| ChatGPT | "채취 pt" |
| Gemini | "나재민이", "개 미니" |
| 일레븐랩스 (ElevenLabs en coréen) | "11 x" |
| 약 15달러 수준 (environ 15 dollars) | "약 시부터 여수 중" |
Sous-titres YouTube, contenus tech, comptes rendus de réunion d'aujourd'hui : dès que des mots anglais se glissent dans l'audio, cet écart se transforme directement en heures de correction.
Sur les mêmes passages, Scribe a conservé ChatGPT, Gemini et API à l'identique.
🎧 Audio source et transcription intégrale
Les chiffres seuls ne disent pas tout.
Voici les fichiers audio réels incluant des termes en anglais que j'ai utilisés pour le test.
Écoutez-les tout en comparant avec les transcriptions ci-dessous.
Audio lu par CLOVA Ara
Script de référence (original)
일레븐랩스의 Creator 플랜은 월 22달러지만, 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고, 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 sonetho.com에서 확인하세요.
CLOVA CSR (taux d'erreur de 36,9%)
11 x의 크리에이터 플랜은 월 22 달라지는 첫달은 50% 할인된 11달러에 시작할 수 있습니다 채취 pt 나재민이 같은 ai 툴과 연동 하면 활용 폭이 넓어지고 2026년 7월 기준 api 요금은 100만장 약 시부터 여수 중입니다 자세한 내용은 선 투 닷컴에서 확인하세요
Scribe v1 (taux d'erreur de 13,8%)
일레븐웹스의 크리에이터 플랜은 월 $22지만 첫 달은 50% 할인된 $11에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 $15 수준입니다. 자세한 내용은 son토.com에서 확인하세요.
Scribe v2 (taux d'erreur de 20,8%)
일레븐랩스의 크리에이터 플랜은 월 22달러지만 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. 챗GPT나 제미니 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 소토닷컴에서 확인하세요.
Il y a un point important à souligner ici.
Bien que la v2 affiche un score inférieur à la v1, elle a en réalité mieux compris le texte.
La v1 a mal retranscrit le nom de marque en "일레븐웹스", tandis que la v2 l'a correctement identifié comme "일레븐랩스".
Concernant le prix, la v1 a converti le montant en 22$, alors que la v2 a conservé la mention originale "22달러".
Cependant, la v2 a transcrit phonétiquement ChatGPT en "챗GPT" et Gemini en "제미니".
Dans le calcul du taux d'erreur par caractère (CER), ces variantes ont été comptabilisées comme des erreurs, faisant grimper le taux à 20,8%.
Il serait donc incorrect de conclure que la v1 est supérieure en se basant uniquement sur le score.
🎙️ Un taux d'erreur quatre fois plus élevé selon la voix utilisée pour la même phrase
J'ai obtenu un résultat inattendu.
Le script pour les segments longs est identique.
Pourtant, avec la voix CLOVA, le taux d'erreur CER de CSR était de 7,3 %, contre 1,7 % avec la voix ElevenLabs.
La différence de taux d'erreur par quatre ne vient pas de l'outil de reconnaissance, mais de la voix utilisée pour la lecture.
Scribe a obtenu un score de 0 % pour les deux enregistrements.
Segment long lu par CLOVA Ara
Segment long lu par ElevenLabs Hyuk
Les erreurs se produisent en fin de phrase.
Le script de référence est "어제보다 오늘 더 자연스러워지고 있다는 것만은 분명합니다".
Avec la voix CLOVA, CSR a transcrit cela par "있다는것만 있는 영화".
Au même endroit, le CSR avec la voix ElevenLabs a correctement retranscrit "있다는것만은 분명합니다".
De plus, le segment "근본적으로 바꾸고 있습니다" de "있습니다" a été entièrement omis uniquement avec la voix CLOVA.
Voici ce que cela signifie en pratique.
Pour mesurer la précision STT, se contenter de tester différents moteurs ne donne qu'une vision partielle des choses.
La prononciation et le souffle de l'audio en entrée influencent considérablement les résultats.
Lors du choix de vos outils internes, vous devez impérativement effectuer les tests avec la voix du locuteur qui sera réellement utilisé.
🧐 Scribe n'est pas parfait non plus
Par honnêteté, voici aussi les erreurs de Scribe.
Il pèche sur les noms propres qu'il rencontre pour la première fois.
Il a écrit « sonto.com » au lieu de « sonetho.com », et sur un échantillon il a entendu « 1 dollar » au lieu de « 11 dollars ».
Si les chiffres engagent de l'argent, la relecture reste indispensable, quel que soit le moteur.
La différence entre v1 et v2 mérite aussi le détour.
La v2 normalise l'écriture d'elle-même : « 22 dollars » devient « $22 ».
Notre méthode de notation (CER) compte cela comme une erreur, alors que le sens est parfaitement juste.
Si la forme d'origine est essentielle, prenez la v1 ; si l'objectif est un sous-titre ou un document agréable à lire, la v2 s'impose.
La v2 existe aussi en version streaming temps réel.
💰 Et côté tarifs ?
ElevenLabs Scribe : $0.22 de l'heure (en traitement par lots).
Le plan gratuit inclut déjà 4,5 heures par mois.
Le Starter à $6 en comprend 27 et le Creator à $22 en comprend 100 : la plupart des projets personnels tiennent dans le plan.
Reconnaissance vocale Clova (CSR) : facturation à l'usage, arrondie par tranches de 15 secondes.
Pour le tarif exact, consultez le calculateur de prix de Naver Cloud.
À noter : le CSR est une API pensée pour les énoncés courts, avec une limite de 60 secondes.
Pour les enregistrements longs et la séparation des locuteurs, il faut un produit distinct, CLOVA Speech.
🤔 Alors, lequel choisir ?
Clova CSR est le bon choix pour
Traiter des énoncés courts, essentiellement en coréen pur.
Un projet qui exige une infrastructure cloud hébergée en Corée.
Une équipe déjà installée dans l'écosystème Naver Cloud.
ElevenLabs Scribe est le bon choix pour
Les sous-titres et comptes rendus de contenus où l'anglais se mêle au coréen.
Les audios tech et marketing truffés de noms de marques.
Les 4,5 heures gratuites permettent de juger la qualité par vous-même avant de décider.
Essayer ElevenLabs Scribe gratuitement →
🧪 Méthodologie (reproductible)
Nous avons rédigé des scripts dans 4 catégories (répliques émotionnelles, style journal, mélange anglais et chiffres, texte long), puis nous les avons synthétisés avec deux TTS haut de gamme (Clova Ara Pro et ElevenLabs Hyuk) pour obtenir 8 audios.
Chaque audio est passé dans les trois moteurs, puis comparé caractère par caractère à la transcription de référence (CER).
Les limites, sans détour.
L'entrée étant de la voix de synthèse, les conditions sont idéales et sans bruit ; avec de vraies voix humaines ou en environnement bruyant, les chiffres peuvent bouger.
Certaines erreurs peuvent aussi venir de la prononciation du TTS lui-même.
❓ Questions fréquentes (FAQ)
Q. Quel est le STT le plus précis pour le coréen ?
Dans notre mesure, Scribe v1 affiche le taux d'erreur caractère moyen le plus bas, à 3.2%.
Mais sur du coréen pur en registre formel, Clova CSR fait jeu égal autour de 0% : le vrai critère de choix, c'est la présence d'anglais dans votre audio.
Q. Quelle différence entre la reconnaissance vocale Clova (CSR) et CLOVA Speech ?
Le CSR est une API pour les énoncés courts de 60 secondes maximum, tandis que CLOVA Speech est un produit distinct qui prend en charge les fichiers longs et la séparation des locuteurs.
Ce test porte sur le CSR.
Q. Scribe v1 ou v2, lequel utiliser ?
La v1 si la préservation de la forme d'origine est essentielle, la v2 si vous voulez une sortie agréable à lire, avec les symboles monétaires normalisés automatiquement.
La v2 prend aussi en charge le streaming temps réel ($0.39 de l'heure).
La suite pratique, transcription d'interviews et séparation des locuteurs, vous attend dans notre comparatif STT ElevenLabs vs Whisper vs Deepgram.
À très vite pour le prochain article. C'était Sonetho. ⚡