Bonjour, ici Sonetho. ⚡
« Pour une narration YouTube, CLOVA Dubbing ne suffit-il pas ? »
C'est une question qu'on me pose souvent.
Alors j'ai comparé par moi-même.
J'ai généré les mêmes 4 scripts coréens avec 5 voix CLOVA Voice et 4 voix ElevenLabs, soit 9 voix au total, puis j'ai écouté l'intégralité des 36 échantillons.
🧪 Comment j'ai procédé
Les scripts couvrent 4 catégories.
Le jeu émotionnel (une réplique qui passe de la joie d'une réussite au poids des regrets), la lecture façon journal télévisé, le mélange d'anglais et de chiffres (ChatGPT, 22 dollars, etc.) et la cohérence sur un texte long.
Côté CLOVA, j'ai généré 1 voix standard et 4 voix Pro via l'API CLOVA Voice.
La documentation officielle de NAVER Cloud précise que CLOVA Dubbing repose justement sur ce moteur CLOVA Voice : la comparaison de qualité est donc valable.
Côté ElevenLabs, j'ai généré 2 voix populaires dans la communauté coréenne avec les deux modèles v2 et v3.
Pour chaque catégorie ci-dessous, j'ai inséré de vrais échantillons. Écoutez-les et jugez par vous-même.
Ce sont tous des originaux produits pour ce test, en extraits à des fins de comparaison.
🎧 Ce que révèle l'écoute
Catégorie | MEILLEUR | En une phrase |
|---|---|---|
Jeu émotionnel | ElevenLabs | Honnêtement, CLOVA reste un TTS robotique de première génération. |
Prononciation de l'anglais et des chiffres | Eleven v3 | Presque tout lu correctement. Retournement : CLOVA fait mieux qu'Eleven v2 |
Le moment « c'est un humain ?! » | ElevenLabs | Un PVC bien entraîné se distingue difficilement d'une vraie personne |
Cohérence de la voix | CLOVA et Eleven v2 | v3 lit bien, mais sa voix a le défaut de se transformer |
Voici ces résultats en détail.
🎧 Écouter la catégorie émotion
Script : « Ha... admis ?! Ce n'est pas un rêve, dites-moi ? »
CLOVA Voice (Ara Pro)
ElevenLabs (Hyuk, v3)
Sur l'expression des émotions, la comparaison n'a même pas lieu d'être.
CLOVA Voice, en Pro comme en standard, débite les répliques émotionnelles comme un bulletin d'information.
De toute façon, CLOVA Dubbing n'offre aucune commande pour diriger l'émotion. Il n'y a que la vitesse, la hauteur et des effets spéciaux.
ElevenLabs, lui, a réellement joué le basculement du soupir à la joie, et un PVC bien entraîné (le clonage de ma propre voix) atteignait un niveau où l'on distingue difficilement l'humain de l'IA.
Sur le mélange d'anglais et de chiffres, il y a eu un retournement amusant.
Le meilleur à la lecture a été Eleven v3. Il a prononcé presque parfaitement des expressions comme ChatGPT, Gemini ou 22 dollars.
Mais la deuxième place n'est pas revenue à ElevenLabs Multilingual v2 : c'est CLOVA qui l'a prise.
Dès que v2 rencontre un motif absent de ses données d'entraînement, sa prononciation s'effondre, alors que CLOVA lisait plus posément.
Il existe aussi des écarts au sein de CLOVA : les voix Pro lisent nettement mieux les mots anglais que la voix standard.
🎧 Écouter la catégorie anglais et chiffres
Le script mêle ChatGPT, Gemini et 22 dollars
① ElevenLabs v2 (Hyuk) : le mauvais élève
② CLOVA Voice (Ara Pro) : étonnamment stable
③ ElevenLabs v3 (Hyuk) : presque parfait
La différence de tempérament entre v2 et v3 était nette, elle aussi.
v2 s'appuie sur des données apprises : il est stable sur les phrases familières, mais faible face aux motifs inédits.
v3 lit bien les motifs inédits, mais souffre d'un défaut de cohérence : son timbre vacille au changement de paragraphe.
J'ai détaillé ce comportement dans le test coréen d'Eleven v3 vs v2 en 4 catégories.
🎙️ Écouter les 9 voix disponibles
Nous n'avons inclus que les voix principales ci-dessus.
Voici les 9 versions générées à partir du même script de dialogue émotionnel.
Les deux précédentes ont été conservées pour faciliter la comparaison.
CLOVA Nara (standard)
CLOVA Ara Pro
CLOVA Donghyun Pro
CLOVA Ian Pro
CLOVA Yuna Pro
ElevenLabs Hyuk (Multilingual v2)
ElevenLabs Hyuk (v3)
ElevenLabs Selly (Multilingual v2)
ElevenLabs Selly (v3)
Chez CLOVA, il existe une différence entre les versions standard et Pro.
Cependant, les quatre versions Pro partagent la même gestion des émotions, seule la texture de la voix change.
Pour ElevenLabs, les versions v2 et v3 d'une même voix donnent l'impression d'entendre des acteurs différents.
⏱️ Au-delà de la qualité, nous avons mesuré la vitesse
Si vous générez des dizaines de clips à partir d'une seule vidéo, le temps de génération devient votre temps de travail effectif.
C'est pourquoi, lors de la création de 36 échantillons, nous avons chronométré tout le processus, de l'appel API jusqu'à la réception complète de l'audio.
| Voix | Temps de génération moyen | Caractères traités par seconde |
|---|---|---|
| CLOVA Nara (Standard) | 918ms | 193 caractères |
| CLOVA Donghyun Pro | 1,391ms | 127 caractères |
| CLOVA Ian Pro | 1,568ms | 113 caractères |
| CLOVA Yuna Pro | 1,592ms | 111 caractères |
| CLOVA Ara Pro | 1,596ms | 111 caractères |
| ElevenLabs Selly (v2) | 4,104ms | 43 caractères |
| ElevenLabs Hyuk (v2) | 4,256ms | 42 caractères |
| ElevenLabs Selly (v3) | 6,855ms | 26 caractères |
| ElevenLabs Hyuk (v3) | 6,899ms | 26 caractères |
Le chiffre le plus fiable est l'écart entre la v3 et la v2.
La v3 est en moyenne 65% plus lente que la v2 (6,877ms contre 4,180ms).
Comme nous avons alterné les appels entre les deux modèles pour chaque voix, les variations liées à l'heure ou à l'état du serveur n'ont pas pu favoriser l'un ou l'autre.
J'ai mentionné précédemment que la v3 offre une meilleure prononciation anglaise, mais c'est le prix à payer en termes de temps.
Concrètement, générer 100 clips prend 7 minutes avec la v2, contre 11 minutes avec la v3.
L'écart entre les moteurs était de 3,9 fois.
La moyenne pour CLOVA est de 1,413ms, contre 5,529ms pour ElevenLabs.
En termes de caractères traités par seconde, cela donne 125 contre 32.
La voix standard de CLOVA s'est révélée être la plus rapide avec 918ms, et au sein même de CLOVA, les versions Pro sont plus lentes que la version standard.
Je tiens également à préciser les limites de ce test.
Chaque combinaison n'a été mesurée qu'une seule fois et le temps de trajet réseau est inclus.
De plus, la boucle de mesure était effectuée par catégorie. Comme les appels d'une même catégorie s'enchaînaient, il est impossible de distinguer si une lenteur était due à la nature du texte ou à l'état du serveur à cet instant précis.
C'est pourquoi nous n'avons pas utilisé les classements par catégorie comme conclusion.
Seuls l'écart entre les moteurs et la différence entre la v3 et la v2 ont été retenus, car ils sont trop marqués pour être expliqués par un simple biais.
Ajoutons que ces chiffres correspondent à un mode de réception simultanée des modèles Multilingual v2 et v3.
ElevenLabs propose par ailleurs des modèles de la gamme Flash, conçus pour une faible latence, ainsi que des méthodes de streaming spécifiques.
Si vous recherchez une solution pour des conversations ou des appels en temps réel, il faudra vous référer à ces options plutôt qu'à ce tableau.
💰 Tarifs et licence : le vrai point de bascule
Au-delà de la qualité, ce sont les conditions qui creusent l'écart. Données à jour de juillet 2026.
Critère | CLOVA Dubbing | ElevenLabs |
|---|---|---|
Gratuit | 15 000 caractères/mois, 20 téléchargements | 10 000 crédits/mois |
Conditions du gratuit | Filigrane obligatoire + mention de la source + publication interdite sur une chaîne monétisée | Usage commercial autorisé avec mention de la source |
Prix d'entrée des droits commerciaux | 19,900원 (mais réservé à un usage personnel et non lucratif) | $6 (environ 8 000 KRW, droits commerciaux complets) |
Vente, publicité, diffusion | À partir de Premium 89,900원 | À partir de Starter ($6) |
Clonage de voix | Aucun | Instant dès $6, PVC dès $22 |
Un point de vigilance.
Utiliser CLOVA Dubbing en version gratuite sur un YouTube monétisé viole les conditions d'utilisation.
Depuis décembre 2023, le plan gratuit n'est autorisé que sur « une chaîne ne générant absolument aucun revenu ».
Les articles de blog affirmant qu'« il suffit de citer la source pour utiliser le gratuit, même sur une chaîne AdSense » relèvent d'une ancienne politique aujourd'hui abrogée.
Et même en réglant Standard (19,900원), la vente de contenu, la production en sous-traitance, la diffusion et la publicité restent interdites.
Cela relève de Premium (89,900원).
🤔 Alors, lequel choisir ?
Quand CLOVA Dubbing s'impose
Pour une chaîne non monétisée ou des vidéos gardées pour un usage personnel.
Quand vous voulez un éditeur qui boucle tout sur un seul écran, de la mise en ligne de la vidéo aux sous-titres, aux bruitages et au doublage.
Quand une interface en coréen et une application mobile vous conviennent mieux.
Quand ElevenLabs s'impose
Pour du contenu monétisé. Avec des droits commerciaux complets dès 8 000 KRW, aucun calcul de conditions n'est nécessaire.
Pour une narration, un livre audio ou un travail de dialogue qui réclament du jeu émotionnel.
Quand vous voulez cloner votre propre voix (PVC) pour créer du contenu.
En vous inscrivant chez ElevenLabs via le lien ci-dessous, la réduction de 50 % sur le premier mois du plan Creator s'applique automatiquement.
Profiter des 50 % de réduction le premier mois chez ElevenLabs →
❓ Questions fréquentes (FAQ)
Q. Puis-je utiliser CLOVA Dubbing gratuit sur un YouTube monétisé ?
Non.
Depuis décembre 2023, le plan gratuit n'est plus autorisé que pour une publication sur une chaîne sans revenus.
Si AdSense est activé sur votre chaîne, il vous faut un plan payant, et la vente de contenu ou les vidéos publicitaires ne deviennent possibles qu'à partir de Premium (89,900원/mois).
Q. CLOVA Dubbing ou ElevenLabs, lequel sonne le plus naturel ?
À l'écoute, ElevenLabs mène sur l'expression des émotions et le naturel global, en particulier v3 et un PVC bien entraîné.
Cela dit, sur les phrases mêlant de l'anglais, CLOVA a créé la surprise en lisant plus posément qu'ElevenLabs v2.
Q. Combien coûte CLOVA Dubbing ?
Gratuit (15 000 caractères/mois), Standard 19,900원/mois, Premium 89,900원/mois.
Standard étant réservé à un usage personnel et non lucratif, la vente de contenu ou la publicité exigent Premium.
Si le triple duel des TTS coréens vous intéresse, jetez aussi un œil à Typecast vs Vrew vs ElevenLabs.
Le duel de la reconnaissance vocale (STT) se poursuit dans CLOVA reconnaissance vocale vs Scribe, à la mesure.
On se retrouve au prochain article. C'était Sonetho. ⚡