नमस्ते, हम हैं Sonetho। ⚡
"कोरियन स्पीच रिकग्निशन में तो आख़िर Naver ही बेहतर है, है न?"
यह बात बहुत सुनने को मिलती है, मगर असल में मापकर देखने वाले बहुत कम हैं।
तो हमने ख़ुद मापा।
एक जैसे 8 कोरियन ऑडियो तीनों इंजनों में डाले और सही स्क्रिप्ट से अक्षर-दर-अक्षर मिलान किया।
📊 नतीजों का सारांश (कैरेक्टर एरर रेट CER, जितना कम उतना सटीक)
| श्रेणी | CLOVA CSR | Scribe v1 | Scribe v2 |
|---|---|---|---|
| भावनात्मक संवाद | 3.2% | 1.1% | 1.1% |
| न्यूज़-स्टाइल वाचन | 0~0.8% | 0~0.8% | 0~0.8% |
| अंग्रेज़ी और अंकों का मिश्रण | 36.9~37.7% | 8.5~13.8% | 8.5~20.8% |
| लंबे टेक्स्ट की एकरूपता | 1.7~7.3% | 0% | 0% |
| औसत | 11.4% | 3.2% | 4.0% |
पहले CLOVA का पक्ष रख दें।
शुद्ध कोरियन में CSR भी लगभग फ़ुल मार्क्स पाता है।
न्यूज़-स्टाइल वाचन में तीनों इंजन 0% के आसपास बराबरी पर रहे।
सिर्फ़ यही हिस्सा देखें तो कोई भी चलेगा।
🔬 खंड-वार कुल माप (8 परीक्षण)
चूंकि सारांश तालिका में इन्हें श्रेणियों में समूहीकृत किया गया है, इसलिए हम यहाँ सभी 8 परीक्षणों को विस्तार से दिखा रहे हैं।
समान स्क्रिप्ट को दो अलग-अलग आवाज़ों में सिंथेसाइज करके दोनों के परिणाम शामिल किए गए हैं।
| श्रेणी | स्रोत आवाज़ | CLOVA CSR | Scribe v1 | Scribe v2 |
|---|---|---|---|---|
| भावनात्मक संवाद | CLOVA Ara | 3.2% | 1.1% | 1.1% |
| भावनात्मक संवाद | ElevenLabs Hyuk | 3.2% | 1.1% | 1.1% |
| समाचार शैली में वाचन | CLOVA Ara | 0% | 0% | 0% |
| समाचार शैली में वाचन | ElevenLabs Hyuk | 0.8% | 0.8% | 0.8% |
| अंग्रेजी और संख्याओं का मिला-जुला उपयोग | CLOVA Ara | 36.9% | 13.8% | 20.8% |
| अंग्रेजी और संख्याओं का मिला-जुला उपयोग | ElevenLabs Hyuk | 37.7% | 8.5% | 8.5% |
| लंबे पाठ में निरंतरता | CLOVA Ara | 7.3% | 0% | 0% |
| लंबे पाठ में निरंतरता | ElevenLabs Hyuk | 1.7% | 0% | 0% |
💥 असली मुक़ाबला अंग्रेज़ी मिश्रण में था
कोरियन वाक्य में ब्रांड नाम और अंक घुलते ही फ़ासला खुलने लगा।
CSR के कुछ असली आउटपुट जस के तस पेश हैं।
| सही टेक्स्ट | CLOVA CSR का आउटपुट |
|---|---|
| ChatGPT | "채취 pt" |
| Gemini | "나재민이", "개 미니" |
| 일레븐랩스 (ElevenLabs) | "11 x" |
| 약 15달러 수준 (यानी "लगभग 15 डॉलर") | "약 시부터 여수 중" |
YouTube सबटाइटल, IT कॉन्टेंट या आजकल की मीटिंग नोट्स जैसे अंग्रेज़ी शब्दों वाले ऑडियो में यह फ़र्क़ सीधे आपके काम के बोझ में बदल जाता है।
उसी हिस्से में Scribe ने ChatGPT, Gemini और API को हूबहू मूल रूप में सुरक्षित रखा।
🎧 इनपुट ऑडियो और पूरी ट्रांसक्रिप्ट
सिर्फ आंकड़ों को देखकर सही अंदाजा लगाना मुश्किल है।
यहाँ मैंने वही वास्तविक ऑडियो अपलोड किया है जिसमें अंग्रेजी और कोरियाई दोनों का मिला-जुला इस्तेमाल किया गया है।
इसे सुनते समय नीचे दी गई ट्रांसक्रिप्ट से इसकी तुलना करके देखें।
CLOVA Ara की आवाज़ में ऑडियो
सही स्क्रिप्ट
일레븐랩스의 Creator 플랜은 월 22달러지만, 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고, 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 sonetho.com에서 확인하세요.
CLOVA CSR (त्रुटि दर 36.9%)
11 x의 크리에이터 플랜은 월 22 달라지는 첫달은 50% 할인된 11달러에 시작할 수 있습니다 채취 pt 나재민이 같은 ai 툴과 연동 하면 활용 폭이 넓어지고 2026년 7월 기준 api 요금은 100만장 약 시부터 여수 중입니다 자세한 내용은 선 투 닷컴에서 확인하세요
Scribe v1 (त्रुटि दर 13.8%)
일레븐웹스의 크리에이터 플랜은 월 $22지만 첫 달은 50% 할인된 $11에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 $15 수준입니다. 자세한 내용은 son토.com에서 확인하세요.
Scribe v2 (त्रुटि दर 20.8%)
일레븐랩스의 크리에이터 플랜은 월 22달러지만 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. 챗GPT나 제미니 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 소토닷컴에서 확인하세요.
यहाँ एक महत्वपूर्ण बात ध्यान देने योग्य है।
हालाँकि v2 का स्कोर v1 से खराब है, लेकिन वास्तव में इसने आवाज़ को बेहतर ढंग से समझा है।
v1 ने ब्रांड का नाम गलत लिखकर कोरियाई में "일레븐웹스" दर्ज किया, जबकि v2 ने इसे सही पहचानते हुए कोरियाई में "일레븐랩스" लिखा।
कीमत के मामले में भी, v1 ने इसे बदलकर प्रतीक रूप में $22 लिखा, जबकि v2 ने इसे मूल कोरियाई पाठ के रूप में "22달러" ही लिखा।
लेकिन v2 ने ChatGPT को कोरियाई उच्चारण के अनुसार "챗GPT" और Gemini को "제미니" के रूप में लिप्यंतरित कर दिया।
कैरेक्टर-लेवल स्कोरिंग (CER) में इन सभी को त्रुटि मान लिया गया, जिससे इसकी त्रुटि दर 20.8% हो गई।
इसलिए सिर्फ स्कोर देखकर यह निष्कर्ष निकालना गलत होगा कि v1 बेहतर है।
🎙️ वाक्य एक ही है, लेकिन आवाज़ के आधार पर त्रुटि दर में 4 गुना अंतर
एक अप्रत्याशित परिणाम सामने आया।
लंबे खंड के लिए स्क्रिप्ट पूरी तरह से समान है।
लेकिन, CLOVA की आवाज़ में रिकॉर्ड किए गए ऑडियो में CSR त्रुटि दर 7.3% थी, जबकि ElevenLabs की आवाज़ वाले ऑडियो में यह 1.7% थी।
रिकॉग्नाइज़र के कारण नहीं, बल्कि पढ़ने वाली आवाज़ के कारण त्रुटि दर में 4 गुना का अंतर आया।
Scribe इन दोनों समान ऑडियो में 0% था।
CLOVA Ara द्वारा पढ़ा गया लंबा खंड
ElevenLabs Hyuk द्वारा पढ़ा गया लंबा खंड
त्रुटि होने का मुख्य बिंदु वाक्य का अंत था।
सही कोरियाई स्क्रिप्ट "어제보다 오늘 더 자연스러워지고 있다는 것만은 분명합니다" है।
CLOVA की आवाज़ वाले ऑडियो में CSR ने इसे कोरियाई में "있다는것만 있는 영화" लिखा।
इसी जगह पर ElevenLabs की आवाज़ के साथ CSR ने इसे सटीक रूप से "있다는것만은 분명합니다" के रूप में पहचाना।
इसके अलावा, बीच में से "근본적으로 바꾸고 있습니다" का "있습니다" भी केवल CLOVA की आवाज़ वाले ऑडियो में पूरी तरह से छूट गया।
व्यावहारिक रूप से इसका अर्थ यह है।
STT की सटीकता को मापते समय केवल रिकॉग्निशन इंजन को बदलना आधा-अधूरा प्रयास है।
इनपुट ऑडियो का उच्चारण और सांस लेने का तरीका परिणामों को बहुत अधिक प्रभावित करता है।
आंतरिक टूल चुनते समय, आपको उस वक्ता की वास्तविक आवाज़ के साथ परीक्षण करना चाहिए जिसका वास्तव में उपयोग किया जाएगा।
🧐 Scribe भी परफ़ेक्ट नहीं निकला
ईमानदारी से Scribe की ग़लतियाँ भी सामने रखते हैं।
पहली बार सुने गए नामों पर यह कमज़ोर है।
"sonetho.com" को "sonto.com" लिखा, और एक सैंपल में "11달러" (11 डॉलर) को "1달러" (1 डॉलर) सुन लिया।
अगर दस्तावेज़ में अंक सीधे पैसों से जुड़े हैं, तो इंजन कोई भी हो, जाँच ज़रूरी है।
v1 और v2 का फ़र्क़ भी दिलचस्प रहा।
v2 "22달러" (22 डॉलर) को अपने आप "$22" में नॉर्मलाइज़ कर देता है।
हमारे स्कोरिंग तरीक़े (CER) में यह ग़लती गिनी जाती है, पर मतलब के हिसाब से आउटपुट सही है।
मूल लिखावट अहम हो तो v1, पढ़ने में आसान सबटाइटल या दस्तावेज़ चाहिए तो v2 सही रहेगा।
v2 का रियल-टाइम स्ट्रीमिंग वर्शन भी है।
💰 क़ीमतों में क्या फ़र्क़ है
ElevenLabs Scribe: $0.22 प्रति घंटा (बैच आधार पर)।
फ़्री प्लान में भी हर महीने 4.5 घंटे शामिल हैं।
$6 वाले Starter में 27 घंटे और $22 वाले Creator में 100 घंटे शामिल हैं, यानी ज़्यादातर निजी काम प्लान के भीतर ही निपट जाते हैं।
CLOVA Speech Recognition (CSR): 15 सेकंड की इकाई में राउंड-अप होने वाला पे-एज़-यू-गो मॉडल है।
सटीक दरें Naver Cloud के प्राइस कैलकुलेटर पर देखें।
ध्यान रहे, CSR छोटे बोल के लिए बना API है और इसमें 60 सेकंड की सीमा है।
लंबी रिकॉर्डिंग और स्पीकर अलग करने के लिए अलग प्रोडक्ट CLOVA Speech चाहिए।
🤔 तो आख़िर किसे चुनें
CLOVA CSR तब सही है जब
ज़्यादातर शुद्ध कोरियन वाले छोटे बोल प्रोसेस करने हों।
प्रोजेक्ट में कोरिया के घरेलू क्लाउड इंफ़्रास्ट्रक्चर की शर्त हो।
टीम पहले से Naver Cloud इकोसिस्टम इस्तेमाल कर रही हो।
ElevenLabs Scribe तब सही है जब
अंग्रेज़ी-कोरियन मिले-जुले कॉन्टेंट के सबटाइटल या मीटिंग नोट्स बनाने हों।
IT और मार्केटिंग ऑडियो में ब्रांड नाम बार-बार आते हों।
फ़्री 4.5 घंटों से पहले ख़ुद क्वालिटी परखकर फिर फ़ैसला किया जा सकता है।
ElevenLabs Scribe मुफ़्त में आज़माएँ →
🧪 मापने का तरीक़ा (दोहराया जा सकता है)
4 श्रेणियों की स्क्रिप्ट (भावनात्मक संवाद, न्यूज़-स्टाइल, अंग्रेज़ी और अंकों का मिश्रण, लंबा टेक्स्ट) को दो हाई-क्वालिटी TTS (CLOVA Ara Pro और ElevenLabs Hyuk) से सिंथेसाइज़ कर 8 ऑडियो बनाए।
हर ऑडियो तीनों इंजनों में डालकर सही स्क्रिप्ट से अक्षर-दर-अक्षर मिलान (CER) किया।
सीमाएँ भी साफ़ बता दें।
इनपुट TTS की सिंथेटिक आवाज़ है, यानी बिना शोर की आदर्श स्थिति; असली इंसानी बोल या शोर भरे माहौल में आँकड़े बदल सकते हैं।
कुछ ग़लतियाँ TTS के उच्चारण से भी आई हो सकती हैं।
❓ अक्सर पूछे जाने वाले सवाल (FAQ)
Q. कोरियन STT में सबसे सटीक कौन है?
इस टेस्ट में औसत कैरेक्टर एरर रेट के हिसाब से Scribe v1 सबसे कम, 3.2% पर रहा।
हालाँकि शुद्ध औपचारिक कोरियन में CLOVA CSR भी 0% के आसपास बराबर है, इसलिए चुनाव का पैमाना यह है कि आपके ऑडियो में अंग्रेज़ी मिली है या नहीं।
Q. CLOVA Speech Recognition (CSR) और CLOVA Speech में क्या फ़र्क़ है?
CSR 60 सेकंड से छोटे बोल के लिए API है, जबकि CLOVA Speech लंबी रिकॉर्डिंग फ़ाइलों और स्पीकर अलग करने को सपोर्ट करने वाला अलग प्रोडक्ट है।
यह टेस्ट CSR पर आधारित है।
Q. Scribe v1 और v2 में किसे चुनें?
मूल लिखावट बचाए रखना अहम हो तो v1, करेंसी सिंबल जैसी चीज़ें अपने आप सँवारा हुआ पढ़ने लायक़ आउटपुट चाहिए तो v2।
v2 रियल-टाइम स्ट्रीमिंग ($0.39 प्रति घंटा) भी सपोर्ट करता है।
इंटरव्यू ट्रांसक्रिप्शन और स्पीकर अलग करने की असली प्रैक्टिस ElevenLabs vs Whisper vs Deepgram STT तुलना में जारी है।
अगली पोस्ट में फिर मिलेंगे। Sonetho की ओर से। ⚡