Xin chào, Sonetho đây. ⚡
"Nhận dạng giọng nói tiếng Hàn thì Naver vẫn tốt hơn chứ?"
Câu này nghe rất nhiều, nhưng hiếm ai thực sự đo thử.
Vậy nên chúng tôi tự đo.
Cùng 8 file audio tiếng Hàn được đưa vào ba engine, rồi đối chiếu từng ký tự với văn bản gốc.
📊 Tóm tắt kết quả (tỷ lệ lỗi ký tự CER, càng thấp càng chính xác)
| Hạng mục | CLOVA CSR | Scribe v1 | Scribe v2 |
|---|---|---|---|
| Thoại cảm xúc | 3.2% | 1.1% | 1.1% |
| Đọc kiểu bản tin | 0~0.8% | 0~0.8% | 0~0.8% |
| Trộn tiếng Anh và số | 36.9~37.7% | 8.5~13.8% | 8.5~20.8% |
| Độ ổn định văn bản dài | 1.7~7.3% | 0% | 0% |
| Trung bình | 11.4% | 3.2% | 4.0% |
Trước hết, phải nói công bằng cho CLOVA.
Với tiếng Hàn thuần, CSR cũng gần như đạt điểm tuyệt đối.
Ở phần đọc kiểu bản tin, cả ba engine đều quanh mức 0%, hòa nhau.
Nếu chỉ nhìn đoạn này thì dùng cái nào cũng được.
🔬 Các số liệu đo lường toàn diện theo phân đoạn (8 lần)
Bảng tóm tắt đã được nhóm theo phạm vi, vì vậy tôi sẽ liệt kê chi tiết cả 8 lần đo.
Cùng một kịch bản đã được tổng hợp bằng hai giọng nói và đưa vào mỗi phần.
| Danh mục | Giọng nguồn | CLOVA CSR | Scribe v1 | Scribe v2 |
|---|---|---|---|---|
| Lời thoại biểu cảm | CLOVA Ara | 3.2% | 1.1% | 1.1% |
| Lời thoại biểu cảm | ElevenLabs Hyuk | 3.2% | 1.1% | 1.1% |
| Đọc kiểu bản tin | CLOVA Ara | 0% | 0% | 0% |
| Đọc kiểu bản tin | ElevenLabs Hyuk | 0.8% | 0.8% | 0.8% |
| Kết hợp Anh-Số | CLOVA Ara | 36.9% | 13.8% | 20.8% |
| Kết hợp Anh-Số | ElevenLabs Hyuk | 37.7% | 8.5% | 8.5% |
| Tính nhất quán đoạn dài | CLOVA Ara | 7.3% | 0% | 0% |
| Tính nhất quán đoạn dài | ElevenLabs Hyuk | 1.7% | 0% | 0% |
💥 Điểm phân thắng bại nằm ở phần trộn tiếng Anh
Khoảnh khắc tên thương hiệu và con số xuất hiện trong câu tiếng Hàn, khoảng cách lập tức nới rộng.
Dưới đây là vài kết quả thực tế của CSR, giữ nguyên không chỉnh sửa.
| Đáp án đúng | Kết quả CLOVA CSR |
|---|---|
| ChatGPT | "채취 pt" |
| Gemini | "나재민이", "개 미니" |
| 일레븐랩스 (ElevenLabs viết bằng tiếng Hàn) | "11 x" |
| 약 15달러 수준 ("khoảng 15 đô la") | "약 시부터 여수 중" |
Với phụ đề YouTube, nội dung IT hay biên bản họp thời nay vốn đầy từ tiếng Anh xen lẫn, chênh lệch này biến thẳng thành khối lượng việc phải sửa tay.
Ở cùng những đoạn đó, Scribe giữ nguyên vẹn ChatGPT, Gemini và API.
🎧 Toàn bộ âm thanh và văn bản đã chuyển đổi
Nhìn vào những con số thì khó mà nắm bắt được thực tế.
Tôi đăng nguyên văn các đoạn âm thanh có chứa tiếng Anh mà mình đã sử dụng.
Hãy vừa nghe vừa so sánh với các văn bản dưới đây.
Âm thanh do giọng CLOVA Ara đọc
Kịch bản gốc
일레븐랩스의 Creator 플랜은 월 22달러지만, 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고, 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 sonetho.com에서 확인하세요.
CLOVA CSR (Tỷ lệ lỗi 36.9%)
11 x의 크리에이터 플랜은 월 22 달라지는 첫달은 50% 할인된 11달러에 시작할 수 있습니다 채취 pt 나재민이 같은 ai 툴과 연동 하면 활용 폭이 넓어지고 2026년 7월 기준 api 요금은 100만장 약 시부터 여수 중입니다 자세한 내용은 선 투 닷컴에서 확인하세요
Scribe v1 (Tỷ lệ lỗi 13.8%)
일레븐웹스의 크리에이터 플랜은 월 $22지만 첫 달은 50% 할인된 $11에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 $15 수준입니다. 자세한 내용은 son토.com에서 확인하세요.
Scribe v2 (Tỷ lệ lỗi 20.8%)
일레븐랩스의 크리에이터 플랜은 월 22달러지만 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. 챗GPT나 제미니 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 소토닷컴에서 확인하세요.
Có một điểm cần lưu ý ở đây.
Mặc dù v2 có điểm số kém hơn v1, nhưng thực tế nó nhận diện tốt hơn.
v1 đã ghi sai tên thương hiệu thành "일레븐웹스", trong khi v2 đã viết đúng là "일레븐랩스".
Đối với số tiền, v1 đã chuyển đổi ký hiệu thành $22, còn v2 đã giữ nguyên văn bản gốc là "22달러".
Tuy nhiên, v2 đã phiên âm tiếng Hàn ChatGPT thành "챗GPT" và Gemini thành "제미니".
Trong cách chấm điểm theo ký tự (CER), những từ này đều bị tính là lỗi, dẫn đến tỷ lệ 20.8%.
Nếu chỉ nhìn vào điểm số mà kết luận v1 tốt hơn thì không chính xác.
🎙️ Dù cùng một câu nhưng tỷ lệ lỗi khác biệt gấp 4 lần tùy vào giọng đọc
Có một kết quả mà tôi không hề dự đoán trước.
Đoạn văn dài có kịch bản hoàn toàn giống nhau.
Tuy nhiên, với âm thanh do giọng CLOVA đọc thì tỷ lệ lỗi CSR là 7.3%, còn với giọng ElevenLabs thì chỉ là 1.7%.
Sự khác biệt gấp 4 lần không nằm ở bộ nhận diện mà nằm ở giọng đọc.
Đối với Scribe, cả hai đoạn âm thanh này đều đạt tỷ lệ lỗi 0%.
Đoạn dài do CLOVA Ara đọc
Đoạn dài do ElevenLabs Hyuk đọc
Điểm sai sót nằm ở cuối câu.
Kịch bản gốc là "어제보다 오늘 더 자연스러워지고 있다는 것만은 분명합니다".
Ở phía giọng CLOVA, CSR đã ghi lại thành "있다는것만 있는 영화".
Cùng tại vị trí đó, CSR của giọng ElevenLabs đã nhận diện chính xác là "있다는것만은 분명합니다".
Ngay cả đoạn "근본적으로 바꾸고 있습니다" của "있습니다" ở giữa cũng bị bỏ sót hoàn toàn chỉ với giọng CLOVA.
Trong thực tế, điều này có nghĩa là:
Khi đo lường độ chính xác của STT, việc chỉ thay đổi công cụ nhận diện là chưa đủ.
Cách phát âm và nhịp thở trong âm thanh đầu vào cũng ảnh hưởng đáng kể đến kết quả.
Khi lựa chọn công cụ nội bộ, bạn nên đo lường bằng chính giọng nói của người dùng thực tế.
🧐 Scribe cũng chưa hoàn hảo
Chúng tôi công khai luôn cả lỗi của Scribe cho sòng phẳng.
Nó yếu với danh từ riêng lần đầu gặp.
"sonetho.com" bị ghi thành "sonto.com", và ở một mẫu, "11달러" (11 đô la) bị nghe nhầm thành "1달러" (1 đô la).
Nếu tài liệu có những con số dính trực tiếp đến tiền, dù dùng engine nào cũng bắt buộc phải rà soát lại.
Khác biệt giữa v1 và v2 cũng rất thú vị.
v2 tự chuẩn hóa cách viết, chẳng hạn "22달러" được ghi thành "$22".
Theo cách chấm của chúng tôi (CER) thì bị tính là lỗi, nhưng về nghĩa lại hoàn toàn chính xác.
Nếu cần giữ nguyên dạng chữ gốc thì chọn v1, còn muốn phụ đề, tài liệu dễ đọc thì v2 là lựa chọn đúng.
v2 còn có phiên bản streaming thời gian thực.
💰 Giá cả khác nhau thế nào
ElevenLabs Scribe: $0.22 mỗi giờ (tính theo batch).
Gói miễn phí cũng bao gồm 4,5 giờ mỗi tháng.
Gói Starter $6 kèm 27 giờ, gói Creator $22 kèm 100 giờ, nên hầu hết nhu cầu cá nhân đều nằm gọn trong gói.
CLOVA Speech Recognition (CSR): tính phí theo lượng dùng, làm tròn lên theo từng khối 15 giây.
Đơn giá chính xác xem tại công cụ tính giá của Naver Cloud.
Lưu ý: CSR là API cho câu nói ngắn, giới hạn 60 giây.
Cần ghi âm dài và tách người nói thì phải dùng sản phẩm riêng là CLOVA Speech.
🤔 Vậy rốt cuộc nên dùng gì
CLOVA CSR phù hợp khi
xử lý câu nói ngắn, chủ yếu là tiếng Hàn thuần.
dự án có yêu cầu hạ tầng cloud đặt tại Hàn Quốc.
đội ngũ vốn đã dùng hệ sinh thái Naver Cloud.
ElevenLabs Scribe phù hợp khi
làm phụ đề, biên bản cho nội dung trộn tiếng Anh và tiếng Hàn.
audio thuộc mảng IT, marketing với tên thương hiệu xuất hiện dày đặc.
Có sẵn 4,5 giờ miễn phí để tự kiểm chứng chất lượng trước rồi hãy quyết định.
Dùng thử ElevenLabs Scribe miễn phí →
🧪 Phương pháp đo (có thể tái lập)
Bốn nhóm kịch bản (thoại cảm xúc, văn phong bản tin, trộn tiếng Anh và số, văn bản dài) được tổng hợp bằng hai giọng TTS chất lượng cao (CLOVA Ara Pro và ElevenLabs Hyuk) để tạo ra 8 file audio.
Mỗi file được đưa vào ba engine rồi đối chiếu từng ký tự với văn bản gốc (CER).
Chúng tôi cũng nói rõ giới hạn.
Đầu vào là giọng TTS tổng hợp, tức điều kiện lý tưởng không tạp âm; với giọng người thật hay môi trường ồn, con số có thể khác.
Một phần lỗi cũng có thể bắt nguồn từ cách phát âm của chính TTS.
❓ Câu hỏi thường gặp (FAQ)
Q. STT nào chính xác nhất cho tiếng Hàn?
Trong lần đo này, xét tỷ lệ lỗi ký tự trung bình, Scribe v1 thấp nhất với 3.2%.
Tuy nhiên với tiếng Hàn thuần văn phong trang trọng, CLOVA CSR cũng quanh mức 0% và ngang ngửa, nên tiêu chí chọn là audio có lẫn tiếng Anh hay không.
Q. CLOVA Speech Recognition (CSR) khác gì CLOVA Speech?
CSR là API cho câu nói ngắn dưới 60 giây, còn CLOVA Speech là sản phẩm riêng hỗ trợ file ghi âm dài và tách người nói.
Bài test lần này dựa trên CSR.
Q. Nên dùng Scribe v1 hay v2?
Cần bảo toàn nguyên dạng chữ thì chọn v1, muốn đầu ra dễ đọc với ký hiệu tiền tệ được tự động chỉnh gọn thì chọn v2.
v2 còn hỗ trợ streaming thời gian thực ($0.39 mỗi giờ).
Phần thực chiến về gỡ băng phỏng vấn và tách người nói tiếp tục tại bài so sánh STT: ElevenLabs vs Whisper vs Deepgram.
Hẹn gặp lại ở bài sau. Sonetho xin chào. ⚡