Ciao, qui Sonetho. ⚡
«Per il coreano, il riconoscimento vocale di Naver resta il migliore, no?»
Lo si sente dire spesso, ma quasi nessuno ha mai misurato davvero.
Così abbiamo misurato noi.
Gli stessi 8 audio in coreano dentro tre motori, confrontati carattere per carattere con il copione di riferimento.
📊 Risultati in sintesi (tasso di errore sui caratteri CER, più è basso più è preciso)
| Categoria | Clova CSR | Scribe v1 | Scribe v2 |
|---|---|---|---|
| Battute emotive | 3.2% | 1.1% | 1.1% |
| Lettura in stile notiziario | 0~0.8% | 0~0.8% | 0~0.8% |
| Mix di inglese e numeri | 36.9~37.7% | 8.5~13.8% | 8.5~20.8% |
| Coerenza su testi lunghi | 1.7~7.3% | 0% | 0% |
| Media | 11.4% | 3.2% | 4.0% |
Prima, una parola a favore di Clova.
Sul coreano puro anche il CSR è praticamente impeccabile.
Nella lettura in stile notiziario tutti e tre i motori erano alla pari, intorno allo 0%.
Se il vostro caso d'uso finisce qui, va bene qualunque motore.
🔬 Riepilogo delle misurazioni per segmento (8 test)
Poiché la tabella di riepilogo raggruppa i risultati, riporto qui tutti gli 8 test.
Per ogni test ho utilizzato lo stesso script, sintetizzato con due voci diverse.
| Categoria | Voce sorgente | CLOVA CSR | Scribe v1 | Scribe v2 |
|---|---|---|---|---|
| Dialogo emotivo | CLOVA Ara | 3.2% | 1.1% | 1.1% |
| Dialogo emotivo | ElevenLabs Hyuk | 3.2% | 1.1% | 1.1% |
| Lettura notiziario | CLOVA Ara | 0% | 0% | 0% |
| Lettura notiziario | ElevenLabs Hyuk | 0.8% | 0.8% | 0.8% |
| Misto inglese/numeri | CLOVA Ara | 36.9% | 13.8% | 20.8% |
| Misto inglese/numeri | ElevenLabs Hyuk | 37.7% | 8.5% | 8.5% |
| Coerenza testi lunghi | CLOVA Ara | 7.3% | 0% | 0% |
| Coerenza testi lunghi | ElevenLabs Hyuk | 1.7% | 0% | 0% |
💥 La partita si è decisa sul mix con l'inglese
Appena in una frase coreana compaiono nomi di brand e numeri, il divario si spalanca.
Riportiamo alcuni output reali del CSR, così come sono usciti.
| Testo corretto | Output di Clova CSR |
|---|---|
| ChatGPT | "채취 pt" |
| Gemini | "나재민이", "개 미니" |
| 일레븐랩스 (ElevenLabs in coreano) | "11 x" |
| 약 15달러 수준 (circa 15 dollari) | "약 시부터 여수 중" |
Sottotitoli per YouTube, contenuti tech, i verbali di riunione di oggi: se nell'audio si mescolano parole inglesi, questo divario si trasforma dritto in ore di correzioni.
Negli stessi passaggi Scribe ha conservato ChatGPT, Gemini e API esattamente nella forma originale.
🎧 L'audio originale e le trascrizioni
I soli numeri non rendono giustizia al risultato.
Pubblico qui l'audio originale utilizzato, che contiene passaggi in inglese.
Ascoltatelo confrontandolo con le trascrizioni qui sotto.
Audio letto dalla voce CLOVA Ara
Script originale (Ground-truth)
일레븐랩스의 Creator 플랜은 월 22달러지만, 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고, 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 sonetho.com에서 확인하세요.
CLOVA CSR (CER 36.9%)
11 x의 크리에이터 플랜은 월 22 달라지는 첫달은 50% 할인된 11달러에 시작할 수 있습니다 채취 pt 나재민이 같은 ai 툴과 연동 하면 활용 폭이 넓어지고 2026년 7월 기준 api 요금은 100만장 약 시부터 여수 중입니다 자세한 내용은 선 투 닷컴에서 확인하세요
Scribe v1 (CER 13.8%)
일레븐웹스의 크리에이터 플랜은 월 $22지만 첫 달은 50% 할인된 $11에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 $15 수준입니다. 자세한 내용은 son토.com에서 확인하세요.
Scribe v2 (CER 20.8%)
일레븐랩스의 크리에이터 플랜은 월 22달러지만 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. 챗GPT나 제미니 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 소토닷컴에서 확인하세요.
C'è un aspetto importante da chiarire:
Sebbene la v2 abbia un punteggio peggiore della v1, in realtà ha compreso meglio il testo.
La v1 ha sbagliato il nome del brand scrivendolo come "일레븐웹스", mentre la v2 lo ha trascritto correttamente come "일레븐랩스".
Anche riguardo agli importi, la v1 ha convertito il simbolo in $22, mentre la v2 ha mantenuto l'originale "22달러".
Tuttavia, la v2 ha trascritto foneticamente in coreano ChatGPT come "챗GPT" e Gemini come "제미니".
Nel calcolo del CER, queste sono state contate tutte come errori, portando il tasso al 20.8%.
Sarebbe un errore concludere che la v1 sia superiore basandosi solo sul punteggio.
🎙️ Stessa frase, ma il tasso di errore varia di 4 volte a seconda della voce
C'è stato un risultato del tutto inatteso.
Il copione per le sezioni a lunga esposizione è identico.
Tuttavia, l'audio letto dalla voce CLOVA ha registrato un tasso di errore CER del 7.3%, mentre quello con la voce ElevenLabs si è fermato all'1.7%.
La differenza di 4 volte non dipende dal software di riconoscimento, ma dalla voce utilizzata per la lettura.
Scribe ha ottenuto lo 0% su entrambi gli audio.
Testo lungo letto da CLOVA Ara
Testo lungo letto da ElevenLabs Hyuk
Il punto critico è stato la fine della frase.
Il testo corretto (il "ground-truth script") è "어제보다 오늘 더 자연스러워지고 있다는 것만은 분명합니다".
Con la voce CLOVA, il CSR ha trascritto erroneamente questo passaggio come "있다는것만 있는 영화".
Nello stesso punto, il CSR con la voce ElevenLabs ha trascritto correttamente "있다는것만은 분명합니다".
Inoltre, "있습니다" di "근본적으로 바꾸고 있습니다" è stato completamente omesso solo nella versione con la voce CLOVA.
Ecco cosa significa questo nella pratica:
Valutare la precisione dello STT testando solo il motore di riconoscimento è riduttivo.
La pronuncia e il ritmo dell'audio in ingresso influenzano i risultati in modo significativo.
Quando scegliete strumenti interni, dovete effettuare test utilizzando le voci degli speaker che verranno effettivamente impiegati.
🧐 Nemmeno Scribe è perfetto
Per onestà, pubblichiamo anche gli errori di Scribe.
È debole sui nomi propri che incontra per la prima volta.
Ha scritto "sonto.com" al posto di "sonetho.com" e in un campione ha sentito "1 dollaro" invece di "11 dollari".
Se i numeri riguardano soldi, la revisione è obbligatoria con qualsiasi motore.
Interessante anche la differenza tra v1 e v2.
La v2 normalizza la scrittura da sola: "22 dollari" diventa "$22".
Con il nostro metodo di valutazione (CER) conta come errore, ma il significato è perfettamente corretto.
Se conta la forma originale, scegliete la v1; se l'obiettivo sono sottotitoli e documenti facili da leggere, la v2.
Della v2 esiste anche la versione in streaming in tempo reale.
💰 Quanto costano
ElevenLabs Scribe: $0.22 all'ora (in modalità batch).
Anche il piano gratuito include 4,5 ore al mese.
Lo Starter da $6 ne include 27 e il Creator da $22 ne include 100: la maggior parte dei progetti personali resta dentro il piano.
Riconoscimento vocale Clova (CSR): tariffa a consumo, arrotondata per eccesso a scatti di 15 secondi.
Per il prezzo esatto consultate il calcolatore dei costi di Naver Cloud.
Da sapere: il CSR è un'API per enunciati brevi, con un limite di 60 secondi.
Per registrazioni lunghe e separazione dei parlanti serve un prodotto a parte, CLOVA Speech.
🤔 Quindi, quale scegliere
Clova CSR è la scelta giusta per
Elaborare enunciati brevi, quasi solo in coreano puro.
Progetti che richiedono infrastruttura cloud in Corea.
Team che usano già l'ecosistema Naver Cloud.
ElevenLabs Scribe è la scelta giusta per
Sottotitoli e verbali di contenuti dove inglese e coreano si mescolano.
Audio IT e marketing pieni di nomi di brand.
Con le 4,5 ore gratuite potete verificare la qualità di persona prima di decidere.
Prova ElevenLabs Scribe gratis →
🧪 Metodo di misura (riproducibile)
Abbiamo scritto copioni in 4 categorie (battute emotive, stile notiziario, mix di inglese e numeri, testo lungo) e li abbiamo sintetizzati con due TTS di alta qualità (Clova Ara Pro ed ElevenLabs Hyuk), ottenendo 8 audio.
Ogni audio è passato nei tre motori ed è stato confrontato carattere per carattere con il copione di riferimento (CER).
Mettiamo sul tavolo anche i limiti.
L'input è voce sintetica, quindi condizioni ideali senza rumore: con voci umane reali o ambienti rumorosi i numeri possono cambiare.
Alcuni errori potrebbero derivare dalla pronuncia del TTS stesso.
❓ Domande frequenti (FAQ)
Q. Qual è lo STT più preciso per il coreano?
In questa misurazione Scribe v1 ha registrato il tasso di errore medio sui caratteri più basso, 3.2%.
Sul coreano puro in registro formale, però, anche Clova CSR è alla pari intorno allo 0%: il criterio di scelta è se nel vostro audio compare l'inglese.
Q. Che differenza c'è tra il riconoscimento vocale Clova (CSR) e CLOVA Speech?
Il CSR è un'API per enunciati brevi fino a 60 secondi, mentre CLOVA Speech è un prodotto separato che supporta file lunghi e separazione dei parlanti.
Questo test riguarda il CSR.
Q. Meglio Scribe v1 o v2?
La v1 se è essenziale preservare la forma originale, la v2 se volete un output leggibile con la notazione, come i simboli di valuta, già sistemata in automatico.
La v2 supporta anche lo streaming in tempo reale ($0.39 all'ora).
La prova sul campo con trascrizione di interviste e separazione dei parlanti continua nel confronto STT ElevenLabs vs Whisper vs Deepgram.
Ci vediamo al prossimo articolo. Qui Sonetho. ⚡