Olá, aqui é a Sonetho. ⚡
"Para coreano, o reconhecimento de voz da Naver não é melhor?"
A gente ouve isso o tempo todo, mas quase ninguém mediu de verdade.
Então medimos nós mesmos.
Colocamos os mesmos 8 áudios em coreano em três engines e comparamos caractere por caractere com o roteiro original.
📊 Resumo dos resultados (taxa de erro de caracteres CER, quanto menor, melhor)
| Categoria | CLOVA CSR | Scribe v1 | Scribe v2 |
|---|---|---|---|
| Falas emocionais | 3.2% | 1.1% | 1.1% |
| Leitura em estilo de telejornal | 0~0.8% | 0~0.8% | 0~0.8% |
| Mistura de inglês e números | 36.9~37.7% | 8.5~13.8% | 8.5~20.8% |
| Consistência em textos longos | 1.7~7.3% | 0% | 0% |
| Média | 11.4% | 3.2% | 4.0% |
Primeiro, em defesa do CLOVA.
Em coreano puro, o CSR também é praticamente nota máxima.
Na leitura em estilo de telejornal, as três engines empataram na faixa de 0%.
Se você só precisa desse cenário, qualquer uma serve.
🔬 Medições completas por seção (8 rodadas)
O resumo foi agrupado por categorias, mas apresento aqui as 8 rodadas completas.
Utilizei o mesmo script de teste em ambas as vozes para cada caso.
| Categoria | Voz de origem | CLOVA CSR | Scribe v1 | Scribe v2 |
|---|---|---|---|---|
| Diálogo emocional | CLOVA Ara | 3.2% | 1.1% | 1.1% |
| Diálogo emocional | ElevenLabs Hyuk | 3.2% | 1.1% | 1.1% |
| Leitura de notícias | CLOVA Ara | 0% | 0% | 0% |
| Leitura de notícias | ElevenLabs Hyuk | 0.8% | 0.8% | 0.8% |
| Misto (inglês/números) | CLOVA Ara | 36.9% | 13.8% | 20.8% |
| Misto (inglês/números) | ElevenLabs Hyuk | 37.7% | 8.5% | 8.5% |
| Consistência em textos longos | CLOVA Ara | 7.3% | 0% | 0% |
| Consistência em textos longos | ElevenLabs Hyuk | 1.7% | 0% | 0% |
💥 O jogo virou na mistura com inglês
No momento em que marcas e números entram nas frases em coreano, a diferença dispara.
Copiamos abaixo algumas saídas reais do CSR, sem retoques.
| Texto correto | Saída do CLOVA CSR |
|---|---|
| ChatGPT | "채취 pt" (sílabas coreanas sem sentido mais "pt") |
| Gemini | "나재민이", "개 미니" (parece nome coreano; "mini cachorro") |
| 일레븐랩스 (ElevenLabs em coreano) | "11 x" |
| 약 15달러 수준 ("cerca de 15 dólares" em coreano) | "약 시부터 여수 중" (sequência coreana sem sentido) |
Se o seu áudio mistura palavras em inglês, como legendas do YouTube, conteúdo de tecnologia ou atas de reunião de hoje em dia, essa diferença vira trabalho de correção na mesma medida.
O Scribe preservou ChatGPT, Gemini e API na forma original nesses mesmos trechos.
🎧 Áudio inserido e transcrições completas
Os números sozinhos não dizem muito.
Estou disponibilizando o áudio original que contém trechos em inglês.
Ouça e compare com as transcrições abaixo.
Áudio lido pela CLOVA Ara
Transcrição de referência (ground-truth)
일레븐랩스의 Creator 플랜은 월 22달러지만, 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고, 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 sonetho.com에서 확인하세요.
CLOVA CSR (taxa de erro 36.9%)
11 x의 크리에이터 플랜은 월 22 달라지는 첫달은 50% 할인된 11달러에 시작할 수 있습니다 채취 pt 나재민이 같은 ai 툴과 연동 하면 활용 폭이 넓어지고 2026년 7월 기준 api 요금은 100만장 약 시부터 여수 중입니다 자세한 내용은 선 투 닷컴에서 확인하세요
Scribe v1 (taxa de erro 13.8%)
일레븐웹스의 크리에이터 플랜은 월 $22지만 첫 달은 50% 할인된 $11에 시작할 수 있습니다. ChatGPT나 Gemini 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 $15 수준입니다. 자세한 내용은 son토.com에서 확인하세요.
Scribe v2 (taxa de erro 20.8%)
일레븐랩스의 크리에이터 플랜은 월 22달러지만 첫 달은 50% 할인된 11달러에 시작할 수 있습니다. 챗GPT나 제미니 같은 AI 툴과 연동하면 활용 폭이 넓어지고 2026년 7월 기준 API 요금은 100만 자당 약 15달러 수준입니다. 자세한 내용은 소토닷컴에서 확인하세요.
Um ponto importante a ser destacado aqui:
Embora a v2 tenha uma pontuação pior que a v1, na verdade ela compreendeu melhor o conteúdo.
A v1 errou o nome da marca como "일레븐웹스", enquanto a v2 acertou como "일레븐랩스".
Quanto aos valores, a v1 converteu para $22, mas a v2 manteve o original como "22달러".
Contudo, a v2 transcreveu foneticamente ChatGPT como "챗GPT" e Gemini como "제미니".
Na pontuação baseada em caracteres (CER), tudo isso foi contabilizado como erro, resultando em 20.8%.
É um equívoco concluir que a v1 é superior apenas olhando para a nota.
🎙️ A mesma frase, mas com taxas de erro 4 vezes maiores dependendo da voz
Houve um resultado inesperado.
O roteiro é exatamente o mesmo para o trecho longo.
No entanto, no áudio lido pela voz da CLOVA, a taxa de erro CER do CSR foi de 7.3%, enquanto no lado lido pela voz da ElevenLabs foi de 1.7%.
A diferença de 4 vezes não se deveu ao reconhecedor, mas sim à voz utilizada na leitura.
O Scribe teve 0% em ambos os áudios.
Texto longo lido pela CLOVA Ara
Texto longo lido pelo ElevenLabs Hyuk
Onde o reconhecimento falhou foi no final da frase.
O script correto é "어제보다 오늘 더 자연스러워지고 있다는 것만은 분명합니다".
No caso da voz da CLOVA, o CSR registrou isso como "있다는것만 있는 영화".
No mesmo ponto, o CSR com a voz da ElevenLabs captou corretamente como "있다는것만은 분명합니다".
No meio do caminho, "근본적으로 바꾸고 있습니다" de "있습니다" também foi totalmente omitido apenas na leitura da voz da CLOVA.
Na prática, isso significa o seguinte:
Ao medir a precisão de STT, testar apenas o motor de reconhecimento é apenas metade do trabalho.
A pronúncia e o ritmo do áudio de entrada influenciam o resultado na mesma medida.
Ao escolher ferramentas para uso interno, você deve testá-las com a voz dos locutores que serão usados de fato.
🧐 O Scribe também não foi perfeito
Sendo honestos, divulgamos os erros do Scribe também.
Ele tropeça em nomes próprios que vê pela primeira vez.
Escreveu "sonetho.com" como "sonto.com" e, em uma amostra, ouviu "11 dólares" como "1 dólar".
Se os números envolvem dinheiro, a revisão é obrigatória com qualquer engine.
A diferença entre v1 e v2 também rendeu.
O v2 normaliza a grafia por conta própria: "22 dólares" vira "$22".
No nosso critério de avaliação (CER) isso conta como erro, mas o significado está correto.
Se a forma literal importa, v1; se o objetivo são legendas e documentos fáceis de ler, v2.
O v2 também tem versão de streaming em tempo real.
💰 E quanto custa?
ElevenLabs Scribe: $0.22 por hora (no modo batch).
Até o plano gratuito inclui 4.5 horas por mês.
O Starter de $6 inclui 27 horas e o Creator de $22, 100 horas, então a maioria dos projetos pessoais cabe dentro do plano.
CLOVA Speech Recognition (CSR): cobrança por uso, arredondada para cima em blocos de 15 segundos.
Confira o valor exato na calculadora de preços da Naver Cloud.
Detalhe: o CSR é uma API para falas curtas e tem limite de 60 segundos.
Para gravações longas e separação de falantes é preciso usar outro produto, o CLOVA Speech.
🤔 Então, qual usar?
CLOVA CSR é a escolha certa quando
Você processa falas curtas quase 100% em coreano.
O projeto exige infraestrutura de nuvem na Coreia.
O time já usa o ecossistema Naver Cloud.
ElevenLabs Scribe é a escolha certa quando
Você legenda ou transcreve conteúdo que mistura inglês e coreano.
O áudio é de TI ou marketing, cheio de nomes de marca.
Dá para conferir a qualidade você mesmo com as 4.5 horas grátis antes de decidir.
Testar o ElevenLabs Scribe grátis →
🧪 Como medimos (reproduzível)
Sintetizamos roteiros de 4 categorias (falas emocionais, estilo telejornal, mistura de inglês e números, texto longo) com dois TTS de alta qualidade (Ara Pro do CLOVA e Hyuk da ElevenLabs), gerando 8 áudios.
Cada áudio passou pelas três engines e foi comparado caractere por caractere com o roteiro original (CER).
Também assumimos os limites.
Como a entrada é voz sintética sem ruído, as condições são ideais; com fala humana real ou ambiente barulhento, os números podem mudar.
Alguns erros podem ter vindo da própria pronúncia do TTS.
❓ Perguntas frequentes (FAQ)
Q. Qual é o STT mais preciso para coreano?
Neste teste, o Scribe v1 teve a menor taxa média de erro de caracteres: 3.2%.
Mas em coreano puro e formal o CLOVA CSR empata na faixa de 0%, então o critério de escolha é se o seu áudio mistura inglês.
Q. Qual a diferença entre CLOVA Speech Recognition (CSR) e CLOVA Speech?
O CSR é uma API para falas curtas de até 60 segundos; o CLOVA Speech é um produto separado que suporta gravações longas e separação de falantes.
Este teste usou o CSR.
Q. Scribe v1 ou v2?
Se preservar a grafia literal é importante, v1; se o objetivo é uma saída legível, com símbolos de moeda e afins normalizados automaticamente, v2.
O v2 também suporta streaming em tempo real ($0.39 por hora).
A parte prática de transcrição de entrevistas e separação de falantes continua no comparativo de STT: ElevenLabs vs Whisper vs Deepgram.
Até o próximo post. Aqui foi a Sonetho. ⚡