한국어 지원 확정! Eleven v3 출시일까지 공개 — 1월 웨비나 5분 요약

일레븐랩스가 웨비나에서 V3 출시 및 한국어 지원을 확정하며, 올인원 플랫폼으로 도약합니다.

Sonetho

 

안녕하세요, Sonetho입니다. ⚡

1월 13일에 진행된 일레븐랩스 웨비나의 내용을 신속하게 전해드립니다.

일레븐랩스는 이제 그동안 우리가 알던 'AI 성우' 서비스 뿐만아니라 '올인원 AI 크리에이티브 플랫폼'으로 도약을 준비중입니다.

 

Sora 2, Veo 3 같은 최정상급 비디오 모델을 품은 Studio 3.0부터,

사람의 귀보다 정확한 Scribe v2까지.

웨비나에서 공개된 모든 내용을 하나도 빠짐없이 심층 분석해 드립니다.


 

1. Studio 3.0: 모든 창작이 한곳에서 (All-in-One)

가장 먼저 공개된 것은 Studio 3.0입니다. 핵심은 "워크플로우의 통합"입니다.

이제 영상 제작을 위해 여러 사이트를 돌아다닐 필요가 없습니다.

🎥 Studio 3.0의 3대 혁신

  • 최정상 비디오 모델 통합: 놀랍게도 Google Veo 3, OpenAI Sora 2, Kling, Ideogram 등 현존하는 최고의 비디오/이미지 생성 모델들이 일레븐랩스 스튜디오 안에 들어왔습니다. 외부 툴 결제 없이 플랫폼 내에서 바로 사용 가능합니다.
  • 원스톱 타임라인 (Timeline): 텍스트만 입력하면 [음성(TTS) + 효과음(SFX) + 배경음악(BGM) + 자막 + 영상]이 하나의 타임라인에 자동으로 생성됩니다.
  • 인라인 편집 (Inline Editing): 영상이나 오디오의 특정 구간이 마음에 들지 않나요? 전체를 다시 생성할 필요 없이, 해당 구간만 드래그해서 수정할 수 있습니다.

이는 단순한 기능 추가가 아닙니다.

디즈니(Disney), 엔비디아(NVIDIA), 어도비(Adobe)와 맺은 전략적 파트너십이 만들어낸 결과물입니다.

 

2. Scribe v2: 압도적인 정확도 (vs 경쟁사 비교)

이어 공개된 Scribe v2는 기존의 STT(Speech-to-Text) 툴들을 압살하는 성능을 보여주었습니다.

특히 공개된 정확도(WER) 데이터는 매우 놀라웠습니다.

모델명 오류율 (WER) 비고
ElevenLabs Scribe v2 2.2% 압도적 1위
GPT-4o Transcribe 2.7% -
Gemini 1.5 Pro 3.0% -
Deepgram Nova 3 6.9% -

* 수치가 낮을수록 정확함 (영어/프랑스어/스페인어 등 주요 언어 평균)

 

Scribe v2만의 킬러 기능:

  • Audio Event Tagging: 웃음소리, 박수 소리, 발자국 소리까지 텍스트 태그로 변환합니다.
  • Smart Diarization: 여러 화자가 겹쳐서 말해도 "누가 말했는지" 정확히 구분합니다.
  • Word-level Timestamp: 단어 하나하나의 타이밍을 잡아내어 완벽한 자막 싱크를 맞춥니다.

 

3. 엔터프라이즈를 위한 보안과 확장성

기업 담당자분들이 주목해야 할 내용도 발표되었습니다.

일레븐랩스는 이제 단순 B2C 서비스를 넘어 엔터프라이즈 솔루션으로 도약했습니다.

🔒 보안 및 컴플라이언스 (Security)

  • SOC 2 / ISO 27001 인증: 글로벌 최고 수준의 정보보호 인증을 획득했습니다.
  • Zero Retention (데이터 미저장): 기업이 원할 경우 데이터를 서버에 남기지 않는 옵션을 제공합니다.
  • GDPR 준수: 유럽 데이터 보호 규정을 완벽하게 따릅니다.

🤝 협업 기능 (Collaboration)

  • 팀원 간 프로젝트 공유 및 승인 프로세스 지원
  • 사내 및 에이전시 접근 권한 세분화 관리

 

4. [Q&A] 웨비나 현장 질의응답 (미공개 정보 포함)

마지막으로, 웨비나 Q&A 세션에서 나온 중요 질문들을 정리했습니다.

 

Q. V3 엔진 출시는 언제인가요?
A. 현재 마무리 단계에 있습니다. 1월 말, 늦어도 2월 중에는 만나보실 수 있습니다.

 

Q. 오디오의 숨소리나 피치(Pitch)를 조절할 수 있나요?
A. 네, 많은 요청이 있었습니다. 현재 결과물을 생성한 후 Fine-tune(미세 조정) 할 수 있는 파라미터를 연구 중이며 업데이트 예정입니다.

 

Q. 한국어 UI 지원 계획은?
A. 네, 올해 내에 지원 준비중입니다. 더 이상 번역기를 쓰지 않으셔도 됩니다.


 

❓ 자주 묻는 질문 (FAQ)

 

Q1. Studio 3.0에서 무엇이 달라지나요?
A. 핵심은 워크플로우의 통합입니다.
Google Veo 3, OpenAI Sora 2, Kling, Ideogram 같은 비디오와 이미지 생성 모델이 스튜디오 안으로 들어왔습니다.
텍스트만 입력하면 음성과 효과음, 배경음악, 자막, 영상이 하나의 타임라인에 자동 생성됩니다.
마음에 안 드는 구간은 전체를 다시 만들 필요 없이 그 부분만 드래그해서 수정할 수 있습니다.

 

Q2. Scribe v2의 정확도는 어느 정도라고 발표됐나요?
A. 웨비나에서 공개된 오류율(WER)은 ElevenLabs Scribe v2가 2.2%로 1위였습니다.
GPT-4o Transcribe가 2.7%, Gemini 1.5 Pro가 3.0%, Deepgram Nova 3가 6.9%였습니다.
수치가 낮을수록 정확하며 영어와 프랑스어, 스페인어 등 주요 언어 평균 기준입니다.

 

Q3. Scribe v2만의 기능은 무엇인가요?
A. 세 가지가 소개됐습니다.
웃음소리와 박수, 발자국 소리까지 텍스트 태그로 바꾸는 Audio Event Tagging입니다.
여러 화자가 겹쳐 말해도 누가 말했는지 구분하는 Smart Diarization입니다.
단어 하나하나의 타이밍을 잡아 자막 싱크를 맞추는 Word-level Timestamp입니다.

 

Q4. 기업에서 쓰기에 보안은 어떤가요?
A. SOC 2와 ISO 27001 인증을 획득했다고 발표했습니다.
기업이 원하면 데이터를 서버에 남기지 않는 Zero Retention 옵션을 제공합니다.
GDPR도 준수합니다.
팀원 간 프로젝트 공유와 승인 프로세스, 접근 권한 세분화 관리도 지원합니다.

 

Q5. v3 출시 시점과 한국어 지원은 어떻게 답변됐나요?
A. 웨비나 Q&A에서 v3는 마무리 단계이며 1월 말, 늦어도 2월 중에 만날 수 있다고 답했습니다.
한국어 UI는 그해 안에 지원을 준비 중이라고 밝혔습니다.
숨소리나 피치 조절은 결과물 생성 후 미세 조정할 수 있는 파라미터를 연구 중이라고 했습니다.

 

 

총평: 상상이 현실이 되는 속도

오늘 웨비나의 메시지는 명확합니다. "상상만 하세요. 제작은 AI가 합니다."
텍스트 한 줄로 영상, 음성, 소리가 동시에 만들어지는 세상이 왔습니다.

 

누구보다 빠르게 이 변화의 물결에 올라타고 싶다면, 지금 바로 Studio 3.0을 경험해 보시길 바랍니다.

 

⚡ 일레븐랩스 Studio 3.0 체험하기 (공식)

 

Sonetho였습니다. ⚡