⚡ 3 Punkte auf einen Blick
• Schluss mit manueller Studioarbeit: Tonfall, Betonung und schauspielerische Nuancen werden automatisch übernommen – ein Quantensprung gegenüber v1.
• Praxistest: Wir haben eine Schlüsselszene aus „Demon Slayer: Mugen Train“ vollständig automatisiert ins Deutsche synchronisiert.
• Globale Bühne für Creator: Erreichen Sie ein internationales Publikum mit Ihrer eigenen Stimme – ganz ohne externes Synchronstudio.
Hallo zusammen, hier spricht das ElevenLabs Team. ⚡
Mit der Ankündigung des Dubbing v2-Updates hatten wir versprochen, die KI auf Herz und Nieren zu prüfen.
Wir haben Wort gehalten: Wir haben eine Schlüsselszene aus „Demon Slayer: Mugen Train“ genommen und sie mit v2 ins Deutsche übersetzt und synchronisiert.
Unser Fazit: Die Leistung ist schlichtweg beeindruckend. Die letzten zwei Prozent, die bisher zur Perfektion fehlten, sind nicht nur da – sie wurden übertroffen.
▲ ElevenLabs Dubbing v2 · Automatische deutsche Synchronisation (Original Japanisch → Deutsch) · Speaker Similarity 7
Warum v1 oft an Grenzen stieß
Wie wir bereits in unserem Artikel über Animation-Dubbing (Clip vs. Track vs. IVC) besprochen haben, sah der Workflow zu v1-Zeiten oft so aus:
Die Synchronität zum Lippenbild war teils unpräzise, was eine aufwendige Nachbearbeitung erforderte.
Man musste jeden einzelnen Clip im Studio manuell zuschneiden und dafür spezifische Klone erstellen.
Dies führte oft dazu, dass der Tonfall innerhalb einer Figur schwankte – sie klang mitunter wie zwei verschiedene Personen.
Da die Trainingsdaten auf kurze Schnipsel begrenzt waren, blieb das Ergebnis oft instabil.
Man musste unzählige Male neu rendern, um ein akzeptables Ergebnis zu erzielen – und selbst dann fehlte oft das „gewisse Etwas“.
Kurz gesagt: Es fühlte sich weniger nach „die KI nimmt mir die Arbeit ab“ an, sondern eher nach „ich synchronisiere mühsam mit KI-Unterstützung“.
v2: Überzeugende Ergebnisse ohne Studio-Stress
Die Performance von v2 hat uns wirklich überrascht.
Ganz ohne manuelle Nachbearbeitung lieferte der erste Durchlauf:
Eine verblüffende Ähnlichkeit in Tonfall und Betonung zum Originalsprecher.
Eine tiefgreifende schauspielerische Nuance (Emotionswiedergabe).
Die manuelle Kleinarbeit des Clip-Schneidens entfällt komplett.
Im Vergleich zu v1 ist das ein gewaltiger Sprung nach vorn.
Hören Sie sich das Video oben an – das „künstliche, abgehackte Gefühl“ früherer KI-Lösungen ist praktisch verschwunden.
Ein entscheidendes Setting: Speaker Similarity
In den Advanced-Einstellungen von v2 finden Sie den Regler „Speaker similarity“.
Dieser steuert die Balance zwischen „Stimmliche Ähnlichkeit zum Original“ und „Natürlichkeit in der Zielsprache“.
Für unsere „Mugen Train“-Synchronisation haben wir den Standardwert 7 gewählt (auf einer Skala von 0 bis 10).

▲ Einstellung 7: Eine ideale Balance – natürlich klingendes Deutsch mit der Nuance der Original-Betonung
Sie können den Regler an die beiden Extreme anpassen. Wir haben die gleiche Szene mit 0 und 10 getestet, damit Sie den direkten Vergleich sehen können.
Wert | Ergebnis |
|---|---|
0 (Natürlich) | Höhere dynamische Bandbreite, klingt wie ein professioneller Sprecher. |
7 (Empfohlen) | Der ideale Mittelweg: Natürlich & Wiedererkennung (Wir empfehlen 4–7) |
10 (Originalgetreu) | Maximale stimmliche Ähnlichkeit zum Original, |
🔊 Speaker similarity 0 — Maximale Natürlichkeit

▲ Einstellung 0: Die flüssigste Performance in der Zielsprache
Überraschenderweise war 0 für uns am besten.
Die emotionale Spannweite war viel größer und es wirkte wie von einem Profi vertont.
Obwohl „geringere Ähnlichkeit“ draufsteht, war die Qualität der deutschen Synchronisation bei 0 am überzeugendsten.
🔊 Speaker similarity 10 — Maximale Originalnähe

▲ Einstellung 10: Maximale Betonung der Original-Intonation (kann auf Deutsch starr wirken)
Im Gegensatz dazu wirkte 10 deutlich steifer.
Da die KI versucht, die exakte Intonation des japanischen Originals zu erzwingen, leidet die deutsche Sprachmelodie und wirkt zuweilen hölzern.
🎬 0 vs 10 — Der direkte Vergleich
▲ Dieselbe Szene mit 0 (Fokus auf Natürlichkeit) vs. 10 (Fokus auf Original-Intonation)
Der Unterschied ist deutlich, oder?
Zusammenfassend lässt sich sagen: Je niedriger der Wert, desto natürlicher klingt die Zielsprache. Je höher der Wert, desto stärker wird versucht, die originale Sprechweise zu kopieren.
Bei Inhalten, in denen Emotion und Schauspiel wichtig sind, sind niedrigere Werte oft besser. Wir empfehlen, je nach Videotyp zwischen 4 und 7 zu experimentieren.
Ein Punkt: Eigennamen benötigen Aufmerksamkeit
Die Qualität der automatischen Übersetzung ist bereits erstaunlich gut, aber bei Eigennamen sollten Sie immer eine manuelle Prüfung einplanen.
Beispiel: In „Demon Slayer“ werden die Dämonen im Deutschen korrekt als „Dämonen“ bezeichnet.
Die KI-Übersetzung hatte sie zu Beginn manchmal falsch übersetzt. 😅
Fans des Genres merken solche Details sofort. Deshalb bleibt eine kurze redaktionelle Prüfung der Begriffe unerlässlich – was durchaus begrüßenswert ist, da so die kreative Kontrolle beim Menschen bleibt.
💡 Hinweis: Da v2 derzeit eine Alpha-Phase durchläuft, sind einige Features wie der Dubbing-Studio-Editor noch in der Entwicklung.
Nach dem offiziellen Launch wird man Übersetzungen direkt im Editor anpassen können (was die Korrektur von Eigennamen massiv vereinfacht!).
Was das bedeutet — Die Revolution des Dubbing-Marktes
Dass man eine solche Qualität mit wenigen Klicks erreicht, ist mehr als nur ein Update.
Der Synchronisationsmarkt steht vor einem Wandel: Preis-Leistungs-Verhältnis und Lieferzeiten klassischer Studios geraten unter Druck.
Ein riesiger Vorteil für Creator: Sie können nun mit Ihrer eigenen Stimme ein globales Publikum erreichen – ohne externe Synchronsprecher buchen zu müssen.
Wer über internationale Kanäle nachdenkt, für den ist Dubbing v2 kein „Nice-to-have“ mehr, sondern ein neuer Standard.
Jetzt selbst testen
Für neue User gibt es aktuell: Kostenlose Testminuten bei Wahl eines Creator-Plans (Starter: 15 Min, Free: 1 Min).
Die oben gezeigte „Mugen Train“-Szene können Sie problemlos mit diesen Minuten selbst nachbauen.
※ Der Link oben ist ein Partnerlink von ElevenLabs (für Sie entstehen keine zusätzlichen Kosten).
📚 Weiterführende Lektüre
ElevenLabs Dubbing v2 ist da! — Über 90 Sprachen mit dem Ausdruck des Originals
Ankündigung · Alle Details zu v2
Synchronisation mit 99 % Übereinstimmung: Die Methoden des Cloning
ElevenLabs-Tipps · Manueller Workflow vs. KI-Automation
Das ultimative Dubbing-Handbuch: Videos automatisch übersetzen und vertonen
ElevenLabs-Tipps · Der klassische Workflow
🚀 Fazit
Die „künstliche“ Barriere von v1 ist mit v2 nahezu gefallen.
Natürlich bleibt die finale redaktionelle Prüfung bei Ihnen, aber die Messlatte wurde ein großes Stück nach oben verschoben.
Ihre Kanäle können ab heute grenzenlos wachsen – mit Ihrer eigenen Stimme!
Viel Erfolg beim Erstellen neuer Inhalte!
ElevenLabs Team ⚡
❓ Häufig gestellte Fragen (FAQ)
Q1. Was ist der größte Unterschied zu v1?
A. Das Ergebnis ist nun direkt verwendbar, ohne dass eine Nachbearbeitung im Dubbing Studio erforderlich ist.
Bei v1 mussten wir die Audioclips einzeln zuschneiden und für jeden Abschnitt eine eigene Kopie erstellen.
Dadurch klang derselbe Charakter in jeder Szene wie eine andere Person.
v2 erfasst mit einer einzigen Ausgabe den Ton, die Intonation und den emotionalen Ausdruck des Originalsprechers.
Q2. Was ist die Speaker Similarity und welcher Wert ist empfehlenswert?
A. Dies ist ein Regler, mit dem Sie steuern, wie stark die synchronisierte Stimme dem Originalsprecher ähnelt oder wie natürlich sie in der Zielsprache klingt.
Der Bereich liegt zwischen 0 und 10 und befindet sich im Menü Advanced.
Für das aktuelle Dubbing von "Demon Slayer: Mugen Train" haben wir den Standardwert 7 verwendet.
Wir empfehlen, je nach Inhalt einen Wert zwischen 4 und 7 zu wählen.
Q3. Ist ein niedriger Wert schlechter, weil er dem Original weniger ähnelt?
A. Nach unseren Tests war 0 überraschenderweise das beste Ergebnis.
Die emotionale Bandbreite der Stimme war deutlich größer und klang wie von einem professionellen Sprecher vertont.
Im Gegensatz dazu versuchte die Einstellung 10 die ursprüngliche Intonation so exakt beizubehalten, dass die Tonlage im Deutschen flach und starr wirkte.
Je wichtiger Emotion und Schauspiel für Ihren Inhalt sind, desto vorteilhafter ist ein niedrigerer Wert.
Q4. Kann ich die automatische Übersetzung direkt verwenden?
A. Die Qualität der automatischen Übersetzung ist besser als erwartet.
Sie sollten jedoch Eigennamen unbedingt manuell überprüfen.
In der offiziellen deutschen Fassung von "Demon Slayer" werden Dämonen als '혈귀' bezeichnet.
Die automatische Übersetzung hat dies jedoch als '도깨비' wiedergegeben.
Der Sinn bleibt zwar erhalten, aber für Fans wirkt dies sofort unnatürlich.
Q5. Kann ich die Übersetzung im Dubbing Studio bearbeiten?
A. Zum Zeitpunkt dieses Beitrags befindet sich v2 noch in der Alpha-Phase, weshalb die Funktionen des Dubbing Studios noch nicht aktiv sind.
Nach der offiziellen Veröffentlichung wird es voraussichtlich möglich sein, Übersetzungen direkt zu bearbeiten.
Dies wird die Korrektur von Eigennamen erheblich erleichtern.
Q6. Kann ich das Angebot kostenlos testen?
A. Für den Creator-Plan und höher sind 30 Minuten Synchronisation in den ersten 7 Tagen kostenlos enthalten.
Starter bietet 15 Minuten und Free 1 Minute.
Sie können das in diesem Beitrag gezeigte "Mugen Train"-Dubbing problemlos mit diesem kostenlosen Kontingent testen.