BATS - Convert2Speech
Text in Ihrer Stimme sprechen lassen – Voice-Cloning per Nvidia-GPU
Convert2Speech erzeugt gesprochene Audio-Dateien aus Text – in einer geklonten Stimme. Die Basis ist das AI-Modell Chatterbox (Nvidia-GPU-beschleunigt, 23 Sprachen): Sie liefern eine kurze Sprachstichprobe (WAV) der Wunschstimme, und BAT Server lässt den gewünschten Text – aus einer SRT-, VisTitle-Datei oder sogar aus vorhandenem Sprech-Audio – in dieser Stimme sprechen. Ideal für Hörbuch-Passagen, Podcasts und Voice-Over in einem konsistenten Timbre.
So richten Sie den Menüpunkt ein
„Convert2Speech“ wird über den Assistenten „Add function...“ angelegt (Rechtsklick im BIN → Add function... → Convert2Speech - Create cloned Voice). Die Fragen des Assistenten:
- Sprache („Please select the language.“): 23 Sprachen – u. a. Arabisch, Dänisch, Deutsch, Griechisch, Englisch, Spanisch, Finnisch, Französisch, Hebräisch, Hindi, Italienisch, Japanisch, Koreanisch, Malaysisch, Niederländisch, Norwegisch, Polnisch, Portugiesisch, Russisch, Schwedisch, Suaheli, Türkisch, Chinesisch.
- Stimm-Muster (Dateiauswahl, WAV): Die Stichprobe ist die Referenz für die Klon-Stimme. Empfohlene Qualität: mind. 10 Sekunden, 24 kHz oder mehr, einziger Sprecher, ohne Hintergrundgeräusch, möglichst professionell aufgenommen – und der gesprochene Text sowie die Emotion sollen zum gewünschten Ergebnis passen (z. B. Hörbuch-Ton für Hörbuch-Ausgaben). Ein Button im Dialog öffnet direkt die Voice-Over-Sprecheranlage von EDIUS zum Aufnehmen.
- Max. Stretch (0–50 %, Standard 10 %): Um die Sätze in die Zeitfenster des Originals zu bringen, darf die Sprechrate bis zu diesem Prozentsatz gedehnt werden. Empfohlen: weniger als 15 %; 0 % schaltet das Dehnen ab.
- Quellentyp: Menüpunkt für VisTitle-Quellen (Video) oder für Audio-Quellen registrieren.
- Ergebnis ins BIN? (Ja → Registrierung unter __BAT Server\Speech / Nein → nur Datei).
-
Platzierung (BIN oder Timeline) und Name (Vorschlag: „TTS
%“), dann [Preview '.bat0' file] / [Add menu entry].
So nutzen Sie es
- Rechtsklick auf die Quell-Datei (SRT-, VisTitle-Datei oder Audio/Video mit Sprache) → Untermenü Generate Speech → Ihr Convert2Speech-Eintrag.
- Hat die Quelle noch keinen Text (reines Audio/Video), transkribiert BAT Server sie zuerst per Whisper (Modell large-v2) – SRT und VisTitle-Dateien werden direkt gelesen.
- Darauf erzeugt Chatterbox die WAV-Datei in der geklonten Stimme – die Zeitstempel folgen der Frame-Rate des Clips, so dass die Sprechpassagen zum Original-Timing passen. Bei „ins BIN“ steht das Ergebnis direkt unter __BAT Server\Speech.
Wichtige Hinweise
- Qualität des Musters = Qualität des Ergebnisses: Rauschen, Hintergrundmusik oder wechselnde Sprecher im WAV-Sample spiegelt der Klon wider. Ein sauberes 10–30-s-Sample in Zielsprache und Ziel-Emotion ist der größte Hebel.
- Stretch mit Maß: Sätze, die in das Zeitfenster „nicht hineinpassen“, werden bis zum eingestellten Maximum gedehnt – größere Werte hörbar verzerren. Unter 15 % bleibt das Ergebnis naturklingend.
-
App-Pfad des Musters eingebrannt: Der vollständige Pfad der WAV-Datei steht in der
.bat0. Wird das Sample umgezogen, den Pfad in der.bat0anpassen oder den Eintrag neu anlegen. - GPU: Chatterbox läuft auf der Nvidia-GPU – ohne passende GPU ist der Eintrag nicht sinnvoll nutzbar.
Preset verwalten
Per Assistent angelegte Einträge sind Nutzer-Presets: Die .bat0-Datei liegt je nach Wahl unter C:\ProgramData\EdiusPowerTools\BAT-server\bat_files\BIN\ bzw. …\bat_files\timeline\ und kann frei bearbeitet, umbenannt oder gelöscht werden (Löschen entfernt den Kontextmenü-Eintrag). Sprache, Stimm-Muster-Pfad und Stretch-Wert sind in der .bat0 eingebrannt – Änderungen wirken ab der nächsten Ausführung.