BATS - Convert2Speech

Text in Ihrer Stimme sprechen lassen – Voice-Cloning per Nvidia-GPU

Convert2Speech erzeugt gesprochene Audio-Dateien aus Text – in einer geklonten Stimme. Die Basis ist das AI-Modell Chatterbox (Nvidia-GPU-beschleunigt, 23 Sprachen): Sie liefern eine kurze Sprachstichprobe (WAV) der Wunschstimme, und BAT Server lässt den gewünschten Text – aus einer SRT-, VisTitle-Datei oder sogar aus vorhandenem Sprech-Audio – in dieser Stimme sprechen. Ideal für Hörbuch-Passagen, Podcasts und Voice-Over in einem konsistenten Timbre.

So richten Sie den Menüpunkt ein

„Convert2Speech“ wird über den Assistenten „Add function...“ angelegt (Rechtsklick im BIN → Add function... → Convert2Speech - Create cloned Voice). Die Fragen des Assistenten:

  1. Sprache („Please select the language.“): 23 Sprachen – u. a. Arabisch, Dänisch, Deutsch, Griechisch, Englisch, Spanisch, Finnisch, Französisch, Hebräisch, Hindi, Italienisch, Japanisch, Koreanisch, Malaysisch, Niederländisch, Norwegisch, Polnisch, Portugiesisch, Russisch, Schwedisch, Suaheli, Türkisch, Chinesisch.
  2. Stimm-Muster (Dateiauswahl, WAV): Die Stichprobe ist die Referenz für die Klon-Stimme. Empfohlene Qualität: mind. 10 Sekunden, 24 kHz oder mehr, einziger Sprecher, ohne Hintergrundgeräusch, möglichst professionell aufgenommen – und der gesprochene Text sowie die Emotion sollen zum gewünschten Ergebnis passen (z. B. Hörbuch-Ton für Hörbuch-Ausgaben). Ein Button im Dialog öffnet direkt die Voice-Over-Sprecheranlage von EDIUS zum Aufnehmen.
  3. Max. Stretch (0–50 %, Standard 10 %): Um die Sätze in die Zeitfenster des Originals zu bringen, darf die Sprechrate bis zu diesem Prozentsatz gedehnt werden. Empfohlen: weniger als 15 %; 0 % schaltet das Dehnen ab.
  4. Quellentyp: Menüpunkt für VisTitle-Quellen (Video) oder für Audio-Quellen registrieren.
  5. Ergebnis ins BIN? (Ja → Registrierung unter __BAT Server\Speech / Nein → nur Datei).
  6. Platzierung (BIN oder Timeline) und Name (Vorschlag: „TTS %“), dann [Preview '.bat0' file] / [Add menu entry].

So nutzen Sie es

  1. Rechtsklick auf die Quell-Datei (SRT-, VisTitle-Datei oder Audio/Video mit Sprache) → Untermenü Generate Speech → Ihr Convert2Speech-Eintrag.
  2. Hat die Quelle noch keinen Text (reines Audio/Video), transkribiert BAT Server sie zuerst per Whisper (Modell large-v2) – SRT und VisTitle-Dateien werden direkt gelesen.
  3. Darauf erzeugt Chatterbox die WAV-Datei in der geklonten Stimme – die Zeitstempel folgen der Frame-Rate des Clips, so dass die Sprechpassagen zum Original-Timing passen. Bei „ins BIN“ steht das Ergebnis direkt unter __BAT Server\Speech.

Wichtige Hinweise

  • Qualität des Musters = Qualität des Ergebnisses: Rauschen, Hintergrundmusik oder wechselnde Sprecher im WAV-Sample spiegelt der Klon wider. Ein sauberes 10–30-s-Sample in Zielsprache und Ziel-Emotion ist der größte Hebel.
  • Stretch mit Maß: Sätze, die in das Zeitfenster „nicht hineinpassen“, werden bis zum eingestellten Maximum gedehnt – größere Werte hörbar verzerren. Unter 15 % bleibt das Ergebnis naturklingend.
  • App-Pfad des Musters eingebrannt: Der vollständige Pfad der WAV-Datei steht in der .bat0. Wird das Sample umgezogen, den Pfad in der .bat0 anpassen oder den Eintrag neu anlegen.
  • GPU: Chatterbox läuft auf der Nvidia-GPU – ohne passende GPU ist der Eintrag nicht sinnvoll nutzbar.

Preset verwalten

Per Assistent angelegte Einträge sind Nutzer-Presets: Die .bat0-Datei liegt je nach Wahl unter C:\ProgramData\EdiusPowerTools\BAT-server\bat_files\BIN\ bzw. …\bat_files\timeline\ und kann frei bearbeitet, umbenannt oder gelöscht werden (Löschen entfernt den Kontextmenü-Eintrag). Sprache, Stimm-Muster-Pfad und Stretch-Wert sind in der .bat0 eingebrannt – Änderungen wirken ab der nächsten Ausführung.