BATS - Speech2Subtitle
Untertitel aus gesprochener Sprache – Whisper mit wörtlich-genauem Timing, in drei Hardware-Varianten
Speech2Subtitle erzeugt aus einer Audio-Datei (oder dem Audio eines Clips) eine SRT-Datei mit exaktem Wort-Timing – per Whisper, dem bewährten AI-Transkriptionsmodell. Im „Add function...“-Assistenten stehen dafür drei Varianten zur Auswahl, je nach Hardware: Intel-optimiert (OpenVINO: NPU/GPU/CPU), Nvidia-optimiert (Whisper-Faster) oder iNPU-optimiert (Whisper-NPU für Intel-NPUs). Alle drei transkribieren in ~90 Sprachen, können das Ergebnis optional ins Englische übersetzen und legen das fertige SRT direkt im BIN ab.
So richten Sie den Menüpunkt ein
Im Assistenten (Rechtsklick im BIN → Add function...) die passende Variante wählen – Speech2Subtitle - Intel optimized, … Nvidia optimized oder … iNPU optimized. Die gemeinsamen Fragen:
- Sprache: „Auto-Detect The Language“ oder eine von ~90 Sprachen (Afrikaans … Yoruba).
- Übersetzen? „Do you want to translate the result to English?“ – Ja, dann transkribiert Whisper direkt in englischen Text (z. B. für Fremdsprach-Interviewe).
- Umfang: gesamtes Video oder der IN/OUT-Teil des Clips.
- Platzierung (BIN oder Timeline) und Name des Menüpunkts – die Assistenten füllen das Feld sinnvoll vor (z. B. „German, standard, Model Medium, NPU“).
Varianten-spezifische Fragen zusätzlich:
- Intel-Optimierung (OpenVINO): Gerät (Intel NPU / Intel GPU / CPU – auch AMD), Untertitel-Format (standard: max. 42 Zeichen/Zeile, max. 2 Zeilen · standard asia: max. 16 Zeichen/Zeile · ein Satz pro Zeile – prima für TTS · ein Wort pro Zeile) und Modellgröße (Tiny, Base, Small, Medium – Empfehlung, Large V2, Large V3; größer = präziser, aber langsamer).
- Nvidia-Optimierung (Whisper-Faster): gleiches Untertitel-Format, dazu Hochpräzision (float16) – verpflichtend ab der RTX-5000-Serie, ohne Nvidia-GPU einfach „Nein“ – und Modellgröße (Tiny … Large V3, Turbo; Medium empfohlen).
- iNPU-Optimierung (Whisper-NPU): Hardware wählen (NPU / GPU / CPU – muss Intel-Hardware sein) und Untertitel-Format. Das Modell ist hier fest auf medium voreingestellt, und eine VAD-Phasenerkennung (Silenz-Erkennung) ist dauerhaft aktiv. Hinweis aus dem Assistenten: Intel-NPU-Treiber aktuell halten (Version 32.0.100.3053 oder neuer).
So nutzen Sie es
- Rechtsklick auf einen Audio-Clip im BIN → Untermenü Generate Subtitle → Ihr Eintrag (z. B. „German, standard, Model Medium, NPU“).
- BAT Server extrahiert zunächst das Audio (16 kHz Mono, ggf. IN/OUT-Teil) und lässt Whisper transkribieren – Fortschritt in der Job-Anzeige.
- Das fertige SRT wird automatisch im BIN unter __BAT Server\Subtitle registriert (Datei-Stempel
_stt, bei der Intel-Variante mit Format-Kürzel). Von dort lässt es sich z. B. mit SubtitleMerge in eine MKV übernehmen oder als Sprechvorlage für Text2Speech/Convert2Speech verwenden.
Wichtige Hinweise
- Variante = Hardware: Nvidia-GPU → Nvidia-Variante (am schnellsten auf RTX); Intel-System mit NPU → iNPU-Variante (und aktuellster NPU-Treiber); alles andere (Intel/AMD ohne NPU) → Intel-OpenVINO-Variante (GPU oder CPU).
- Modellgröße abwägen: Medium ist der vernünftige Standard; Large/Turbo sind präziser (v. a. Mund-artikel, Fachbegriffe), brauchen aber deutlich mehr Zeit – bei der Nvidia-Variante ab RTX 5000 zwingend mit float16.
- Zeilenformate: „standard“/„standard asia“ sind für die Anzeige als Untertitel gedacht; „ein Satz pro Zeile“ optimiert das SRT für nachgeschaltete Text2Speech-Presets, „ein Wort pro Zeile“ für maximale Granularität (z. B. Marker-Verfahren).
- Neue Datei, Original bleibt: Es wird nur die SRT-Datei erzeugt; das Audio-Original bleibt unverändert.
Preset verwalten
Per Assistent angelegte Einträge sind Nutzer-Presets: Die .bat0-Datei liegt je nach Wahl unter C:\ProgramData\EdiusPowerTools\BAT-server\bat_files\BIN\ bzw. …\bat_files\timeline\ und kann frei bearbeitet, umbenannt oder gelöscht werden (Löschen entfernt den Kontextmenü-Eintrag). Sprache, Übersetzung, Format, Modell und Gerät sind in der .bat0 eingebrannt – Änderungen wirken ab der nächsten Ausführung.