diff --git a/requirements/server.txt b/requirements/server.txt index 2fc1170..90eaa86 100644 --- a/requirements/server.txt +++ b/requirements/server.txt @@ -1,4 +1,4 @@ -faster-whisper==1.1.0 +faster-whisper==1.2.0 websockets onnxruntime==1.17.0 numba diff --git a/whisper_live/backend/faster_whisper_backend.py b/whisper_live/backend/faster_whisper_backend.py index 8df189e..60cf3cd 100644 --- a/whisper_live/backend/faster_whisper_backend.py +++ b/whisper_live/backend/faster_whisper_backend.py @@ -76,7 +76,7 @@ class ServeClientFasterWhisper(ServeClientBase): self.language = "en" if self.model_size_or_path.endswith("en") else language self.task = task self.initial_prompt = initial_prompt - self.vad_parameters = vad_parameters or {"onset": 0.5} + self.vad_parameters = vad_parameters or {"threshold": 0.5} device = "cuda" if torch.cuda.is_available() else "cpu" if device == "cuda": diff --git a/whisper_live/transcriber/transcriber_faster_whisper.py b/whisper_live/transcriber/transcriber_faster_whisper.py index cfa2e56..c9828bc 100644 --- a/whisper_live/transcriber/transcriber_faster_whisper.py +++ b/whisper_live/transcriber/transcriber_faster_whisper.py @@ -27,7 +27,6 @@ from faster_whisper.vad import ( VadOptions, collect_chunks, get_speech_timestamps, - merge_segments, ) @@ -407,8 +406,7 @@ class BatchedInferencePipeline: **vad_parameters, max_speech_duration_s=chunk_length ) - active_segments = get_speech_timestamps(audio, vad_parameters) - clip_timestamps = merge_segments(active_segments, vad_parameters) + clip_timestamps = get_speech_timestamps(audio, vad_parameters) # run the audio if it is less than 30 sec even without clip_timestamps elif duration < chunk_length: clip_timestamps = [{"start": 0, "end": audio.shape[0]}]