From c43eb1dd5a6f49fd9b7c95a083c8945f4f25ae29 Mon Sep 17 00:00:00 2001 From: Alex Stansfield Date: Tue, 7 Oct 2025 14:20:20 +0000 Subject: [PATCH] update to support faster whisper 1.2.0 --- requirements/server.txt | 2 +- whisper_live/backend/faster_whisper_backend.py | 2 +- whisper_live/transcriber/transcriber_faster_whisper.py | 4 +--- 3 files changed, 3 insertions(+), 5 deletions(-) diff --git a/requirements/server.txt b/requirements/server.txt index 76319ad..833015b 100644 --- a/requirements/server.txt +++ b/requirements/server.txt @@ -1,4 +1,4 @@ -faster-whisper==1.1.0 +faster-whisper==1.2.0 websockets onnxruntime==1.17.0 numba diff --git a/whisper_live/backend/faster_whisper_backend.py b/whisper_live/backend/faster_whisper_backend.py index 8df189e..60cf3cd 100644 --- a/whisper_live/backend/faster_whisper_backend.py +++ b/whisper_live/backend/faster_whisper_backend.py @@ -76,7 +76,7 @@ class ServeClientFasterWhisper(ServeClientBase): self.language = "en" if self.model_size_or_path.endswith("en") else language self.task = task self.initial_prompt = initial_prompt - self.vad_parameters = vad_parameters or {"onset": 0.5} + self.vad_parameters = vad_parameters or {"threshold": 0.5} device = "cuda" if torch.cuda.is_available() else "cpu" if device == "cuda": diff --git a/whisper_live/transcriber/transcriber_faster_whisper.py b/whisper_live/transcriber/transcriber_faster_whisper.py index cfa2e56..c9828bc 100644 --- a/whisper_live/transcriber/transcriber_faster_whisper.py +++ b/whisper_live/transcriber/transcriber_faster_whisper.py @@ -27,7 +27,6 @@ from faster_whisper.vad import ( VadOptions, collect_chunks, get_speech_timestamps, - merge_segments, ) @@ -407,8 +406,7 @@ class BatchedInferencePipeline: **vad_parameters, max_speech_duration_s=chunk_length ) - active_segments = get_speech_timestamps(audio, vad_parameters) - clip_timestamps = merge_segments(active_segments, vad_parameters) + clip_timestamps = get_speech_timestamps(audio, vad_parameters) # run the audio if it is less than 30 sec even without clip_timestamps elif duration < chunk_length: clip_timestamps = [{"start": 0, "end": audio.shape[0]}]