#6929 语音识别阶段出错[faster-whisper(内置)] No transcription results returned. Please check the original audio/video [info.duration_aft

171.91.**4 Posted at: 2 hours ago

语音识别阶段出错[faster-whisper(内置)] No transcription results returned. Please check the original audio/video [info.duration_after_vad=0.0s].
info=TranscriptionInfo(language='ja', language_probability=1, duration=3118.4946875, duration_after_vad=0.0, all_language_probs=None, transcription_options=TranscriptionOptions(beam_size=5, best_of=5, patience=1, length_penalty=1, repetition_penalty=1.5, no_repeat_ngram_size=0, log_prob_threshold=-1.0, no_speech_threshold=0.6, compression_ratio_threshold=1.0, condition_on_previous_text=True, prompt_reset_on_temperature=0.5, temperatures=[0.0], initial_prompt=None, prefix=None, suppress_blank=True, suppress_tokens=(1, 2, 7, 8, 9, 10, 14, 25, 26, 27, 28, 29, 31, 58, 59, 60, 61, 62, 63, 90, 91, 92, 93, 359, 503, 522, 542, 873, 893, 902, 918, 922, 931, 1350, 1853, 1982, 2460, 2627, 3246, 3253, 3268, 3536, 3846, 3961, 4183, 4667, 6585, 6647, 7273, 9061, 9383, 10428, 10929, 11938, 12033, 12331, 12562, 13793, 14157, 14635, 15265, 15618, 16553, 16604, 18362, 18
......
Please check the original audio/video [info.duration_after_vad=0.0s].
info=TranscriptionInfo(language='ja', language_probability=1, duration=3118.4946875, duration_after_vad=0.0, all_language_probs=None, transcription_options=TranscriptionOptions(beam_size=5, best_of=5, patience=1, length_penalty=1, repetition_penalty=1.5, no_repeat_ngram_size=0, log_prob_threshold=-1.0, no_speech_threshold=0.6, compression_ratio_threshold=1.0, condition_on_previous_text=True, prompt_reset_on_temperature=0.5, temperatures=[0.0], initial_prompt=None, prefix=None, suppress_blank=True, suppress_tokens=(1, 2, 7, 8, 9, 10, 14, 25, 26, 27, 28, 29, 31, 58, 59, 60, 61, 62, 63, 90, 91, 92, 93, 359, 503, 522, 542, 873, 893, 902, 918, 922, 931, 1350, 1853, 1982, 2460, 2627, 3246, 3253, 3268, 3536, 3846, 3961, 4183, 4667, 6585, 6647, 7273, 9061, 9383, 10428, 10929, 11938, 12033, 12331, 12562, 13793, 14157, 14635, 15265, 15618, 16553, 16604, 18362, 18956, 20075, 21675, 22520, 26130, 26161, 26435, 28279, 29464, 31650, 32302, 32470, 36865, 42863, 47425, 49870, 50254, 50258, 50359, 50360, 50361, 50362, 50363), without_timestamps=False, max_initial_timestamp=1.0, word_timestamps=True, prepend_punctuations='"\'“¿([{-', append_punctuations='"\'.。,,!!??::”)]}、', multilingual=False, max_new_tokens=None, clip_timestamps=[0.0], hallucination_silence_threshold=None, hotwords=''), vad_options=VadOptions(threshold=0.5, neg_threshold=None, min_speech_duration_ms=0, max_speech_duration_s=inf, min_silence_duration_ms=140, speech_pad_ms=400))
[SpeechToText]语音转录: self.out_format='srt',self.copysrt_rawvideo=True,self.spk_insert=False
[TaskCfgSTT]
原始输入文件名: F:/新建文件夹/2/honnamatv-399.mp4,
输出结果保存到文件夹: D:/BaiduNetdiskDownload/win-pyvideotrans-v4.11/output/recogn,
临时文件夹: D:/win-pyvideotrans-v4.11/tmp/12720/d219b0927f
已启用CUDA加速
未选 降噪
语音识别:faster-whisper(内置), large-v3 断句方式:默认断句
发音语言:ja
未选 降噪


=
system:Windows-10-10.0.19045-SP0
version:v4.11
frozen:True
language:zh
root_dir:D:/win-pyvideotrans-v4.11

3 Replies

#1 DeepSeek reply at 2 hours ago

这是由于 VAD(语音活动检测)将整个音频判定为静音,导致识别出的有效语音时长为 0 秒。日志中 duration_after_vad=0.0s 即表示此问题。原始音频时长约 3118 秒(约 52 分钟),但 VAD 后有效时长为 0,说明音频全部被过滤为静音。

可能原因:音频本身无清晰人声/音量过低;音频流解码异常;VAD 阈值设置不当;VAD 模型文件损坏或不完整;GPU 加速时 VAD 运行异常。

解决方案按顺序尝试:

  1. 先用播放器试听该视频,确认从开头到结尾是否有清晰的日语人声,且音量正常。
  2. 进入 菜单 -> 工具 -> 高级选项 -> 语音识别参数,将“语音阈值”调低到 0.2 或 0.3,“非语音阈值”调高到 0.7 或 0.8,保存后重试。
  3. 取消勾选“CUDA加速”,改用 CPU 运行,排除 GPU 兼容性问题。
  4. 检查 models/onnx/ 目录下是否有 seg_model.onnx 等 VAD 模型文件,若缺失或认为下载不完整,可手动下载后覆盖(参考官方文档“手动下载模型”页面)。
  5. 若仍失败,请提供 logs/ 目录下最新日志文件底部约 30 行报错信息,以便进一步分析。

请查阅相关文档:

#2 171.91.**4 reply at 2 hours ago

已启用CUDA加速
未选 降噪
语音识别:faster-whisper(内置), large-v3 断句方式:默认断句
发音语言:ja
未选 降噪

[DEBUG] [新进程任务 开始:title='Model: large-v3']
[DEBUG] 新进程任务 参数:kwargs={'detect_language': 'ja', 'model_name': 'large-v3', 'logs_file': 'D:/win-pyvideotrans-v4.11/tmp/12720/f19863f6bc/faster-ja-1787906257.1802227.log', 'is_cuda': True, 'no_speech_threshold': 0.6, 'condition_on_previous_text': True, 'speech_timestamps': 'D:/win-pyvideotrans-v4.11/tmp/12720/f19863f6bc/speech_timestamps_1787906257.1792247.json', 'audio_file': 'D:/win-pyvideotrans-v4.11/tmp/12720/f19863f6bc/蓝毛-1787906216.8428931.wav', 'local_dir': 'D:/win-pyvideotrans-v4.11/models/models--Systran--faster-whisper-large-v3', 'compute_type': 'float16', 'jianfan': False, 'audio_duration': 3500779, 'hotwords': '', 'prompt': '', 'beam_size': 5, 'best_of': 5, 'temperature': '0.0', 'repetition_penalty': 1.5, 'compression_ratio_threshold': 1.0, 'max_speech_ms': 10000, 'subtitle_srt': 'D:/win-pyvideotrans-v4.11/tmp/faster-20260828-16_37_37.srt', 'device_index': 0}
[DEBUG] 开始加载 faster-whisper模型large-v3,数据类型:float16
[DEBUG] [faster_whisper]加载模型large-v3: is_cuda=True,_compute_type='float16'
[DEBUG] 预先VAD处理后,将断句时间数据传给 BatchedInferencePipeline 批量识别,batch_size=4
[DEBUG] faster-whisper模式下,预先使用VAD分割音频,对large-v3模型返回的文字结果直接使用
[DEBUG] faster-whisper下已临时保存识别结果到 D:/win-pyvideotrans-v4.11/tmp/faster-20260828-16_37_37.srt,防止进程崩溃后永久等待
[DEBUG] [新进程任务 title='Model: large-v3'] 已返回
[DEBUG] [新进程任务 结束:title='Model: large-v3'],耗时52.497323513031006s

[ERROR] trk=[SpeechToText]语音转录: self.out_format='srt',self.copysrt_rawvideo=True,self.spk_insert=False
[TaskCfgSTT]
原始输入文件名: F:/新建文件夹/2/蓝毛.mp4,
输出结果保存到文件夹: D:/BaiduNetdisk


/win-pyvideotrans-v4.11/output/recogn,
临时文件夹: D:/win-pyvideotrans-v4.11/tmp/12720/f19863f6bc
已启用CUDA加速
未选 降噪
语音识别:faster-whisper(内置), large-v3 断句方式:默认断句
发音语言:ja
未选 降噪
[ERROR] 没有识别到任何说话声,请确认所选音视频中是否包含人类说话声,以及说话语言是否同所选一致
Traceback (most recent call last):
File "videotrans\task\job.py", line 35, in run
File "videotrans\task\job.py", line 102, in process_task
File "videotrans\task\speech2text.py", line 100, in recogn
File "videotrans\recognition\__init__.py", line 211, in run
File "videotrans\recognition\_base.py", line 102, in run
videotrans.configure.excepts.SpeechToTextError: 没有识别到任何说话声,请确认所选音视频中是否包含人类说话声,以及说话语言是否同所选一致

#3 DeepSeek reply at 2 hours ago

<VAD 将整个音频判定为静音,导致有效语音时长 duration_after_vad=0.0。原始音频时长约3500秒,却没有任何语音片段被保留。请按以下顺序排查:

  1. 试听提取出的音频:用播放器打开 D:/win-pyvideotrans-v4.11/tmp/12720/f19863f6bc/蓝毛-1787906216.8428931.wav,确认是否有清晰日语人声。若无声,说明原视频音轨为空或音频解码异常。
  2. 取消CUDA加速:在软件主界面取消勾选“CUDA加速”后重新执行,排除GPU环境下VAD运行异常的可能。
  3. 检查VAD模型:进入 软件目录/models/onnx/,确认是否存在 seg_model.onnx 等VAD模型文件。若缺失或怀疑下载不完整,请按官方文档手动下载并覆盖。
  4. 调整VAD阈值:进入 菜单 -> 工具 -> 高级选项 -> 语音识别参数,将“语音阈值”调低至0.2,“非语音阈值”调高至0.7,保存后重试。
  5. 避免中文路径:将视频移动到纯英文数字目录(如 D:/test/lanmao.mp4)再试,防止底层解析异常。

若以上操作均无效,请提供 logs/ 目录下最新日志文件底部约30行报错内容,以便进一步分析。

请查阅相关文档:

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource