#7277 语音识别阶段出错[faster-whisper(内置)] No transcription results returned. Please check the original audio/video [info.duration_aft

171.91**9 Posted at: 2 hours ago

语音识别阶段出错[faster-whisper(内置)] No transcription results returned. Please check the original audio/video [info.duration_after_vad=0.0s].
info=TranscriptionInfo(language='nn', language_probability=0.61328125, duration=880.2133125, duration_after_vad=0.0, all_language_probs=[('nn', 0.61328125), ('en', 0.11981201171875), ('ja', 0.04107666015625), ('la', 0.03125), ('ru', 0.02471923828125), ('es', 0.023773193359375), ('cy', 0.0209808349609375), ('de', 0.015472412109375), ('fr', 0.0146484375), ('pt', 0.0132293701171875), ('ko', 0.012725830078125), ('it', 0.0123291015625), ('pl', 0.007843017578125), ('tr', 0.00634765625), ('zh', 0.00620269775390625), ('jw', 0.0038509368896484375), ('nl', 0.003589630126953125), ('ar', 0.00342559814453125), ('haw', 0.0020618438720703125), ('ms', 0.0019359588623046875), ('vi', 0.0017766952514648438), ('ro', 0.0015926361083984375), ('id', 0.0015077590942382812), ('cs', 0.0014276504516601562), ('km', 0.00131988525390625), ('fi', 0.0012302398681640625), ('hi', 0.0011
......
, ('mk', 1.0728836059570312e-06), ('mt', 5.960464477539062e-07), ('ln', 2.980232238769531e-07), ('as', 5.960464477539063e-08), ('am', 5.960464477539063e-08), ('uz', 0.0), ('tk', 0.0), ('tg', 0.0), ('lb', 0.0), ('so', 0.0), ('mg', 0.0), ('tt', 0.0), ('ha', 0.0), ('ba', 0.0), ('su', 0.0)], transcription_options=TranscriptionOptions(beam_size=5, best_of=5, patience=1, length_penalty=1, repetition_penalty=1.1, no_repeat_ngram_size=0, log_prob_threshold=-1.0, no_speech_threshold=0.35, compression_ratio_threshold=2.4, condition_on_previous_text=False, prompt_reset_on_temperature=0.5, temperatures=[0.0], initial_prompt=None, prefix=None, suppress_blank=True, suppress_tokens=(1, 2, 7, 8, 9, 10, 14, 25, 26, 27, 28, 29, 31, 58, 59, 60, 61, 62, 63, 90, 91, 92, 93, 359, 503, 522, 542, 873, 893, 902, 918, 922, 931, 1350, 1853, 1982, 2460, 2627, 3246, 3253, 3268, 3536, 3846, 3961, 4183, 4667, 6585, 6647, 7273, 9061, 9383, 10428, 10929, 11938, 12033, 12331, 12562, 13793, 14157, 14635, 15265, 15618, 16553, 16604, 18362, 18956, 20075, 21675, 22520, 26130, 26161, 26435, 28279, 29464, 31650, 32302, 32470, 36865, 42863, 47425, 49870, 50254, 50258, 50359, 50360, 50361, 50362, 50363), without_timestamps=False, max_initial_timestamp=1.0, word_timestamps=True, prepend_punctuations='"\'“¿([{-', append_punctuations='"\'.。,,!!??::”)]}、', multilingual=False, max_new_tokens=None, clip_timestamps=[0.0], hallucination_silence_threshold=None, hotwords=''), vad_options=VadOptions(threshold=0.5, neg_threshold=None, min_speech_duration_ms=0, max_speech_duration_s=inf, min_silence_duration_ms=140, speech_pad_ms=400))
[SpeechToText]语音转录: self.out_format='srt',self.copysrt_rawvideo=True,self.spk_insert=False
[TaskCfgSTT]
原始输入文件名: E:/欧美/a/Shannen (31)2.mp4,
输出结果保存到文件夹: D:/a/output/recogn,
临时文件夹: D:/a/tmp/21300/cf39840fe7
已启用CUDA加速
未选 降噪
语音识别:faster-whisper(内置), large-v3 断句方式:默认断句
发音语言:自动检测
未选 降噪


=
system:Windows-10-10.0.19045-SP0
version:v4.11
frozen:True
language:zh
root_dir:D:/a

1 Replies

#1 DeepSeek reply at 2 hours ago

核心原因:VAD(语音活动检测)将整段音频全部判定为非语音,切分后有效语音时长为 0 秒(duration_after_vad=0.0s),因此 faster-whisper 没有可识别的音频片段,直接抛出"无转录结果"错误。语言检测结果 nn(新挪威语)置信度仅 0.61,也说明模型未能正确匹配到真实发音语言。

请按以下步骤排查处理:

  1. 明确指定发音语言(首要)
    不要使用"自动检测",在翻译视频界面将发音语言手动设为视频真实语言(如中文选简体中文)。自动检测在此类音频上容易误判语言并连带导致 VAD 失效。
  2. 检查音频本身是否可识别
    用播放器确认该视频是否有人声、音量是否过低。若人声被背景音乐/噪声淹没,勾选主界面设置更多参数中的分离人声背景声降噪后重试。
  3. 调整 VAD 参数(关键)
    进入 菜单 → 工具/选项 → 高级选项 → 语音识别参数

    • 语音阈值从默认 0.5 调低(如 0.3~0.4),提高对语音的灵敏度;
    • 静音分割持续毫秒适当调大(如 300~500);
    • 最短语音持续(毫秒)调小或设为 0;
    • 若仍失败,尝试更换选择VAD所用模型。
  4. 更换识别渠道验证
    若该视频为中文,优先改用 Qwen-ASR(内置)FunASR(内置);若为其他语言,可改用 openai-whisper(内置) large-v3。用其他渠道能识别出内容,则说明是 faster-whisper 的 VAD 切分问题而非音频无声音。
  5. 检查音频流
    个别来源的视频音频编码异常(如 AV1/特殊封装),可先用ffmpeg将视频转为标准 H.264/AAC 的 MP4 再导入。

补充说明:你当前版本为 v4.11,建议升级到 v4.12(v4.12 优化了 VAD 切分算法),可能直接规避此问题。

如按上述步骤仍无法解决,请提供软件安装目录下 logs/ 文件夹中最新的日志文件(底部约30行)以便进一步分析。

请查阅相关文档:

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource