#7572 No human voice detected. Please confirm that human speech is present in the original file. [info.duration_after_vad=0.0s

112.45**0 Posted at: 2 hours ago

No human voice detected. Please confirm that human speech is present in the original file. [info.duration_after_vad=0.0s].
_kw={'beam_size': 5, 'best_of': 5, 'condition_on_previous_text': False, 'threshold': 0.45, 'no_speech_threshold': 0.6, 'temperature': 0.0, 'repetition_penalty': 1.0, 'compression_ratio_threshold': 2.4, 'initial_prompt': None}
info=TranscriptionInfo(language='en', language_probability=1, duration=227.602, duration_after_vad=0.0, all_language_probs=None, transcription_options=TranscriptionOptions(beam_size=5, best_of=5, patience=1, length_penalty=1, repetition_penalty=1.0, no_repeat_ngram_size=0, log_prob_threshold=-1.0, no_speech_threshold=0.6, compression_ratio_threshold=2.4, condition_on_previous_text=False, prompt_reset_on_temperature=0.5, temperatures=[0.0], initial_prompt=None, prefix=None, suppress_blank=True, suppress_tokens=(1, 2, 7, 8, 9, 10, 14, 25, 26, 27, 28, 29, 31, 58, 59, 60, 61, 62, 63, 90, 91, 92, 93, 359, 503, 522, 542, 873, 893, 902, 918, 922, 9
......
hold=-1.0, no_speech_threshold=0.6, compression_ratio_threshold=2.4, condition_on_previous_text=False, prompt_reset_on_temperature=0.5, temperatures=[0.0], initial_prompt=None, prefix=None, suppress_blank=True, suppress_tokens=(1, 2, 7, 8, 9, 10, 14, 25, 26, 27, 28, 29, 31, 58, 59, 60, 61, 62, 63, 90, 91, 92, 93, 359, 503, 522, 542, 873, 893, 902, 918, 922, 931, 1350, 1853, 1982, 2460, 2627, 3246, 3253, 3268, 3536, 3846, 3961, 4183, 4667, 6585, 6647, 7273, 9061, 9383, 10428, 10929, 11938, 12033, 12331, 12562, 13793, 14157, 14635, 15265, 15618, 16553, 16604, 18362, 18956, 20075, 21675, 22520, 26130, 26161, 26435, 28279, 29464, 31650, 32302, 32470, 36865, 42863, 47425, 49870, 50254, 50258, 50359, 50360, 50361, 50362, 50363), without_timestamps=False, max_initial_timestamp=1.0, word_timestamps=True, prepend_punctuations='"\'“¿([{-', append_punctuations='"\'.。,,!!??::”)]}、', multilingual=False, max_new_tokens=None, clip_timestamps=[0.0], hallucination_silence_threshold=None, hotwords=''), vad_options=VadOptions(threshold=0.45, neg_threshold=None, min_speech_duration_ms=0, max_speech_duration_s=inf, min_silence_duration_ms=2000, speech_pad_ms=400))

cfg=[TaskCfgVTT]当前工作模式: 翻译视频 单视频模式
原始输入文件名: C:/Users/GIBDERSZH/Desktop/和弦即兴演奏教程/单一和弦即兴演奏Jack Gardiner/ One Chord Groove Phrasing Backing Track E.mp3,
输出结果保存到文件夹: C:/Users/GIBDERSZH/Desktop/和弦即兴演奏教程/单一和弦即兴演奏Jack Gardiner/_video_out/ One Chord Groove Phrasing Backing Track E-mp3,
临时文件夹: D:/win-pyvideotrans-v4.12-0913/tmp/12724/044a877c69
已选 清理已存在
已启用CUDA加速
未选 降噪
语音识别:faster-whisper(内置), large-v3-turbo, 发音语言: 英语, 断句方式:默认断句
翻译渠道:微软(免费),原始语言:英语,目标语言:简体中文, 已选 发送完整字幕
配音渠道:Edge-TTS(免费), 角色:Xiaoyi(Female/CN), 配音语言:简体中文, 未选 二次语音识别
音量:+0%, 语速:+0%, 已选 音频加速, 未选 视频慢速
字幕: 嵌入硬字幕
已选 分离人声与背景声, 已选 重新嵌入背景声, 背景音量0.8, 背景声音时长 短于 视频时长时: 拉长(降速播放),存在分离后的纯净人声文件,存在分离后的背景声音文件
已选 仅输出mp4
video_duration_ms=227604


=
system:Windows-10-10.0.26200-SP0
version:v4.12
frozen:True
language:zh_CN
root_dir:D:/win-pyvideotrans-v4.12-0913

1 Replies

#1 DeepSeek reply at 2 hours ago

duration_after_vad=0.0s 表示 VAD(语音活动检测)在整段音频中没有检测到任何符合条件的人声片段,因此在进入识别环节前就已判定"无人声"。

但结合您的配置,最可能的原因是您已勾选"分离人声与背景声",而您的输入是一段纯音乐伴奏(文件名为 Backing Track,即吉他伴奏轨)。

人声分离后的人声轨中确实没有任何人声内容,故 VAD 结果为 0。

可能原因与排查方向

  1. 输入文件本身无人声(最可能)

    • 文件名含 Backing Track,属于纯伴奏音乐,没有演唱或说话声。

      此类文件无法进行语音识别和翻译。

  2. 人声分离误将主要内容归类为背景

    • 勾选"分离人声与背景声"后,VAD 是对分离出的人声轨进行检测。

      若原音频人声很弱或分离效果不佳,人声轨可能近乎为空。

  3. VAD 阈值过高,把弱人声判为静音

    • 当前 threshold=0.45no_speech_threshold=0.6

  4. 音频实际有说话声但音量极低或被音乐掩盖

建议操作

  1. 先关闭"分离人声与背景声"重试一次,确认原音频是否含人声。

  2. 若确认为纯音乐/伴奏无人声,则本软件不适用(无法处理仅有背景音乐的视频)。

  3. 若音频确实含说话声,可尝试:

    • 取消勾选"分离人声背景声",勾选"降噪";
    • 进入 菜单 → 工具 → 高级选项 → 语音识别参数,将 语音阈值(VAD: Speech probability threshold) 从 0.45 适当调低(如 0.3);
    • 非语音阈值 适当调低。

  4. 若仍失败,请用播放器确认该音频是否真的含有人声说话内容。

请查阅相关文档:

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource