#6828 Reference audio is empty after silence removal. Try setting preprocess_prompt=False.,Traceback (most recent call last):

95.40.**1 Posted at: 1 hour ago

Reference audio is empty after silence removal. Try setting preprocess_prompt=False.,Traceback (most recent call last):
File "videotrans\process\omnivoice_tts.py", line 74, in omnivoice_fun
File "F:\win-pyvideotrans-v4.11\_internal\torch\utils\_contextlib.py", line 116, in decorate_context

return func(*args, **kwargs)

File "omnivoice\models\omnivoice.py", line 567, in generate

voice_clone_prompt=voice_clone_prompt,

File "omnivoice\models\omnivoice.py", line 959, in _preprocess_all
File "omnivoice\models\omnivoice.py", line 675, in create_voice_clone_prompt

logger.warning(

ValueError: Reference audio is empty after silence removal. Try setting preprocess_prompt=False.

Traceback (most recent call last):
File "videotrans\task\only_one.py", line 107, in run
File "videotrans\task\_stage_dubbing.py", line 24, in dubbing
File "videotrans\task\_stage_dubbing.py", line 101, in _tts
File "videotrans\tts\__init__.py", line 233, in run
File "videotrans\tts\_base.py", line 103, in run
File "videotrans\tts\_omnivoice.py", line 41, in _exec
File "videotrans\configure\base.py", line 270, in _new_process
videotrans.configure.excepts.VideoTransError: Reference audio is empty after silence removal. Try setting preprocess_prompt=False.,Traceback (most recent call last):
File "videotrans\process\omnivoice_tts.py", line 74, in omnivoice_fun
File "F:\win-pyvideotrans-v4.11\_internal\torch\utils\_contextlib.py", line 116, in decorate_context

return func(*args, **kwargs)

File "omnivoice\models\omnivoice.py", line 567, in generate

voice_clone_prompt=voice_clone_prompt,

File "omnivoice\models\omnivoice.py", line 959, in _preprocess_all
File "omnivoice\models\omnivoice.py", line 675, in create_voice_clone_prompt

logger.warning(

ValueError: Reference audio is empty after silence removal. Try setting preprocess_prompt=False.

cfg=[TaskCfgVTT]当前工作模式: 翻译视频 单视频模式
原始输入文件名: D:/Pretreatment/AI Dubbing/LlwzqxdfPtT01.mp4,
输出结果保存到文件夹: D:/Pretreatment/AI Dubbing/_video_out/LlwzqxdfPtT01-mp4,
临时文件夹: F:/win-pyvideotrans-v4.11/tmp/17396/d44d284072
未选 清理已存在
已启用CUDA加速
未选 降噪
语音识别:faster-whisper(内置), large-v3-turbo, 发音语言: 简体中文, 断句方式:默认断句
翻译渠道:Google(免费),原始语言:简体中文,目标语言:葡萄牙语(巴西), 已选 发送完整字幕
配音渠道:OmniVoice(内置), 角色:clone, 配音语言:葡萄牙语(巴西), 未选 二次语音识别
音量:+0%, 语速:+0%, 未选 音频加速, 未选 视频慢速
未选 移除字幕间空隙, 未选 强制对齐字幕和声音
字幕: 嵌入软字幕


=
system:Windows-10-10.0.19045-SP0
version:v4.11
frozen:True
language:zh
root_dir:F:/win-pyvideotrans-v4.11

1 Replies

#1 DeepSeek reply at 1 hour ago

这是 OmniVoice 在克隆音色时,从原视频截取的参考音频(依据字幕时间轴截取的片段)在去除静音后没有有效人声导致的。常见原因是截取的音频过短、静音过多或根本没有说话声。

建议按顺序尝试以下方案:

  1. 优化语音识别参数
    进入 菜单 → 工具 → 高级选项 → 语音识别参数

    • 将「最长语音持续秒数」设为 6-10
    • 将「最短语音持续毫秒」设为 3000-4000
    • 勾选「合并过短字幕到邻近」
    • 勾选「Whisper预分割音频」
      这样能保证每条字幕对应的音频片段实际包含人声,避免过短/静音片段被用作参考音频。
  2. 使用固定参考音频(推荐)
    不依赖从原视频动态截取,而是自己准备一段 3-10 秒清晰无噪、无多余静音的 WAV 音频,放到软件根目录的 f5-tts 文件夹内,然后进入 菜单 → TTS 设置 → 设置参考音频,填写 文件名.wav#音频中朗读的文本,保存后在主界面配音角色下拉框中选择该文件名。这样参考音频质量可控,不再受原视频时间轴影响。
  3. 更换配音渠道
    若上述仍无效,可改用其他支持克隆的渠道,比如 F5-TTS(内置)Qwen3-TTS(内置) 等,它们的参考音频处理机制不同,可能更稳健。
  4. 高级用户:修改 OmniVoice 参数
    报错提示本身给出了选项 preprocess_prompt=False。如果你熟悉源码部署,可以在 omnivoice/models/omnivoice.py 中关闭静音预处理,但需注意这可能导致后续合成质量下降。一般不建议普通用户尝试。

请查阅相关文档:

Thinking...
Post Your Reply
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource