您遇到的问题是典型的配音后句间停顿过长和断句不合理,主要原因有两个:
- 语音识别(ASR)阶段把一句话切成了多个过短的片段,导致配音时每条字幕独立生成音频,中间留有多余静音。
- 配音合成阶段没有有效压缩字幕间的空白,也没有启用音频加速或移除前后静音缓冲。
以下按优先级列出解决方案,请逐一执行:
1. 合并过短字幕,从源头减少断句
进入 菜单 → 工具/选项 → 高级选项 → 语音识别参数,设置:
- 最短语音持续(毫秒):建议
800~1500(单位ms,即0.8~1.5秒)。小于此值的字幕会被合并到相邻字幕。 - 最长语音持续(秒):
10(足够长,避免主动截断) - 勾选 “合并过短字幕到邻近”
- 勾选 “Whisper预分割音频?”(让Whisper按照语义断句,而非纯VAD)
若使用 faster-whisper,还可以在高级选项中将 beam_size 和 best_of 设为 1,能略微减少过分割。
2. 压缩配音后的静音间隔
在 主界面 → 设置更多参数... 中:
- 勾选 “配音加速”(当配音比原声音长时自动加速,避免因配音慢导致停顿)
- 配音语速:设为
+10% 或 +15%(加快语速,让句子更紧凑)
在 高级选项 → 字幕配音调整 中:
- 勾选 “移除配音前后静音缓冲”(剔除句首句末的无效静音)
- 勾选 “移除字幕间的空隙”(此项在高级选项 → 字幕声音画面对齐 中,有些版本直接叫“移除字幕间隙”)
3. 如果使用 Edge-TTS,注意并发和暂停
Edge-TTS 自动为每条配音生成前后淡入淡出,容易产生停顿。建议:
在高级选项 → 字幕配音调整中:
- EdgeTTS配音渠道配音并发数:设为
1 - 配音后暂停秒:设为
0 或 1(不额外等待)
- 若停顿仍严重,可换用本地 Qwen-TTS 或 F5-TTS,它们对短句的连接更平滑。
4. 彻底解决“一句话被分成两次说”
这通常是ASR在句子中间发生了分割。除第一步参数外,还可以:
- 使用 LLM 重新断句:在主界面语音识别区域选择 LLM重新断句,并配置 DeepSeek 或 OpenAI 模型。这会让大模型将碎片字幕重新组合成完整句子。
- 注意:若使用 clone 音色复制,则不要启用LLM断句(会破坏参考音频对齐),以上参数调整已经足够。
效果预期
优化后,配音流畅度会明显改善,句间停顿控制在0.3~0.8秒,一句话基本不会分两次。50分钟视频的配音时间也会因参数调整而缩短。
如果问题仍然存在,请提供最新日志文件(logs/文件夹内)中最末尾的30行报错信息,以便进一步排查。