#7489 同一个电影相同的参数411识别的字幕为27 k.字幕数为400行.而新版412至413识别的字幕为20 k字母为200行

120.217**1 Posted at: 1 hour ago

同一个电影相同的参数411识别的字幕为27 k.字幕数为400行.而新版412至413识别的字幕为20 k字母为200行

1 Replies

#1 DeepSeek reply at 1 hour ago

识别字幕行数变少、体积变小,根本原因是 v4.12 起优化了 VAD 切分算法和重断句逻辑,导致合并策略变化,把原来被拆碎的短句合并成了更长的整句。

核心原因说明:
v4.12 更新日志明确提到:

  • 优化 VAD 切分算法
  • 优化 whisper 模型识别后重断句算法
  • 移除了 whisper预分割音频合并邻近短字幕 等旧选项

新旧版本对同一音频的切分颗粒度不同,所以 400 行 / 27K 变成了 200 行 / 20K。

解决方案(三种,按需选择):

  1. 调低字幕合并门槛,让字幕变多、变短
    进入 菜单 → 工具/选项 → 高级选项 → 语音识别参数

    • 最短语音持续(毫秒):从默认 3000 调低,例如 1000~1500
    • 静音分割持续毫秒:从默认 600 调低,例如 300~400
    • 最长语音持续(秒):调低,例如 3~4
      这样切分更敏感,单条字幕更短,行数会更接近旧版。
  2. 关闭或检查 LLM 纠错的影响
    v4.12 起 LLM重新断句 改为 LLM纠错(只改错别字和标点,不重新断句)。若你启用了相关纠错渠道,也可能影响最终合并结果,可在 高级选项 → 通用 → LLM纠错所用AI渠道 检查。
  3. 确认没有使用旧版的“合并短字幕”逻辑
    合并邻近短字幕whisper预分割音频 在 v4.12 已被移除,无法再通过旧选项恢复 400 行的效果,只能通过上面第 1 条的 VAD 参数变相达到相似颗粒度。

注意: 若你后续要用 clone 音色克隆配音,最短语音持续 请保持在 3000 毫秒以上,否则参考音频过短会导致克隆失败或音质差。

如果按上述调整后行数仍与 v4.11 差异过大,请提供两个版本各自的日志文件(logs/ 目录下最新 YYYYMMDD.log,复制语音识别相关段落)进一步确认切分行为。

请查阅相关文档:

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource