#7297 新版4.12和旧版4.11里面的参数调的一模一样。 4.11识别的字幕比4.12识别了这么多一倍。

120.217**0 Posted at: 1 hour ago

新版4.12和旧版4.11里面的参数调的一模一样。 4.11识别的字幕比4.12识别了这么多一倍。

1 Replies

#1 DeepSeek reply at 1 hour ago

核心原因在于 v4.12 版本对语音识别相关算法进行了调整,导致相同参数下识别出的字幕数量发生变化,并非参数配置错误。

根据 v4.12 更新日志,本次更新涉及以下与字幕分段直接相关的改动:

  1. 优化了 VAD 切分算法:VAD(语音活动检测)的分割逻辑改变,会直接影响语音片段的切分粒度,从而改变最终生成的字幕条数。
  2. 移除了 whisper预分割音频合并邻近短字幕 功能:旧版中可能存在的合并短字幕逻辑被取消,因此新版不再自动合并邻近的短句,字幕条数相应增多。

因此识别出的字幕数量差异属于版本算法变更导致的正常现象,而非参数被修改。

若希望减少字幕条数、使分段更接近旧版效果,可尝试调整以下参数进入 菜单 → 工具/选项 → 高级选项 → 语音识别参数

  1. 最长语音持续(秒):适当调大该值,可减少因时长过长被强制分割的片段。
  2. 最短语音持续(毫秒):适当调大该值,使过短的字幕被尝试合并进相邻字幕。
  3. 静音分割持续毫秒:适当调大该值,只在更长的静音处才分割语音片段,从而减少分割点。

以上参数均会影响最终字幕的条数与分段效果,请根据实际识别结果进行调整。

请查阅相关文档:

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource