#7114 最新的4.12版本语音识别,切分更好一些吗?我用的是0.8版本,感觉英语切得断句很多,翻译过来后,没法听

2a14**38b Posted at: 1 hour ago

最新的4.12版本语音识别,切分更好一些吗?我用的是0.8版本,感觉英语切得断句很多,翻译过来后,没法听

5 Replies

#1 DeepSeek reply at 1 hour ago

v4.12 已优化 VAD 切分算法,理论上断句会比旧版本更合理、更连贯。如果您目前使用的版本较旧,建议直接升级到最新版 v4.12。

若升级后仍觉得断句偏碎,请进入 菜单 → 工具 → 高级选项 → 语音识别参数,尝试以下调整:

  1. 将「静音分割持续毫秒(VAD:Min silence duration for split)」适当调大(例如从默认的 300 调至 500~800),使 VAD 更少在短静音处切断;
  2. 将「最短语音持续(毫秒)(VAD:min speech duration)」适当调小(例如从 1000 调至 800),避免过短的片段强制合并。

关于您提到的“英语断句多、翻译后没法听”,还建议:

  • 翻译渠道优先使用 DeepSeek 等大模型,并在高级选项中勾选「发送完整字幕」;
  • 若使用传统翻译渠道,可将「传统翻译渠道每批字幕行数」设为 1,减少合并错乱。

请查阅相关文档:

#2 2a14**38b reply at 1 hour ago

哦我看到,这些参数和0.8版本,参考建议不一样,是不是优化后,按照你上面的推荐值

#3 DeepSeek reply at 1 hour ago

v4.12 确实优化了 VAD 切分算法,因此高级选项中的参数默认值可能和旧版本不同,但并没有一个“固定推荐值”。上一条回复中的具体数字是建议的尝试方向,您可以在当前版本默认值基础上,根据实际配音效果微调。

如果英语断句仍偏碎,可重点尝试:增大「静音分割持续毫秒」,让 VAD 更少在短停顿处切断;适当减小「最短语音持续(毫秒)」,避免过短片段被强制合并。同时建议翻译渠道使用 DeepSeek 等大模型,并勾选「发送完整字幕」,这样翻译后的句子更自然,便于配音。

请查阅相关文档:

#4 2a14**38b reply at 1 hour ago

我用这0.8版本还行,有必要升级到12版本吗?中间的更新日志,我没有看到,不知道更新的大不大

#5 DeepSeek reply at 1 hour ago

v4.12 相比 0.8 版本更新幅度较大,主要涉及语音识别切分算法、LLM 纠错逻辑、二次识别模型固定、修复多个 bug 等。其中与您当前痛点(英语断句碎)直接相关的是:优化了 VAD 切分算法,并将“LLM 重新断句”调整为“LLM 纠错”,只修正错别字和恢复标点,不再重新断句。这可能让字幕更符合原意,翻译后配音更连贯。另外,二次识别固定使用 faster-whisper 的 large-v3-turbo 模型,速度与质量更均衡。如果您的 0.8 版本目前使用正常且无困扰,可以暂不升级;但若想改善断句与翻译配音效果,建议升级到 v4.12 并重新调整参数。升级前请先备份配置文件(videotrans/params.jsonvideotrans/cfg.json),然后直接覆盖补丁包即可保留原有设置。请查阅相关文档:下载软件

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource