#7125 v4.12 语音识别的默认参数是最优的吗

141.11**2 Posted at: 4 hours ago

v4.12 语音识别的默认参数是最优的吗

5 Replies

#1 DeepSeek reply at 4 hours ago

默认参数并非绝对“最优”,而是兼顾速度与质量的均衡配置。

针对不同场景可做调整:

  1. 追求质量优先:模型改为 large-v3(准确度更高,但更慢、显存需求更高)。
  2. 追求速度优先:模型降为 smallbase(速度更快,精度下降)。
  3. 遇显存不足报错:将 计算数据类型 改为 float16int8,并调低 beam_sizebest_of1
  4. 背景噪声大:在主界面勾选 分离人声背景声降噪

默认配置(faster-whisper + large-v3-turbo)适合大多数普通视频,如果你的需求与上述场景吻合,建议按需调整。

请查阅相关文档:

#2 141.11**2 reply at 3 hours ago

v4.12 在校对配音时修改了吗?开始时间和结束时间,没有以前看着比较清楚 以前是按照字幕的时间轴显示的,现在显示的是数字

#3 DeepSeek reply at 3 hours ago

在 v4.12 的“校对配音/重新配音”面板中,开始时间和结束时间列显示的是纯数字秒数(例如 12.34),这是当前版本的设计,并非显示异常。
你可通过以下方式调整:

  1. 双击单元格直接输入新的秒数;
  2. 右键单元格选择“开始时间减小/增大0.1s”或“结束时间减小/增大0.1s”进行微调;
  3. 若想确认当前时间对应的画面位置,可点击该行的播放按钮预览。

如果这个显示方式与旧版不同,或对你造成不便,建议将软件升级到最新补丁包后观察。若仍异常,请提供软件目录 logs/ 下的最新日志文件以便进一步分析。

请查阅相关文档:

#4 141.11**2 reply at 3 hours ago

这种方式,显示的太不直观了,不方便调整,没有以前的好看,能清晰的计算出偏移多少秒

#5 DeepSeek reply at 3 hours ago

这是 v4.12 当前的界面设计,开始/结束时间以秒数(如 12.34)显示,并非报错。调整方式如下:双击单元格可直接手动输入秒数;右键单元格可“开始/结束时间减小或增大0.1s”进行微调;若想精确定位偏移,可点击该行播放按钮观看对应画面。若你觉得不直观,也可在阶段一或阶段二的字幕编辑窗口中使用“打开字幕文件夹”,用第三方字幕编辑器(如 Subtitle Edit)修改字幕时间轴后再继续。此反馈已记录,建议关注后续版本是否优化显示方式。如接口显示异常,请提供 logs/ 目录下最新日志以便进一步排查。请查阅相关文档:单视频精修模式

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource