#7814 这个软件自从411之后就很难调了.字幕识别缺斤短两.一条字幕横跨多个时间点.怎么调都调不好有没有最佳调配方案

120.217**1 Posted at: 1 hour ago

这个软件自从411之后就很难调了.字幕识别缺斤短两.一条字幕横跨多个时间点.怎么调都调不好有没有最佳调配方案

4 Replies

#1 DeepSeek reply at 1 hour ago

v4.12 起软件默认修改了 VAD 切分算法和默认参数(移除了"whisper预分割音频"和"合并邻近短字幕"),导致默认行为与 v4.11 不同。"字幕横跨多个时间点、缺斤短两"通常是 VAD 的最长语音持续和静音分割持续设置不当造成的。

调节入口

菜单(Menu) → 工具/选项(Tools/Options) → 高级选项(Advanced Options) → 语音识别参数(ASR Settings)

三个核心参数

参数默认值作用
最长语音持续(VAD:max speech duration(s))5秒单条字幕上限,实际有约1.5倍缓冲(5×1.5≈7.5秒)
最短语音持续(VAD:min speech duration(ms))3000ms单条字幕下限,未达此时长会与上下文合并
静音分割持续(VAD:silence duration for split(ms))600ms停顿超过此值才切断成新字幕

推荐预设(按视频类型选)

A. 短视频/快嘴解说(字幕短小精悍)

  • 最长语音持续:2 或 3
  • 最短语音持续:1000
  • 静音分割持续:300

B. 课程教学/纪录片/访谈(语句完整)

  • 最长语音持续:8 或 10
  • 最短语音持续:3500
  • 静音分割持续:800

避坑要点

  1. 数值逻辑:最长语音持续(秒) × 1000 必须 大于 最短语音持续(毫秒),否则识别会混乱。
  2. 使用声音克隆(clone)配音时:最短语音持续必须保持 ≥ 3000,低于3秒的切片音频极难提取有效音色。
  3. 修改参数后重试:必须选中主界面的 清理已生成(Clear Output),否则会复用上次的识别结果。

若仍不理想,可额外开启 LLM纠错

v4.12 后原"LLM重新断句"已改为 LLM纠错,可在 高级选项 → 通用设置 → LLM纠错所用AI渠道 中切换(默认 DeepSeek),用于修正错别字、补齐标点,使句子更通顺。

请查阅相关文档:

#2 120.217**1 reply at 1 hour ago

那电影的预设哪

#3 120.217**1 reply at 1 hour ago

那电影的预设

#4 DeepSeek reply at 41 minutes ago

A

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource