#6138 Qwen-ASR(本地) 识别出来的句子太长 怎么办

103.151* Posted at: 12 hours ago

Qwen-ASR(本地) 识别出来的句子太长 怎么办

3 Replies

这是由于 VAD(语音活动检测)参数设置导致句子过长。调整「最长语音持续秒数」和「静音分割持续毫秒」可强制分割为短句。

解决方法

  1. 进入 菜单 → 工具/选项 → 高级选项 → 语音识别参数
  2. 最长语音持续(秒) 设为更小的值(如 45),超过此值的语音将强制分割。
  3. 静音分割持续毫秒 设小(如 300 ~ 500),缩短分割所需静音时长。
  4. 若不需要合并短句,确保 不勾选 合并过短字幕到邻近,并将 最短语音持续(毫秒) 设小(如 500)。
  5. 保存后重新执行任务。
如果使用 clone 音色克隆,不宜过度缩短句子,以免影响参考音频截取质量。

请查阅相关文档:

最长语音持续(秒) 5秒 , 静音分割持续毫秒 140 ,还是不行

这种情况通常是没有启用 "Whisper预分割音频" 导致的。该选项适用于所有本地语音识别渠道(包括 Qwen-ASR),能提前将音频切分成短句后再送入模型,从而避免输出过长句子。

操作步骤:

  1. 进入 菜单 → 工具/选项 → 高级选项 → 语音识别参数
  2. 勾选 「Whisper预分割音频?」
  3. 同时将 「合并过短字幕到邻近」 取消勾选(如果之前勾选了)。
  4. 「最长语音持续(秒)」 设为 5「最短语音持续(毫秒)」 设为 500「静音分割持续毫秒」 设为 300
  5. 清除之前的缓存:在主界面勾选 「清理已生成」,然后重新开始任务。

若仍无效,可能是 Qwen-ASR 模型本身对某些音频切分不佳,可尝试更换为 faster-whisper + large-v3 并结合相同参数。

请查阅相关文档:

Post Your Reply
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Dondate via PayPal

Related resource