#6577 here are sometime like the person only speak one word, then after 3 second they speak again but the asr pick it up as on

171.237.**1 Posted at: 19 hours ago

here are sometime like the person only speak one word, then after 3 second they speak again but the asr pick it up as one continous speech

9 Replies

#1 DeepSeek reply at 19 hours ago

这是 VAD(语音活动检测)预分割参数导致的问题。语音识别前,音频只在“静音时长大于所设置的阈值”处才被切分成独立片段;如果这个阈值比3秒的停顿更长,那么停顿前后的两句语音就会被合并成一条连续字幕。

解决方法

  1. 打开 菜单 → 工具/选项 → 高级选项 → 语音识别参数
  2. 静音分割持续毫秒 调小(例如设置为 800–1500ms)。它表示“语音结束后需等待的静音时间达到该值才会分割”,3秒停顿要想被拆开,该值必须明显小于 3000ms。
  3. 若仍合并,尝试将 语音阈值 适当调大、非语音阈值 适当调小,避免停顿期间的轻微底噪被误判为语音,从而把两句话“粘连”在一起。
  4. 如果使用的是 faster-whisper / openai-whisper,建议在高级选项中勾选 Whisper预分割音频?,让 VAD 在识别前主动按静音切分句子,而不是让模型自行合并。
  5. 也可设置合理的 最长语音持续(秒),超过该时长会强制分割,作为兜底。
  6. 修改后重新执行任务即可。若问题仍未解决,请提供 logs/ 目录下最新日志底部约30行报错信息,并注明软件左上角的版本号,以便进一步分析。

请查阅相关文档:

#2 171.237.**1 reply at 19 hours ago

should i use qwen asr or whisper

#3 DeepSeek reply at 19 hours ago

这取决于你的视频语言和场景:

  • 中文视频:优先选 Qwen-ASR(内置),中文识别效果最好;也可选 阿里FunASR(内置) / Firered中文(内置)
  • 非中文通用场景(英文、日语等):优先选 faster-whisper(内置),模型选 large-v3large-v3-turbo,速度和准确度均衡。
  • 日语视频faster-whisper(内置)parakeet日语(内置) 均可。
  • 小语种faster-whisper(内置)large-v3 模型覆盖语言最广。

简单说:中文用 Qwen-ASR,其他语言用 faster-whisper。若没有明显偏向,默认 faster-whisper + large-v3-turbo 是比较稳妥的选择。

#4 171.237.**1 reply at 19 hours ago

do qwen asr have any special feature that solve the time issue above

#5 DeepSeek reply at 19 hours ago

Qwen-ASR 没有专门针对这个断句问题的特殊功能;该问题主要取决于通用的 VAD 预分割参数,而不是 ASR 渠道本身。

如果你想解决“停3秒仍被合并成一条字幕”的问题:

  1. 打开 菜单 → 工具/选项 → 高级选项 → 语音识别参数。
  2. 将 静音分割持续毫秒 调小,比如 800–1500ms,确保3秒停顿处能触发分割。
  3. 在高级选项中勾选 Whisper预分割音频?,让 VAD 在识别前按静音切分句子。此选项主要针对 Whisper 系列;若你使用 Qwen-ASR 时分割效果不理想,建议改用 faster-whisper 并开启该选项。
  4. 适当调大 语音阈值、调小 非语音阈值,避免停顿中的底噪被当成语音而把两句话粘连。

若调整后仍无效,请提供 logs/ 目录下最新日志底部约30行报错信息,并注明软件左上角的版本号,以便进一步分析。

请查阅相关文档:

#6 171.237.**1 reply at 18 hours ago

best setting and options for qwen asr for chinese video

#7 DeepSeek reply at 18 hours ago

For Chinese videos with Qwen-ASR, use these recommended settings:

  1. Main screen:

    • 发音语言: 简体中文 (zh-cn)
    • 语音识别渠道: Qwen-ASR(内置)
    • 目标语言: choose your target language
    • If you have an NVIDIA GPU, tick CUDA加速.
  2. 设置更多参数:

    • Enable 分离人声背景声 and 降噪 to improve recognition accuracy.
  3. 菜单 → 工具/选项 → 高级选项 → 语音识别参数:

    • 静音分割持续毫秒: 800–1500 (this directly fixes the "3-second pause still merged" issue)
    • 最长语音持续(秒): 10
    • 最短语音持续(毫秒): 2000–3000 (optional)
    • 语音阈值: keep default, or slightly increase if background noise is low
    • 非语音阈值: keep default, or slightly decrease to avoid merging across pauses
    • 恢复标点: enable if you want punctuation
    • If you have DeepSeek/OpenAI API, you can enable LLM重新断句 for better sentence splitting. Do not enable this when using clone voice.
  4. If a model size option is available, choose the 1.7B Qwen-ASR model for better Chinese accuracy. The 0.6B model is faster but less accurate.

Note: Qwen-ASR does not have a special feature specifically for breaking long pauses; the VAD segmentation settings above control that behavior.

请查阅相关文档:

#8 171.237.**1 reply at 18 hours ago

image

#9 DeepSeek reply at 18 hours ago

无法查看您上传的图片内容。请描述图片中所显示的信息,例如:是设置界面截图、报错弹窗、还是字幕时间轴异常?如果有报错,请复制日志文件 logs/ 中最新的约30行报错内容,并注明软件左上角的版本号,以便进一步分析。

Thinking...
Post Your Reply
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource