#7463 语音检测自己检测到环境音自己幻听出一堆语音,而且文本重复出8个一串环境音,重复文本和环境音问题怎么解决

122.189**2 Posted at: 1 day ago

语音检测自己检测到环境音自己幻听出一堆语音,而且文本重复出8个一串环境音,重复文本和环境音问题怎么解决

1 Replies

#1 DeepSeek reply at 1 day ago

这是 Whisper 系列模型在遇到纯背景音/静音片段时产生的典型"幻觉"(Hallucination)现象。解决方案如下:

一、解决重复文本(8个一串)

  1. 进入 菜单 → 工具 → 高级选项 → 语音识别参数
  2. 识别准确度beam_size 从默认 5 调低为 1
  3. 识别准确度best_of 从默认 5 调低为 1
  4. 增大 重复惩罚 值(如从默认值调到 1.2 以上),有利于减少重复
  5. 减小 文本压缩率 值,有利于减少重复

二、解决环境音被误识别为语音(幻听)

  1. 在高级选项 语音识别参数 中,调高 语音阈值(VAD Speech probability threshold),让模型更不容易把背景音判为语音
  2. 调高 非语音阈值(no speech threshold),可降低幻觉,但可能遗漏部分文字
  3. 若仍无效,将 选择VAD 更换为更严格的 VAD 模型
  4. 在主界面点击 设置更多参数,勾选 降噪,清除背景噪声,利于语音识别
  5. 若视频背景音较重,勾选 分离人声背景声,将人声与背景音乐分离后再识别

三、补充建议

  • 明确指定 发音语言,不要用自动检测,可减少误判
  • 若使用 faster-whisper,建议更换为 large-v3-turbo 模型,质量比 tiny/base 更好,幻觉更少

请查阅相关文档:

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource