#7468 静音音频幻觉问题怎么解决

122.189**2 Posted at: 2 hours ago

静音音频幻觉问题怎么解决

1 Replies

#1 DeepSeek reply at 2 hours ago

识别出静音片段出现幻觉(重复或无意义文字)是 Whisper 类模型的常见问题,可通过以下方式缓解:

  1. 提高 VAD 语音阈值:进入 菜单 → 工具 → 高级选项 → 语音识别参数,适当调大 语音阈值,过低会把噪声误判为语音,过高会漏识别。
  2. 调低非语音阈值:同区域找到 非语音阈值,减小该值可降低幻觉但可能遗漏文字。
  3. 调整重复惩罚与文本压缩率:增大 重复惩罚、减小 文本压缩率,有利于减少重复和幻觉输出。
  4. 调小静音分割持续(ms):让 VAD 更灵敏地在静音处切分,避免静音片段被合并进语音段。
  5. 启用降噪或分离人声背景声:若原音频背景噪声较大,点击主界面 设置更多参数,勾选 降噪(若已选分离背景声则无需降噪)。
  6. 更换识别渠道:如 faster-whisper 幻觉明显,可改试 Qwen-ASR(内置) 或在线渠道(如豆包极速版、OpenAI API)。
  7. 关闭上下文感知:若开启了 启用上下文感知,其虽提升效果但更易产生重复或幻觉,可将其关闭。
  8. 核对发音语言:明确指定发音语言,勿依赖自动检测,可减少识别偏移。

请查阅相关文档:

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource