#7447 没有语音但是语音识别出有语音,怎么解决

122.189**2 Posted at: 2 hours ago

没有语音但是语音识别出有语音,怎么解决

1 Replies

#1 DeepSeek reply at 2 hours ago

这是语音识别模型的“幻觉(hallucination)”问题——Whisper 等模型在遇到静音、纯背景音乐、噪声时,有时会凭空编造出文字(常见于模型用训练数据中的高频句“脑补”,比如“请不吝点赞订阅”“字幕由XX提供”之类)。

排查与解决步骤(按优先级)

1. 确认视频是否真的无音轨
用播放器播放原视频,确认是否有声音。若在线下载的视频音画分离导致无声,需先修复视频本身。

2. 使用 VAD 过滤静音段
进入 菜单 → 工具 → 高级选项 → 语音识别参数

  • 选择合适的 VAD(如 ten-vad
  • 提高 语音阈值(Speech probability threshold),让静音/噪声不被判定为语音
  • 提高 非语音阈值(no speech threshold),减少幻觉

3. 勾选降噪 / 分离人声背景声
主界面点击 设置更多参数,勾选 降噪分离人声背景声。纯背景音乐视频经人声分离后,送入 ASR 的音频基本为空,可大幅减少幻觉(二者选一即可,已分离背景声则无需再降噪)。

4. 更换识别模型/渠道

  • 换用对幻觉抑制更好的渠道,如 Qwen-ASR(内置)Firered中文(内置)(仅中文)、FunASR(内置) 等。
  • 若仍用 whisper,可尝试 large-v3-turbo 或调低 采样温度(temperature)参数。

5. 明确指定发音语言
不要用“自动检测”(若你的版本有该项),明确指定语言可降低幻觉概率。

请查阅相关文档:

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource