#7612 语音识别到五分钟、7分钟 。音频沉默后字幕自动输出,但是还有后面几分钟没输出

64.118**3 Posted at: 1 hour ago

语音识别到五分钟、7分钟 。音频沉默后字幕自动输出,但是还有后面几分钟没输出

1 Replies

#1 DeepSeek reply at 1 hour ago

请补充以下信息以便定位问题:软件版本号(左上角显示)、操作系统、语音识别渠道名称及模型、是否勾选"启用CUDA加速"、该完整音频总时长是多少分钟。

已知可能原因(需结合上述信息判断):

  1. VAD 切割/静音分割参数不当:若"静音分割持续(ms)"过大或"最长语音持续(秒)"设置异常,可能在某段长静音后处理异常中断。

    可进入 菜单 → 工具/选项 → 高级选项 → 语音识别参数,检查 最长语音持续(秒)(默认5)、最短语音持续(毫秒)(默认3000)、静音分割持续毫秒(默认600)是否为默认值。

  2. 子进程崩溃或超时:本地大模型(如 large-v3)在长音频处理时可能因显存溢出导致子进程崩溃(BrokenProcessPool / SttTimeoutError),表现为中途停止、后续未输出。

    可查看 软件目录/logs/ 下当日日志文件底部报错信息确认。

  3. 音频后半段无人声或音量过低:若后半段仅有背景音/音乐,VAD 会判定无语音而不生成字幕,属正常行为。

    可用播放器确认后半段是否有人声。

  4. 二次识别:若勾选了"二次识别",其固定使用 faster-whisper + large-v3-turbo,参数不同也可能导致结果差异。

    可对比未勾选时的输出。

建议操作:

  1. 先确认原音频 7 分钟后是否确实存在可辨识人声;
  2. 打开 软件目录/logs/日期.log,复制底部约 30 行记录;
  3. 尝试改用 faster-whisper 内置 / medium 模型重试同一文件,并勾选主界面 清理已生成;
  4. 若为长音频,可先用 菜单 → 工具/选项 → 批量从视频中分离音频 确认音频完整性。

如仍无法定位,请提供上述日志片段以便进一步分析。

请查阅相关文档:

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource