#6903 现在使用的是 faster-whisper + large-v3.图中配置是现在的设置。还是会出现漏句子

182.147.**2 Posted at: 2 hours ago

image
现在使用的是 faster-whisper + large-v3.图中配置是现在的设置。还是会出现漏句子

7 Replies

#1 DeepSeek reply at 2 hours ago

漏句子通常由语音识别模型参数设置过大或不当导致模型在长视频处理时出现解码偏差,尤其在你当前使用 fast-v3 模型且喂给它的音频较复杂时,更易出现整句未识别。从你图中的配置看,最可能导致漏句子的参数是:

计算数据类型float32beam_size/best_of5启用上下文感知 勾选,这三个组合会极大增加显存和解码负担,一旦显存不足或模型在某些片段上出现幻觉/重复,就可能导致该段被整体跳过。

建议按下述步骤调整:

  1. 降低计算数据类型:进入 菜单 -> 工具 -> 高级选项 -> 语音识别参数,将 计算数据类型 改为 float16(N卡支持时)或 int8(最省显存)。
  2. 降低解码搜索深度:将 beam_sizebest_of 都从 5 降为 1
  3. 关闭上下文感知:取消勾选 启用上下文感知,该功能在某些场景下会导致模型过度依赖上下文而重复或漏句。
  4. 若仍然漏句子,可尝试:

    • 将模型从 large-v3 降为 large-v3-turbo,后者速度和精度更平衡。
    • 高级选项 -> 语音识别参数 中调低 语音阈值(如0.4)和 非语音阈值,使模型更敏感地识别较弱的语音片段。
    • 勾选 Whisper预分割音频?,提前将长音频切成短句再送入模型,可显著缓解整句遗漏问题。
  5. 检查显卡显存float32 + beam_size=5large-v3 下需要约8GB以上显存,若显存不足,模型会静默丢句。若显存足够,也应优先参考以上参数调整。

若上述调整后仍漏句子,请提供软件安装目录下 logs/ 文件夹中最新日志文件(例如 20250101.log)底部约30行报错信息,以便进一步定位是否由模型下载不完整或音频切片异常导致。

请查阅相关文档:

#2 182.147.**2 reply at 2 hours ago

image

#3 DeepSeek reply at 2 hours ago

漏句子的核心原因通常有两点:一是VAD 语音阈值设置过高,导致部分音量较低或背景噪声干扰的语音被当作静音过滤掉;二是模型解码负担过重(large-v3 + float32 + beam_size=5 等高精度设置)在显存不足时静默跳过某些片段。

从你上传的截图看,当前语音阈值设为 0.5,这一数值偏保守,很容易漏掉模糊的弱语音。建议按以下顺序调整:

1. 调低 VAD 阈值(最直接)

  • 语音阈值从 0.5 降到 0.3,提高对弱语音的敏感度。
  • 非语音阈值从 0.3 微调至 0.2 或保持 0.3,降低误判为静音的概率。

2. 缩短单次最长语音持续时长

  • 最长语音持续(秒)从 10 降到 6~8 秒,避免过长的连续语音片段因解码压力过大被整体丢弃。你已经勾选了「Whisper预分割音频」,配合较短的持续时间会更稳定。

3. 检查显存与 CUDA 状态

  • large-v3 在 float32 + beam_size=5 + 上下文感知 下需要约 8GB 以上显存;若显存不足,模型会静默丢句。
  • 确认是否已启用 CUDA 加速。若未启用,请安装 CUDA 12.8 + cuDNN 9.11 并在主界面勾选 CUDA 加速。
  • 若显存不足,请改用 large-v3-turbo(速度更快、显存需求约 6GB)或 medium 模型。

4. 如仍无效,将解码参数调低

  • 进入 菜单 → 工具 → 高级选项 → 语音识别参数:

    • 计算数据类型:改为 float16(N卡)或 int8
    • beam_size:改为 1
    • best_of:改为 1
    • 取消勾选「启用上下文感知」

5. 用独立语音转录功能排查
使用左侧面板的「语音转录」,发音语言设为“自动检测”,选相同的渠道和模型,处理同一视频。若转录结果同样漏句,则问题在识别环节;若转录正常,则问题可能出在视频翻译流程的后续缓存或剪辑逻辑中。

如果调整后仍然漏句子,请提供软件安装目录下 logs/ 文件夹中最新日志文件(底部约30行报错信息),以便进一步判断是否由模型下载不完整或 BrokenProcessPool 等底层崩溃导致。

请查阅相关文档:

#4 182.147.**2 reply at 2 hours ago

已经将语音阈值从 0.5 降到 0.2
将非语音阈值从 0.3 微调至 0.3
最长语音持续5秒
最短语音设置200毫秒
计算数据类型:float16
beam_size:改为 1
best_of:改为 1
取消勾选「启用上下文感知」
重复惩罚1.8
采样0.0

#5 DeepSeek reply at 2 hours ago

参数调整方向正确,这些设置能显著降低漏句概率。但需注意以下几点以确保效果:

  1. 务必确认勾选了「合并过短字幕到邻近」
    你当前设置最短语音持续为 200ms,若不勾选该项,会产生大量碎片化字幕,反而可能因时间轴重叠而造成部分字幕被丢弃。请进入 高级选项 → 语音识别参数,确认勾选该项。
  2. 采样温度 0.0 与重复惩罚 1.8 的影响
    温度 0 会强制贪婪解码,稳定但缺乏多样性;重复惩罚 1.8 偏高,可能抑制正常重复词。若发现识别结果中出现“明明没有重复却删掉了正常重复词”的情况,可将重复惩罚降至 1.2~1.5。
  3. 若仍漏句子,尝试降低「非语音阈值」
    目前非语音阈值保持 0.3,若还有弱语音漏掉,可将它降到 0.2(数值越小越不敏感于静音,但可减少漏句)。注意此值过低可能会引入更多噪声误识别,建议每次只调 0.05 步进测试。
  4. 验证是否是模型本身问题
    使用左侧面板的「语音转录」功能,发音语言选 自动检测,选择相同的 faster-whisper 渠道和模型,处理同一段视频。若转录结果同样漏句,则问题在识别环节;若转录正常,则问题可能在视频翻译流程中的 VAD 切片或后续逻辑。
  5. 若显存充裕,可换用 large-v3-turbo
    large-v3-turbo 在速度和精度之间更平衡,尤其对长视频处理更稳定,可显著减少整句遗漏。

请先做以上调整后重新处理同一视频,观察是否还有漏句。如果仍存在问题,请提供软件安装目录下 logs/ 文件夹中最新日志文件(底部约30行报错信息),并说明具体漏句的位置(如视频开头/中间/结尾),以便进一步排查是否为模型下载不完整或子进程崩溃导致。

请查阅相关文档:

#6 182.147.**2 reply at 2 hours ago

确认勾选了「合并过短字幕到邻近」重复惩罚1.5 发音语言选日文 不自动检测

#7 DeepSeek reply at 2 hours ago

当前的参数组合已比较合理:发音语言明确指定为日文(避免自动检测误判)、重复惩罚降至 1.5、合并过短字幕已勾选。请先使用该配置重新处理同一视频,观察是否仍有漏句。

如果仍然漏句,建议按优先级尝试以下调整:

  1. 更换识别渠道(针对日语更优)

    • 使用 openai-whisper(内置),模型选 large-v3(对日语识别效果通常优于 faster-whisper 的同一模型)。
    • 或使用 parakeet日语(内置),该渠道专为日语优化,可显著减少漏句。
    • 也可尝试 Huggingface_ASR(内置) 选择 reazon-research/japanese-wav2vec2-large-rs35kh(日语专用模型)。
  2. 微调 VAD 参数

    • 若仍漏句,将「非语音阈值」从 0.3 降到 0.2(每次只降 0.05 测试),同时确保「语音阈值」不低于 0.2,避免过度敏感引入噪声。
  3. 检查 CUDA 状态

    • 如未启用 CUDA 加速,请安装 CUDA 12.8 + cuDNN 9.11 并勾选主界面的 CUDA 加速;若显存不足 8GB,large-v3 可能静默丢句。
  4. 确认是否持续漏句

    • 使用左侧面板「语音转录」功能,发音语言选“日文”,渠道与模型和视频翻译一致,处理同一视频。若转录结果同样漏句,问题在识别环节;若转录正常,则问题可能出在视频翻译流程中的 VAD 切片或后续剪辑逻辑。

若调整后仍无法解决,请提供软件安装目录下 logs/ 文件夹中最新日志文件(底部约30行报错信息),并说明漏句出现在视频具体位置(开头/中间/结尾),以便进一步排查是否为模型文件不完整或子进程崩溃导致。

请查阅相关文档:

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource