#7544 漏很多的句子,最新版本,内置的large-v3模型

112.49**5 Posted at: 2 hours ago

漏很多的句子,最新版本,内置的large-v3模型

9 Replies

#1 DeepSeek reply at 2 hours ago

语音识别"漏句"通常由 VAD(语音活动检测)切分参数过于激进导致——把一些停顿、轻声或短句判定为静音而丢弃。

请按以下顺序排查调整:

  1. 调整 VAD 参数(主菜单 → 工具/选项 → 高级选项 → 语音识别参数):

    • 增大 最长语音持续(VAD:max speech duration(s)),例如从默认 5 调到 8~10
    • 减小 静音分割持续毫秒(VAD:Min silence duration for split(ms)),例如从默认 600 调到 300~400,让停顿短的句子也能被切出来
    • 适当降低 语音阈值(VAD: Speech probability threshold),越小越灵敏
    • 提高 非语音阈值(no speech threshold) 的值可减少漏字
  2. 在"设置更多参数"中勾选

    • 分离人声背景声(背景音干扰常导致漏识别)
    • 降噪(二者选一即可)
  3. 注意参数逻辑关系最长语音持续(秒) × 1000 必须大于 最短语音持续(毫秒),否则会识别混乱。

  4. 调整后重试时,务必勾选主界面的 清理已生成,避免复用上次已生成的错误字幕。

如果以上调整后仍大量漏句,请提供软件安装目录下 logs/ 文件夹中最新的日志文件(复制底部约30行),以便进一步分析。

请查阅相关文档:

#2 112.49**5 reply at 1 hour ago

[DEBUG] [Video-Cut] 片段94 [原片段时长:12860.0ms] [目标:12860.0ms] [PTS:1.0] 完成。真实时长: 12884ms, 真实-应生=24.0ms
[DEBUG] [Video-Cut] 片段88 [原片段时长:3260.0ms] [目标:3260.0ms] [PTS:1.0] 完成。真实时长: 3246ms, 真实-应生=-14.0ms
[DEBUG] [Video-Cut] 片段82 [原片段时长:21760.0ms] [目标:21760.0ms] [PTS:1.0] 完成。真实时长: 21820ms, 真实-应生=60.0ms
[DEBUG] [Video-Cut] 片段66 [原片段时长:134510ms] [目标:134510ms] [PTS:1.0] 完成。真实时长: 135037ms, 真实-应生=527ms
[DEBUG] [Video-Cut] 片段76 [原片段时长:91090.0ms] [目标:91090.0ms] [PTS:1.0] 完成。真实时长: 91430ms, 真实-应生=340.0ms
[DEBUG] [Video-Cut] 片段96 [原片段时长:25150.0ms] [目标:25150.0ms] [PTS:1.0] 完成。真实时长: 25233ms, 真实-应生=83.0ms
[DEBUG] [Video-Cut] 片段86 [原片段时长:101970.0ms] [目标:101970.0ms] [PTS:1.0] 完成。真实时长: 102374ms, 真实-应生=404.0ms
[DEBUG] [Video-Cut] 片段87 [原片段时长:4540.0ms] [目标:5100ms] [PTS:1.1233480176211454] 完成。真实时长: 5137ms, 真实-应生=37ms
[DEBUG] [Video-Cut] 片段97 [原片段时长:4360.0ms] [目标:4540ms] [PTS:1.0412844036697249] 完成。真实时长: 4555ms, 真实-应生=15ms
[DEBUG] [Video-Cut] 片段95 [原片段时长:3760.0ms] [目标:4350ms] [PTS:1.1569148936170213] 完成。真
......
urbo'
[DEBUG] [新进程任务 开始:title='Model: large-v3-turbo']
[DEBUG] 新进程任务 参数:kwargs={'detect_language': 'en', 'model_name': 'large-v3-turbo', 'logs_file': 'D:/YII/tmp/34896/a328c0a64d/faster-en-1790050730.2920358.log', 'is_cuda': True, 'no_speech_threshold': 0.8, 'threshold': 0.3, 'condition_on_previous_text': False, 'audio_file': 'D:/YII/tmp/34896/a328c0a64d/recogn2pass-1790050729.8610365.wav', 'local_dir': 'D:/YII/models/models--mobiuslabsgmbh--faster-whisper-large-v3-turbo', 'compute_type': 'default', 'jianfan': False, 'audio_duration': 1854442, 'hotwords': '', 'prompt': '', 'beam_size': 5, 'best_of': 5, 'temperature': '0.0', 'repetition_penalty': 1.0, 'compression_ratio_threshold': 2.4, 'max_speech_ms': 10000, 'min_speech_ms': 3000, 'uuid': 'a328c0a64d', 'subtitle_srt': 'D:/YII/tmp/faster-20260922-12_18_50.srt', 'recogn2_max_speech': 1000, 'recogn2_min_speech': 300, 'device_index': 0, 'device_name': 'auto'}
[DEBUG] 开始加载 faster-whisper模型large-v3-turbo,数据类型:default
[DEBUG] [faster_whisper]加载模型large-v3-turbo: running on cuda,_compute_type='default'
[DEBUG] 直接传递完整音频,由faster-whisper内部VAD处理,返回字级时间戳数据
[DEBUG] faster-whisper模式下,对large-v3-turbo模型返回的字级时间戳进行断句
[DEBUG] 进入二次识别重新断句:recogn2_min_speech=300,recogn2_max_speech=1000,info.language='en'
[DEBUG] 二次识别断句完成
[DEBUG] faster-whisper下已临时保存识别结果到 D:/YII/tmp/faster-20260922-12_18_50.srt,防止进程崩溃后永久等待
[DEBUG] [新进程任务 title='Model: large-v3-turbo'] 已返回
[DEBUG] [新进程任务 结束:title='Model: large-v3-turbo'],耗时36.26637291908264s
[DEBUG] 二次识别成功完成

[DEBUG] 视频时长1868258ms-音频时长1854442ms=13816ms,需延长音频
[DEBUG] [最终视频合成]copy模式,无需重新编码:
['-y', '-progress', 'compose1790050823.9975164.txt', '-i', 'novoice.mp4', '-i', 'will_embed.m4a', '-map', '0:v', '-map', '1:a', '-c:v', 'copy', '-c:a', 'copy', '-movflags', '+faststart', '-fps_mode', 'vfr', '-shortest', 'laste_target.mp4']

#3 DeepSeek reply at 1 hour ago

从日志看,语音识别(large-v3-turbo)本身已正常完成、无报错,但你贴出的是二次识别 + 视频切割/合成阶段的日志,其中断句参数被压得极短,导致字幕被切得过于零碎,从而出现"字幕不全/句子被切散"的现象。核心问题在于参数设置:

1. 二次识别断句参数过短(最直接原因)
日志中:recogn2_max_speech=1000(1秒)、recogn2_min_speech=300(0.3秒)。
含义是:二次识别把每条字幕强制限制在 1 秒以内、最短 0.3 秒。这会把正常的一句话切成很多极短的碎片,看起来就是"漏句/字幕不完整"。
进入 菜单 → 工具/选项 → 高级选项 → 语音识别参数,把这两个值调回默认:

  • 二次识别最长语音持续(秒)/Recognition(2): max duration(s):1.5(或更大)
  • 二次识别最短语音持续(毫秒)/Recognition(2): min duration(ms):600

2. 主识别 VAD 切分参数
日志中 max_speech_ms: 10000, min_speech_ms: 3000,最长 10 秒/最短 3 秒属于正常范围,暂不调整。若主字幕也偏碎,可参考上一个问题的 VAD 调整建议。

3. 关于时长差
日志末尾 视频时长1868258ms - 音频时长1854442ms = 13816ms,需延长音频,这是正常的音画对齐处理(配音比视频短时补足),并非漏句原因,无需处理。

4. 重试前务必勾选 主界面的 清理已生成,否则会复用上次已生成的错误字幕。

调整后重试。如果仍有句子丢失,请把二次识别参数改回默认后,提供 logs/ 文件夹中最新的完整日志(含主识别 ASR 阶段)以便进一步判断。

请查阅相关文档:

#4 112.49**5 reply at 1 hour ago

总是会漏句子,视频嘴巴在说话,但却没声音

#5 DeepSeek reply at 1 hour ago

这是配音音频缺失导致的,不是语音识别漏句。核心原因有两类:

一类是 ASR 阶段确实漏识别(字幕里根本没这句),另一类是识别到了但配音阶段该句音频为空。从"嘴巴在动却没声音"的现象看,问题出在配音(TTS)阶段——某几句生成了静音或空文件。

请依次排查:

1. 排查是识别漏句还是配音漏音

  • 打开输出目录,检查翻译后的 en.srt(目标语言字幕),看缺失的部分到底有没有字幕行。
  • 若字幕这行、但配音无声 → TTS 问题(见第 2 步)。
  • 若字幕没有这行 → ASR 漏识别(见第 3 步)。

2. 配音无声的处理(最常见)

  • 高级选项 → 字幕配音调整:

    • 并发配音线程数 设为 1
    • 配音后暂停秒 设为 5~10
    • 若用 Edge-TTS,把 EdgeTTS配音渠道配音并发数 也设为 1、失败重试次数提高到 5
  • 勾选 保留每条字幕的配音文件,重试后去输出目录的配音文件夹,逐个检查哪句是空/极短文件。
  • 若渠道是 Edge-TTS,高频请求会被微软限流导致静音,降并发后重试。

3. ASR 漏识别的处理

  • 在"设置更多参数"勾选 分离人声背景声(背景音会吞掉轻声/快速说话)
  • 高级选项 → 语音识别参数:静音分割持续 调到 300~400,最长语音持续 调到 8~10
  • 检查是否使用了 自动检测 发音语言——若用了,可能返回错误语言代码导致后续整段丢失,请明确指定发音语言

4. 中途有编辑窗口时
你若是单视频交互模式,在配音完成后会弹出校对面板,能看到每句"配音时长"。若某行显示 0s 或被清空,该行就不会被合成,直接对应"没声音"。可在该面板中对该行右键 重新配音

5. 重试前
务必勾选主界面 清理已生成,避免复用上次的错误字幕和错误配音缓存。

若调整后仍存在无声片段,请提供:软件版本号、使用的配音渠道、以及 logs/ 文件夹中最新日志(复制报错或配音阶段的约30行),以便进一步分析。

请查阅相关文档:

#6 112.49**5 reply at 1 hour ago

配音完成后的srt字幕也缺失算吗

#7 DeepSeek reply at 1 hour ago

算,而且是关键判断依据。

配音完成后的 SRT 字幕也缺失,说明问题不在 TTS(配音)阶段,而是字幕文件本身就没生成这句——也就是在 语音识别(ASR) 或后续处理阶段就已经丢了,配音只是"照着缺失的字幕"配音,自然没声音。

因此排查方向应聚焦到语音识别阶段,而非配音阶段:

  1. 确认缺失是在哪一步丢的
    打开输出目录,按顺序看这几个文件:

    • 原始语言字幕(如 zh-cn.srt / en.srt):若这里就缺 → ASR 漏识别
    • 翻译后字幕:若原始字幕有、翻译后缺 → 翻译渠道问题(AI 合并了相邻行,会留空行,属正常)
    • 配音后的字幕:若前面都有、这里缺 → 才是配音阶段问题
  2. ASR 漏识别的处理(你的情况大概率在此)

    • 在"设置更多参数"中勾选 分离人声背景声(背景音乐吞掉人声,是漏句最常见原因)
    • 高级选项 → 语音识别参数:

      • 静音分割持续 调到 300~400(让短停顿也能切出句子)
      • 最长语音持续 调到 8~10
      • 语音阈值 适当降低,非语音阈值 适当减小
    • 不要使用"自动检测"发音语言,明确指定语言,否则可能返回错误语言码导致整段丢失
  3. 检查是否为二次识别压缩导致
    你之前的日志中 recogn2_min_speech=300recogn2_max_speech=1000,会把字幕切得极短、并可能合并丢行。请把这二次识别参数改回默认(max 1.5 秒 / min 600 毫秒)。
    注意:二次识别会重新生成一份字幕覆盖,若它丢句,最终字幕就会缺——这也是"配音后字幕缺失"的常见来源。
  4. 重试前务必勾选主界面的 清理已生成,否则会复用上次已生成的缺失字幕。

请点击下面链接参考优化断句和 VAD 参数。若调整后仍漏句,请提供 logs/ 文件夹中最新日志的 ASR 阶段内容(约30行)以便分析。

请查阅相关文档:

#8 112.49**5 reply at 1 hour ago

语音识别哪个模型最精准最好用,中午的

#9 DeepSeek reply at 1 hour ago

你说的"中午的"应是"中文的"。

中文识别最精准好用的模型推荐如下:首选:Qwen-ASR(内置)中文效果最佳,也支持英文等少数语言。

无论是否勾选 CUDA 加速,只要 CUDA 可用都优先走 GPU,速度快。

备选(中文效果同样优秀):阿里FunASR(内置),模型选 paraformer-zhFirered中文(内置),小红书模型,中文及20种方言;仅支持中文及英文,固定 CPU(onnx),无 GPU 加速Huggingface_ASR(内置),选 zai-org/GLM-ASR-Nano-2512(智谱AI,中文粤语效果好)收费推荐(中文极佳):豆包语音识别大模型极速版(需在字节平台开通)小米 mimo-v2.5-asr(需在小米AI平台开通并充值)通用但中文非最优:faster-whisper / openai-whisper 选 large-v3,多语言通用、质量高,但中文标点和专业识别不如上面几个中文专用模型。

综合建议:纯中文视频 → 首选 Qwen-ASR(内置);若需兼顾多语种且图省事 → faster-whisper 的 large-v3-turbo。

提高中文识别准确率补充设置:在"设置更多参数"勾选 分离人声背景声高级选项 → 语音识别参数:静音分割持续调到 300~400,最长语音持续 8~10,热词中填入视频中的专有名词(英文逗号分隔)请查阅相关文档:
语音识别所有渠道
Qwen-ASR(本地内置)
阿里FunASR(本地内置)
最佳配置推荐

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource