#7091 还是会出现漏句子的情况 ,太难受了

182.147**1 Posted at: 2 hours ago

image
image
还是会出现漏句子的情况 ,太难受了

25 Replies

#1 DeepSeek reply at 2 hours ago

导致“漏句子”通常有以下 3 种常见原因,请按顺序排查:

  1. 语音识别阶段 VAD 参数过于严格
    较短的语句可能被误判为静音并合并或丢弃。
    解决方法:菜单 → 工具 → 高级选项 → 语音识别参数,将:

    • 最短语音持续(毫秒) 调小(例如 3000 或更低)
    • 最长语音持续(秒) 适当调大(例如 10-15)
    • 静音分割持续毫秒 适当调小(例如 500-800)
  2. AI 大模型翻译时重新合并了相邻字幕
    AI 可能会将前后两个短句合并翻译,导致原始内容并入其他行,留下一行空白字幕,视觉上像漏句。
    解决方法:高级选项 → 字幕翻译调整取消勾选 发送完整字幕,并将 AI翻译渠道每批字幕行数 设为 1
  3. 翻译结果出现空行,配音阶段跳过空行
    翻译后的字幕如果存在空行,配音时会跳过该行,导致听感上缺句。
    解决方法:在字幕编辑界面手动补全或删除空行,并确保没有空文本。

若问题依然存在,请提供以下信息以便进一步定位:

  • 软件版本号(主界面左上角)
  • 漏句子具体发生在哪个阶段:识别出的字幕缺失 / 翻译后的字幕缺失 / 配音缺失
  • logs/ 目录下最新日志文件底部约 30 行内容

请查阅相关文档:

#2 182.147**1 reply at 2 hours ago

AI 大模型翻译时重新合并了相邻字幕 这个我没有设置!翻译没设置 我不需要!翻译结果出现空行配音阶段跳过空行 不需要 也没有设置。 语音识别阶段 VAD 参数过于严格 不需要设置语音阈值和非语音阈值吗,?我翻译日语 场景是成人视屏。 最短语音持续(毫秒)
最长语音持续(秒)
静音分割持续毫秒 应该怎么设置, 需要勾选合并果断字幕吗?

#3 DeepSeek reply at 2 hours ago

漏句子在日语成人视频场景下,最常见原因就是语音识别阶段的 VAD 参数过严,导致短句被误判为静音、被合并或被丢弃。你不需要动翻译相关设置,只调整识别参数即可。

1. 语音阈值 / 非语音阈值需要设置

成人视频中常有大量气音、喘息、低音量人声,这些声音的能量低于普通说话声,容易被 VAD 判定为“非语音”而漏掉。

  • 语音阈值:适当调低(让更多片段被判定为语音,减少漏句)
  • 非语音阈值:适当调低(让更少片段被判定为非语音,也能减少漏句,但可能引入噪声)

两个值没有固定推荐值,建议各从默认值向下逐步微调,观察漏句是否改善。如果噪声变多,再略回调。

2. 最短语音持续(毫秒)、最长语音持续(秒)、静音分割持续(毫秒)

  • 最短语音持续(毫秒)调小,例如 3000 或更低。数值越小,短句越不容易被合并进相邻字幕,能保留更多短句。
  • 最长语音持续(秒)适当调大,例如 10-15,避免长句被强制切割,导致内容被切掉。
  • 静音分割持续(毫秒)调小,例如 500-800,这样在较短静音处就会分割,保留独立短句。

3. 关于“合并短字幕”

如果你使用的是 v4.12 及以上版本,该功能已移除,无需设置。如果是旧版本,请取消勾选“合并邻近短字幕”,否则短字幕会被合并成一条,视觉和听觉上都会漏句。

4. 额外建议

  • 主界面点击“设置更多参数”,勾选 “分离人声背景声”“降噪”,能有效排除背景音干扰,提高识别完整度。
  • 识别渠道建议保持在 faster-whisper(内置),模型选择 large-v3large-v3-turbo,准确度更高。
  • 注意:以上调整后,如果仍漏句,请提供主界面左上角的软件版本号、以及 logs/ 目录下最新日志底部约30行内容,便于进一步定位。

请查阅相关文档:

#4 182.147**1 reply at 2 hours ago

image
这个参数怎么样

#5 DeepSeek reply at 2 hours ago

我无法直接查看你上传的图片内容,请将截图中的具体参数值(如语音阈值、非语音阈值、最短语音持续、最长语音持续、静音分割持续等)按顺序告诉我,我可以帮你判断是否合适。

结合你翻译日语成人视频的场景,以下参数是推荐的调整方向,你可以对照检查:

  • 语音阈值:适当调低(例如从默认的 0.5 降至 0.3-0.4),让更多低音量片段被识别为语音,减少漏句。
  • 非语音阈值:适当调低(例如从默认的 0.6 降至 0.4-0.5),减少被误判为静音的片段。
  • 最短语音持续(毫秒):建议设为 3000 或更低,保留短句。
  • 最长语音持续(秒):建议设为 10-15,避免长句被强制切断。
  • 静音分割持续毫秒:建议设为 500-800,在较短静音处即可分割,保留独立短句。

另外,主界面「设置更多参数」中建议勾选 分离人声背景声降噪,能有效提升识别完整性。

如果参数调整后仍漏句,请提供以下信息:

  • 软件版本号(主界面左上角)
  • 漏句发生在哪个阶段(识别出的字幕缺失 / 翻译后的字幕缺失 / 配音缺失)
  • logs/ 目录下最新日志文件底部约 30 行内容

请查阅相关文档:

#6 182.147**1 reply at 2 hours ago

语音阈值:0.3 非语音阈值.0.4 最长语音持续(秒)10秒 。最短语音持续(毫秒)1500.二次最长语音持续.2秒 。 二次识别最短语音持续;500毫秒。 静音分割持续毫秒;400. 未勾选合并过短字幕

#7 DeepSeek reply at 2 hours ago

你的参数整体方向正确,但有一个关键值偏大,可能会直接导致漏句:

最短语音持续(毫秒)设为 1500ms 过大
这个参数的含义是:如果某条字幕时长小于该值,就会尝试合并进相邻字幕。在日语成人视频中,常有短促的气音、喘息或短句,时长可能只有几百毫秒。1500ms 会把这些短句合并掉,看起来就像漏了句子。

建议调整:将「最短语音持续(毫秒)」改为 500-700ms,保留更多短句。

其他参数基本合理:

  • 语音阈值 0.3、非语音阈值 0.4:已足够灵敏,能捕捉低音量人声,但有带入噪声的风险,可观察效果后再微调。
  • 最长语音持续(秒)10秒:合适。
  • 静音分割持续毫秒 400ms:偏小,利于在短静音处分割,保留独立短句,合理。
  • 二次识别参数(最长2秒、最短500ms):只影响配音后的二次识别,不参与首轮识别,对漏句影响不大。
  • 未勾选「合并过短字幕」:如果软件是 v4.12 及以上,该功能已被移除,无需关注。

额外建议
在主界面点击「设置更多参数」,勾选「分离人声背景声」和「降噪」,能有效排除背景音干扰,提升识别完整度。

若调整后仍漏句,请提供主界面左上角的软件版本号,以及 logs/ 目录下最新日志底部约30行内容,便于进一步定位。

请查阅相关文档:

#8 182.147**1 reply at 2 hours ago

处理器 Intel(R) Core(TM) i5-10400F CPU @ 2.90GHz 2.90 GHz
机带 RAM 16.0 GB
存储 466 GB HDD MB0500GCEHE, 466 GB SSD WDS500G3X0C-00SJG0, 932 GB HDD WDC WD10EZEX-08WN4A0
显卡 NVIDIA GeForce RTX 2060 SUPER (8 GB)
以上是我的电脑配置。 使用降噪 处理的是2小时视频文件的降噪。速度太慢了! 从来没勾选~

#9 DeepSeek reply at 2 hours ago

降噪与分离人声背景声在软件内是纯 CPU 运算,不会使用你的 RTX 2060 SUPER 显卡加速。处理 2 小时视频,CPU 需要处理大量音频切片,速度慢是正常的,并不是软件卡死。你的电脑配置(Intel i5-10400F + 16GB + RTX 2060 SUPER)不算差,但这类算法本身不支持 GPU 加速,仅靠 CPU 跑 2 小时音频会非常耗时。处理建议如下:1. 如果不需要降噪或分离背景声,直接在“设置更多参数”中取消勾选“降噪”和“分离人声背景声”,软件将直接使用原始音频,速度会快很多。2. 如果确实需要分离人声和背景声(例如想要保留原背景音乐),建议使用第三方工具如 UVR5-GUI,它支持 GPU 加速,分离速度远快于软件内置的 CPU 版本。3. 使用 UVR5 分离好后,将人声文件重命名为 vocal.wav,伴奏文件重命名为 instrument.wav,放到输出目录 _video_out/视频名-后缀/ 文件夹内,然后回到软件勾选“分离人声背景声”和“重新嵌入背景”,软件将直接使用已分离好的文件,跳过 CPU 分离过程。注意:软件内置降噪也是纯 CPU 操作,如果没有明显背景噪声,不建议开启,否则会大幅拖慢整体识别速度。若必须降噪,建议先用第三方音频工具(如 Adobe Audition、Audacity 等)离线降噪后再导入软件。请查阅相关文档:导入本地已有的字幕或人声高级选项参数说明

#10 182.147**1 reply at 2 hours ago

我现在使用的是4.11版本, 有最新版本吗?
分离人声这个功能在语音转录界面下并没有! 只有降噪, 这两个功能是一样的吗

#11 DeepSeek reply at 2 hours ago

最新版本是 v4.12,建议升级。该版本修复了部分已知 bug,并优化了 VAD 切分算法,对漏句问题可能有所改善。

降噪和分离人声背景声是两个不同的功能:

  • 降噪:清除音频中的背景噪声,保留人声本身,常用于提升识别准确度。
  • 分离人声背景声:将人声与背景音乐/环境声完全分离,可单独处理人声或背景声,并支持后续重新嵌入背景。

在左侧的“语音转录”独立功能界面中,仅提供“降噪”选项,没有“分离人声背景声”是正常的。“分离人声背景声”位于视频翻译主界面的“设置更多参数”中,用于视频翻译的全流程处理。如果你只是单纯想将视频中的语音转录为字幕,不涉及后期重新嵌入背景声,使用“降噪”即可,无需勾选“分离人声背景声”。

如果你确实需要分离人声(例如视频中有大量背景音乐干扰识别),请回到视频翻译主界面(默认界面),点击“设置更多参数”,勾选“分离人声背景声”。但请注意,软件内置的分离也是 CPU 运行,2小时视频速度会很慢。建议使用第三方工具 UVR5-GUI 先在 GPU 下分离好,再按本文档 导入本地已有的字幕或人声 中的方法放入指定文件夹。

升级到 v4.12 后,在高级选项中“合并过短字幕”功能已被移除,无需再关注此项。

#12 182.147**1 reply at 2 hours ago

更新到了4.12.二次识别使用模型 选择哪个、 ? 根据我使用的环境。你帮我推荐一个 。 说话人分离模型又应该怎么选择?

#13 DeepSeek reply at 2 hours ago

更新到 v4.12 后,二次识别固定使用 faster-whisper 渠道,你只需要在高级选项 → 语音识别参数 → 二次识别所用模型 中选择模型即可。根据你的硬件(RTX 2060 SUPER 8GB 显存),推荐使用 large-v3-turbo,速度与质量平衡,显存占用约 6GB,适合 8GB 显存。如果你觉得速度慢或显存不够,可选 medium 或 small,但准确度会有所下降。说话人分离模型:如果你不需要按说话人分配角色,直接保持“不启用”即可,这样可以加快处理速度。如果需要分离说话人:日语场景下,默认内置模型仅支持中英,不适合日语。推荐使用 pyannote(支持多语言),但需要在 huggingface.co 拥有 token,并手动同意其授权协议,然后在高级选项 → 语音识别参数 → Huggingface的token 中填写。若你无法访问 huggingface,也可尝试阿里 CAM++,但需要手动下载模型。注意:批量翻译视频时会跳过说话人分离,只有单视频交互模式下才会生效。如果不想处理说话人分离,建议关闭,避免额外的时间和模型下载成本。

#14 182.147**1 reply at 2 hours ago

一部2小时的电影 ,我的CPU如果开启降噪 大概需要多久能处理完成

#15 DeepSeek reply at 2 hours ago

降噪在软件内是纯 CPU 运算,不支持 GPU 加速。处理一部 2 小时电影,耗时没有固定值,取决于你的 CPU 核心数、降噪模型、音频采样率、内存大小以及音频本身的复杂程度。以你的 i5-10400F + 16GB 内存估算,处理时长可能会达到数小时甚至更长,远超出视频本身时长。因此强烈建议:如果只是为了提升语音识别准确度,且视频本身没有明显背景噪声,请关闭降噪,直接识别原始音频,速度会快很多。如果确实需要降噪,建议使用第三方音频工具(如 Audacity、Adobe Audition 或 UVR5-GUI)离线处理,这些工具支持 GPU 加速,速度远快于软件内置的 CPU 降噪。处理完成后再将降噪后的音频导入软件。注意:软件“设置更多参数”中的“降噪”与“分离人声背景声”均为纯 CPU 运算,不建议在大规模批量处理时开启。如果你只是想解决漏句问题,优先调整 VAD 参数(如最短语音持续设为 500-700ms、静音分割持续设为 400-800ms),不一定需要开启降噪。

#16 182.147**1 reply at 56 minutes ago

这么多模型,有适合我用的日本成人视频提取字幕的模型吗

#17 DeepSeek reply at 56 minutes ago

针对日语成人视频,推荐的语音识别模型如下:首选 faster-whisper(内置) 的 large-v3-turbo 或 large-v3,准确度高,支持日语。若显存紧张(8GB),large-v3-turbo 是平衡之选。备选 parakeet日语(内置),英伟达开源日语专用模型,对日语发音识别效果很好,但仅支持日语,且不支持 CUDA 加速,速度较慢。备选 openai-whisper(内置) 的 large-v3,通用效果好,速度比 faster-whisper 慢,但有时对含混发音更稳健。如果你想要专门针对日语微调的模型,还可以在 HuggingFace_ASR(内置) 渠道中选择:reazon-research/japanese-wav2vec2-large-rs35kh 或 kotoba-tech/kotoba-whisper-v2.0,这两个都是日语专用模型,但模型下载可能受网络影响。另外,成人视频常见低音量、气音、喘息音,虽然模型识别能力强,但漏句仍可能由 VAD 参数导致。建议你保持 faster-whisper + large-v3-turbo,并调整以下参数:语音阈值 0.3、非语音阈值 0.4、最短语音持续 500-700ms、最长语音持续 10-15s、静音分割持续 400-800ms。如果需要更好效果,可在主界面“设置更多参数”中勾选“降噪”或先用第三方工具分离背景声。注意:以上模型均需首次在线下载,若下载失败,请参考手动下载模型文档。请查阅相关文档:faster-whisper本地手动下载模型

#18 182.147**1 reply at 53 minutes ago

reazon-research/japanese-wav2vec2-large-rs35kh 或 kotoba-tech/kotoba-whisper-v2.0 这两个谁更好,更加适合我呢

#19 DeepSeek reply at 53 minutes ago

推荐使用 kotoba-tech/kotoba-whisper-v2.0。原因:kotoba-whisper-v2.0 基于 Whisper 架构,经过日语语料微调,对嘈杂环境、低音量、弱语音的鲁棒性更强,更适合成人视频中常见的气音、喘息、背景音乐等复杂声学环境。reazon-research/japanese-wav2vec2-large-rs35kh 是 wav2vec2 类模型,速度较快,但在噪声较大或说话人声音较小时,漏句和错识率明显更高。虽然两个模型都需在线下载,但 kotoba-whisper-v2.0 在日语识别准确度和复杂音频适应性上均优于前者。注意:该模型需在左侧“语音转录”或视频翻译界面选择 HuggingFace_ASR 渠道,并在模型下拉框中选择 kotoba-tech/kotoba-whisper-v2.0。同时,请保持 VAD 参数已经调整为较低阈值(最短语音持续 500-700ms、静音分割 400-800ms),否则再优秀的模型也可能漏句。请查阅相关文档:Huggingface_ASR渠道手动下载模型

#20 182.147**1 reply at 52 minutes ago

kotoba-whisper-v2.0 不是说有2.1 2.2版本吗~

#21 DeepSeek reply at 52 minutes ago

知识库中仅记录存在 kotoba-tech/kotoba-whisper-v2.0 这一模型,未涉及 2.1 或 2.2 版本的信息。因此无法确定是否有更新版本。请以以下两个来源为准:软件内 HuggingFace_ASR 渠道的模型下拉列表是否显示其他版本;访问 HuggingFace 官方仓库查看当前收录的版本。如果存在更高版本,可能需要手动下载模型文件并放置到软件目录,但需要注意软件兼容性,未经官方适配的版本可能出现未知错误。建议先使用 v2.0 测试效果,如果漏句问题显著改善,则无需追求更高级版本。请查阅相关文档:Huggingface_ASR渠道手动下载模型

#22 182.147**1 reply at 14 minutes ago

有什么办法parakeet日语这个模型用GPU跑吗?

#23 DeepSeek reply at 14 minutes ago

根据知识库信息,parakeet日语模型标注为“仅支持日语”,且其 GPU 加速列显示为“X”,即该模型在软件内不支持 GPU 加速,固定使用 CPU 运行。知识库中未提供任何使其改用 GPU 的方法。如果确实需要 GPU 加速,建议改用以下支持 CUDA 的渠道,效果更好:faster-whisper(内置) 的 large-v3-turbo,支持日语,速度快且可使用 GPU;openai-whisper(内置) 的 large-v3,准确度高,支持 GPU。如果坚持使用 parakeet,那么只能接受 CPU 处理,速度会较慢,且需等待较长时长。请查阅相关文档:faster-whisper本地手动下载模型

#24 182.147**1 reply at 12 minutes ago

pyVideoTrans内置的parakeet日语模型只能跑CPU,但它支持的另一个方式——Parakeet-API——可以完美利用你的NVIDIA显卡。

这相当于在你的电脑上单独启动一个高性能的语音转录服务,然后让pyVideoTrans通过网络接口去调用它,这个服务本身是支持GPU加速的。配置起来也不复杂: 这个建议怎么样?

#25 DeepSeek reply at 12 minutes ago

这个建议是可行的,但需要明确区分:pyVideoTrans 软件内置的“parakeet日语(内置)”渠道固定使用 CPU;而你说的方案对应的是知识库中“Parakeet-tdt(本地API)”渠道,它属于“高级自定义”类,需要你自行单独部署一个支持 GPU 加速的语音转录服务,再让软件通过 API 地址调用。如果你能成功部署并开启 GPU 加速,那么确实可以利用你的 RTX 2060 SUPER 显卡。但需要注意:

  1. 部署过程比较复杂,需要单独安装运行环境、下载 Parakeet 模型,并确保服务监听在本地端口(例如 127.0.0.1:xxxx)。
  2. 软件中需要在“语音识别渠道”中选择 “Parakeet-tdt(本地API)”,并填写你部署好的 API 地址。
  3. 并不是所有部署方式都默认支持 GPU,你需要确认你部署的服务确实使用了 CUDA 加速,否则仍然会走 CPU。
  4. 该方案适合有一定技术能力的用户,如果你只是想快速解决漏句问题,更推荐直接使用 faster-whisper(内置) 的 large-v3-turbo,它原生支持 GPU,配置简单,且日语识别效果优秀。

如果你愿意尝试本地 API 方案,请查阅相关文档:

请查阅相关文档:

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource