#6531 开头出现了后面的字幕

116.162.**3 Posted at: 11 hours ago

开头出现了后面的字幕

11 Replies

字幕顺序错乱可能由多种原因导致,最常见的是字幕时间轴或翻译缓存异常。请先按以下步骤排查:

  1. 检查输出目录下生成的 SRT 字幕文件,用文本编辑器打开,确认 SRT 文件本身的时间轴和文本顺序是否正确。如果 SRT 文件正确,说明问题出在最终合成阶段;如果 SRT 文件本身错乱,则问题出在识别/翻译阶段。
  2. 如果你使用了 AI 翻译渠道且开启了“发送完整字幕”,可能是大模型重新组织合并了相邻字幕,导致按行号对齐时指针移位,出现顺序错乱。可在高级选项中取消勾选“发送完整字幕”,并确保翻译并发数为 1。
  3. 如果你在软件中勾选了“清理已生成”,请确认不是读取到了旧的翻译缓存。可手动删除 软件目录/tmp/translate_cache/ 目录下的缓存文件后重试。
  4. 如果你手动导入了外部 SRT 字幕,请确认该字幕文件符合标准 SRT 格式(行号、时间码、空行齐全),且时间轴没有重叠或乱序。

如果以上步骤仍无法解决,暂无法确定具体原因。请提供软件安装目录下的 logs/ 文件夹中最新的日志文件内容,以及软件左上角的版本号,以便进一步分析。

取消勾选发送完整字幕有什么缺点

取消勾选“发送完整字幕”后,AI 翻译渠道将不再收到完整的行号、时间轴和整篇字幕上下文,而是按纯文本逐行或分批提交翻译。主要缺点是:AI 无法感知前后句的语境和完整语篇,翻译连贯性、自然度会下降,尤其是涉及跨句指代、语气衔接、术语一致性时,效果可能不如整段翻译。但这种方式更稳定,能有效避免大模型自行合并或重组相邻字幕导致的行号错位问题。如果你的翻译结果出现过顺序错乱,建议保持取消勾选。

顺序错乱的字幕显示的时间轴在开头 但是字幕在的位置顺序是对的

从你的描述看,如果生成的 SRT 字幕文件本身时间轴顺序正确、字幕文本顺序也正确,但最终视频里却出现“开头显示了后面的字幕”,那问题通常不在语音识别或翻译阶段,而是在最终合成阶段使用的字幕文件或字幕轨道顺序上。请按以下步骤排查:

  1. 打开输出目录(默认是视频同级的 _video_out/{视频名}-{格式} 文件夹),用文本编辑器打开里面生成的 SRT 字幕文件,确认时间轴是否按从 00:00:00 开始逐条递增、行号是否连续、文本是否对应正确。
  2. 确认你看到的是硬字幕还是软字幕。如果是软字幕,请在播放器中手动切换到正确的字幕轨道,并确认该轨道内的时间轴顺序是否正确。
  3. 检查你是否勾选了“仅输出mp4”。如果未勾选,输出文件夹里会保留多个字幕和中间文件,请确认最终视频合成时使用的是哪一个 SRT(目标语言字幕,而不是源语言字幕)。
  4. 如果 SRT 文件本身正确,请删除软件目录下 tmp/ 临时文件夹和 tmp/translate_cache/ 翻译缓存目录,并取消勾选“清理已生成”,重新处理一次,排除旧缓存干扰。
  5. 如果以上步骤仍无法解决,暂无法确定具体原因。请提供软件安装目录下 logs/ 文件夹中最新的日志文件内容,以及软件左上角的版本号数字,以便进一步分析。

时间轴顺序是错的 字幕文本顺序是正确的

字幕文本顺序正确但时间轴顺序错乱,通常发生在字幕生成或后处理阶段,而不是合成阶段。请按以下步骤排查:

  1. 打开输出目录(默认是视频同级的 _video_out/{视频名}-{格式} 文件夹),用文本编辑器打开生成的 SRT 文件,检查行号 1,2,3... 对应的时间轴是否从 00:00:00,000 开始逐条递增。如果时间轴确实乱序,说明字幕生成阶段出错。
  2. 如果你开启了「LLM重新断句」,AI 大模型在重新切分长句后可能错误分配时间轴,导致文本顺序正确但时间轴乱。请在高级选项中关闭「LLM重新断句」,改用默认断句后重试。
  3. 如果你选中了「二次识别」并嵌入单字幕,最终视频嵌入的是二次识别后的字幕,而非首次翻译字幕。请检查二次识别生成的字幕时间轴是否正确。如果二次识别字幕乱序,可关闭「二次识别」或改用「嵌入硬字幕/软字幕」模式。
  4. 如果你导入了外部 SRT 字幕,请确认该文件行号连续、时间轴严格递增且格式符合标准规范。乱序的 SRT 文件会被直接使用,导致此问题。
  5. 翻译缓存可能干扰新任务,请删除 软件目录/tmp/translate_cache/ 下的缓存文件,并取消勾选主界面的「清理已生成」,重新处理。

如果以上步骤仍无法解决,暂无法确定具体原因。请提供软件安装目录下 logs/ 文件夹中最新的日志文件内容,以及软件左上角的版本号数字,以便进一步分析。

时间轴确实乱序,字幕生成阶段出错是什么原因

字幕文本顺序正确但时间轴乱序,通常是语音识别后处理阶段对时间轴进行了重新分配或排序导致的。常见原因如下:

  1. 启用了 LLM 重新断句:AI 大模型在重新切分长句时,可能错误分配时间轴或打乱原有顺序。请到 菜单 → 工具 → 高级选项 → 语音识别参数,将「默认断句和LLM重新断句」改为「默认断句」,然后重新处理。
  2. 启用了说话人分离:如果选中了「识别说话人」,说话人归类后可能重排字幕顺序。建议先关闭「识别说话人」测试。
  3. 使用了不稳定的 VAD 参数:语音识别切片过碎或分割异常,可能导致时间轴错乱。在高级选项中适当提高「静音分割持续毫秒」,或降低「最长语音持续(秒)」和「最短语音持续(毫秒)」。
  4. 语音识别渠道自身异常:某些在线 API 或本地模型在长音频分段处理时可能返回乱序结果。建议更换为默认推荐的 faster-whisper(内置) + large-v3 模型测试。

如果关闭上述功能后仍乱序,请提供软件安装目录下 logs/ 文件夹中最新的日志文件内容,以及软件左上角版本号数字,以便进一步定位是哪个阶段出了问题。

4导致的异常除了用内置没法解决是吗

不是只能换内置渠道,但内置渠道(faster-whisper)在本地处理时最稳定,乱序概率最低。如果是其他语音识别渠道自身返回乱序,可尝试以下操作:检查该渠道在高级选项中是否有可调的“每批切片数”“识别暂停秒”等参数,适当调小每批数量或增加暂停间隔,避免长音频分批上传时返回乱序。确认该渠道是否对音频时长有限制,超长音频可能被分段处理导致时间轴错乱,可先用软件工具将音频按 10-20 分钟切片后分别识别。如果使用的在线 API 渠道持续乱序,通常不是软件能控制的,只能更换渠道或联系该服务商确认。最直接的方案仍是切换为 faster-whisper(内置) 或 openai-whisper(内置) 本地识别,这两个渠道软件能够完整控制时间轴排序逻辑。

Post Your Reply
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Dondate via PayPal

Related resource