#6654 我在软件运行流程,也就是最开始的分离流程之前把背景音频放置到目标文件夹下视频所在目录\_video_out\0807_no_sub\ \0807_no_sub\inst

203.198.**5 Posted at: 3 hours ago

我在软件运行流程,也就是最开始的分离流程之前把背景音频放置到目标文件夹下
视频所在目录\_video_out\0807_no_sub\

                                     \0807_no_sub\instrument.wav

\0807_no_sub\0807_no_sub.mp4
后面的视频翻译过程,是否会直接用我给的背景音频以及视频,和软件生成的配音进行视频合成呢

11 Replies

#1 DeepSeek reply at 3 hours ago

你提到只放置了 instrument.wav(背景音频),但没有放置 vocal.wav(人声音频)。根据软件设计,要直接使用外部人声/背景声,必须同时存在以下两个文件,并且命名完全一致:

_video_out/0807_no_sub-mp4/
├── vocal.wav        ← 人声(必须存在)
└── instrument.wav   ← 伴奏/背景声

同时还需要满足:

  1. 输出文件夹名称必须是 视频名-格式
    例如你的视频是 0807_no_sub.mp4,则正确的文件夹名是 0807_no_sub-mp4,不是 0807_no_sub。否则软件不会识别你放入的文件。
  2. 不要勾选“清理已生成”,否则会清空你已经放入的 instrument.wav
  3. 必须勾选“设置更多参数”中的“分离人声背景声”和“重新嵌入背景”,软件才会跳过自带的分离流程,直接使用你提供的 vocal.wavinstrument.wav 进行后续配音合成。

如果你只放了 instrument.wav 而没有 vocal.wav,软件不会按你预期的方式直接采用这个背景音频,因为它要求两个文件同时存在。请补齐 vocal.wav 并放在正确的 0807_no_sub-mp4 文件夹内后重试。

请查阅相关文档:

#2 42.200.**9 reply at 2 hours ago

只放了 instrument.wav,以及原始语言字幕字幕 而没有 vocal.wav,我的意思就是,软件是否会根据我的字幕进行重新配音,是否会跳过自动分离流程进入下一步-字幕翻译流程

#3 DeepSeek reply at 2 hours ago

根据软件设计,你只放入 instrument.wav 而没有 vocal.wav,软件不会直接采用这个背景音频,也不会因此跳过分离流程。要使用你提供的外部背景声,必须同时存在 vocal.wavinstrument.wav 两个文件,并勾选“分离人声背景声”和“重新嵌入背景”,软件才会跳过自带分离,直接使用这两个文件。

关于字幕翻译:如果你已经提供了源语言字幕(如 zh-cn.srt),软件会跳过语音识别,直接进入字幕翻译和配音阶段。但这与使用外部背景声无关。

请检查并补齐:

  1. 缺少 vocal.wav:必须同时放入人声和背景声,否则软件不会按你的预期使用 instrument.wav
  2. 文件夹命名:输出文件夹必须是 _video_out/0807_no_sub-mp4/(视频名-格式),不是 0807_no_sub
  3. 不要勾选“清理已生成”,否则会清空你放入的文件。
  4. 在主界面 设置更多参数 中必须勾选 分离人声背景声重新嵌入背景

满足以上条件后,软件才会使用你提供的外部人声/背景声与重新配音进行合成。

请查阅相关文档:

#4 42.200.**9 reply at 2 hours ago

我的意思就是,我想用我自己的背景声,要在哪一步放入?

#5 DeepSeek reply at 2 hours ago

你想用自己的背景声(instrument.wav),软件要求必须同时提供 vocal.wav(人声)instrument.wav(背景声) 两个文件,否则不会使用你放入的 instrument.wav。

正确操作步骤:

  1. 找到输出文件夹
    _video_out\0807_no_sub-mp4\
    (注意文件夹名是 视频名-格式,你当前写的是 0807_no_sub,不符合规范)
  2. 放入两个文件

    • vocal.wav:原始视频中分离出的人声(或任意可用的音频占位)
    • instrument.wav:你想要的背景音乐/伴奏
  3. 开始翻译时勾选参数

    • 不要勾选「清理已生成」
    • 在「设置更多参数」中勾选「分离人声背景声」和「重新嵌入背景」

这样软件会跳过自带的分离流程,直接使用你提供的两个文件,与 TTS 重新生成的配音进行最终合成。

如果你只能提供 instrument.wav,没有 vocal.wav,软件无法识别并采用你的背景声,请务必补齐 vocal.wav。

请查阅相关文档:

#6 42.200.**1 reply at 2 hours ago

软件的工作流程是什么?我给定字母之后,正常工作
哪一步可以替换背景音?

#7 DeepSeek reply at 2 hours ago

软件正常的工作流程是:预处理(分离音视频、人声/背景分离等)→ 语音识别 → 说话人分离 → 字幕翻译 → 配音 → 音画对齐 → 二次识别 → 最终合成。
当你已经提供字幕时,语音识别和字幕翻译会被跳过,直接进入配音与合成阶段。而替换背景音属于“预处理”阶段的工作,也就是在流程最开始的地方完成。
具体操作:在输出文件夹 _video_out/视频名-格式/ 内同时放入 vocal.wavinstrument.wav,然后在主界面“设置更多参数”中勾选“分离人声背景声”和“重新嵌入背景”,并不要勾选“清理已生成”。软件检测到这两个文件后,就会跳过自带的分离流程,直接使用你提供的背景声与重新配音进行合成。
注意:必须同时存在 vocal.wavinstrument.wav,只放其中一个不会被软件采用。
请查阅相关文档:

#8 42.200.**1 reply at 2 hours ago

背景音再合成不可能属于“预处理”阶段的工作,应该实在配音结束之后进行,到底是哪个阶段

#9 DeepSeek reply at 2 hours ago

你指出得对,我修正之前的表述。

正确流程如下:

  • 如果你提供了外部 vocal.wavinstrument.wav,软件在预处理阶段检测到后,会跳过自带的“人声/背景声分离”步骤,不进行分离计算。
  • 背景音真正被混入音频,是在配音完成之后最终合成阶段(assembling)完成的——此时 FFmpeg 会将无声视频、TTS 生成的配音、你提供的 instrument.wav 背景声,以及字幕合并为最终视频。

所以准确说法是:

  1. 预处理阶段:确认使用你提供的 vocal.wav + instrument.wav,跳过内置分离。
  2. 配音阶段:根据你提供的字幕生成新配音。
  3. 最终合成阶段(assembling):将新配音与 instrument.wav 背景声、原画面、字幕一起合并输出。

你提供字幕的前提下,语音识别和字幕翻译都会被跳过。请确保 _video_out/视频名-格式/ 文件夹下同时存在 vocal.wavinstrument.wav,并勾选“分离人声背景声”和“重新嵌入背景”,且不勾选“清理已生成”。

请查阅相关文档:

#10 42.200.**1 reply at 2 hours ago

如何进行批量视频翻译

#11 DeepSeek reply at 2 hours ago

在主界面翻译视频面板中,勾选“文件夹”,再点击左上角选择按钮,选择包含多个视频的文件夹,即可批量处理该文件夹下所有视频。也可以直接多选视频文件(支持 mp4/mkv/avi/mov/wav/mp3 等格式)。注意事项:默认输出位置:勾选文件夹时,输出到所选文件夹同级的 _video_out/{该文件夹名} 下,每个视频生成一个结果文件夹。批量翻译时不会进入单视频交互编辑模式,中间也不会暂停。若需分批并发,可在 菜单 → 工具 → 高级选项 → 通用设置 → 批量翻译视频时每批数量 中设置每批同时处理的视频数,默认 0 即不限制。请查阅相关文档:视频翻译功能

Thinking...
Post Your Reply
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource