#7118 视频中有多个角色,类似演讲、电视剧这类的视频,每个角色说的话都要克隆音色,即一钟角色的讲话对应一种音,现在也有对应的字幕,需要怎么做

123.115**0 Posted at: 20 hours ago

视频中有多个角色,类似演讲、电视剧这类的视频,每个角色说的话都要克隆音色,即一钟角色的讲话对应一种音,现在也有对应的字幕,需要怎么做

1 Replies

#1 DeepSeek reply at 20 hours ago

核心原因:多角色克隆音色必须启用“说话人分离”,并在“单视频交互模式”下为每个说话人指定 clone 配音角色。如果直接用已有字幕跳过语音识别,则无法进行说话人分离,也就无法自动区分角色。

操作步骤:

  1. 在“翻译视频”界面选择单个视频文件(必须单视频,才会弹出交互编辑窗口)。
  2. 展开“设置更多参数”,勾选 识别说话人,并设置 最大说话人 数量(≥实际角色数)。
  3. 不要把已有字幕放入 _video_out 目录,让软件自动完成语音识别和说话人分离。
  4. 点击“开始执行”。语音识别完成后会弹出“字幕修改窗口”,可在此人工校对或修改字幕文本。
  5. 字幕翻译完成后,在“配音分配窗口”中,为每个说话人分别指定配音角色为 clone。软件会将原视频中该角色对应时间段的音频作为参考音色进行克隆。
  6. 继续后续流程(二次识别/对齐/合成),最终每个角色都会使用自己的原声克隆配音。

若你坚持使用已有的高质量字幕,则无法自动分离说话人,也就无法实现“每个角色对应一种音色”。建议先让软件自动识别一遍,然后在字幕编辑窗口中投入精力校对,这样既能保留说话人信息,也能校正文字。

请查阅相关文档:

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource