#6540 No transcription results returned. Please check the original audio/video or model and try again.info=TranscriptionInfo(l

112.48.**3 Posted at: 3 hours ago

No transcription results returned. Please check the original audio/video or model and try again.
info=TranscriptionInfo(language='en', language_probability=1, duration=28.9566875, duration_after_vad=0.0, all_language_probs=None, transcription_options=TranscriptionOptions(beam_size=5, best_of=5, patience=1, length_penalty=1, repetition_penalty=1.0, no_repeat_ngram_size=0, log_prob_threshold=-1.0, no_speech_threshold=0.6, compression_ratio_threshold=2.4, condition_on_previous_text=False, prompt_reset_on_temperature=0.5, temperatures=[0.0, 0.2, 0.4, 0.6, 0.8, 1.0], initial_prompt=None, prefix=None, suppress_blank=True, suppress_tokens=(1, 2, 7, 8, 9, 10, 14, 25, 26, 27, 28, 29, 31, 58, 59, 60, 61, 62, 63, 90, 91, 92, 93, 359, 503, 522, 542, 873, 893, 902, 918, 922, 931, 1350, 1853, 1982, 2460, 2627, 3246, 3253, 3268, 3536, 3846, 3961, 4183, 4667, 6585, 6647, 7273, 9061, 9383, 10428, 10929, 11938, 12033, 12331, 12562, 13793, 14157, 14635, 15265, 15618, 16553, 16604, 18362, 18956, 20075, 2
......
5, duration_after_vad=0.0, all_language_probs=None, transcription_options=TranscriptionOptions(beam_size=5, best_of=5, patience=1, length_penalty=1, repetition_penalty=1.0, no_repeat_ngram_size=0, log_prob_threshold=-1.0, no_speech_threshold=0.6, compression_ratio_threshold=2.4, condition_on_previous_text=False, prompt_reset_on_temperature=0.5, temperatures=[0.0, 0.2, 0.4, 0.6, 0.8, 1.0], initial_prompt=None, prefix=None, suppress_blank=True, suppress_tokens=(1, 2, 7, 8, 9, 10, 14, 25, 26, 27, 28, 29, 31, 58, 59, 60, 61, 62, 63, 90, 91, 92, 93, 359, 503, 522, 542, 873, 893, 902, 918, 922, 931, 1350, 1853, 1982, 2460, 2627, 3246, 3253, 3268, 3536, 3846, 3961, 4183, 4667, 6585, 6647, 7273, 9061, 9383, 10428, 10929, 11938, 12033, 12331, 12562, 13793, 14157, 14635, 15265, 15618, 16553, 16604, 18362, 18956, 20075, 21675, 22520, 26130, 26161, 26435, 28279, 29464, 31650, 32302, 32470, 36865, 42863, 47425, 49870, 50254, 50258, 50359, 50360, 50361, 50362, 50363), without_timestamps=False, max_initial_timestamp=1.0, word_timestamps=True, prepend_punctuations='"\'“¿([{-', append_punctuations='"\'.。,,!!??::”)]}、', multilingual=False, max_new_tokens=None, clip_timestamps=[0.0], hallucination_silence_threshold=None, hotwords=''), vad_options=VadOptions(threshold=0.5, neg_threshold=None, min_speech_duration_ms=0, max_speech_duration_s=inf, min_silence_duration_ms=140, speech_pad_ms=400))

cfg=[TaskCfgVTT]当前工作模式: 翻译视频或音频 单视频模式
原始输入文件名: C:/Users/Administrator/Desktop/视频/3.mp4,
输出结果保存到文件夹: C:/Users/Administrator/Desktop/视频/_video_out/3-mp4,
临时文件夹: D:/pyvideotrans/win-pyvideotrans-v4.09/tmp/9036/9f44220770
已选 清理已存在
未启用CUDA加速
未选 降噪
语音识别:faster-whisper(内置), large-v3-turbo, 发音语言: 英语, 断句方式:LLM重新断句
翻译渠道:DeepSeek,原始语言:英语,目标语言:简体中文, 已选 发送完整字幕
配音渠道:Edge-TTS(免费), 角色:Xiaoxiao(Female/CN), 配音语言:简体中文, 未选 二次语音识别
音量:+0%, 语速:+0%, 已选 音频加速, 未选 视频慢速
字幕: 嵌入硬字幕


=
system:Windows-10-10.0.19045-SP0
version:v4.09
frozen:True
language:zh
root_dir:D:/pyvideotrans/win-pyvideotrans-v4.09

53 Replies

这是 VAD(语音活动检测)在音频中未检测到任何有效人声导致的。日志中 duration=28.9566875 表示音频总时长约 28.96 秒,但 duration_after_vad=0.0 表示经过 VAD 切割后有效语音片段为 0 秒,识别引擎没有拿到可转录的人声输入,因此直接报 "No transcription results returned"。这类情况通常不是模型损坏,而是输入音频本身没有清晰人声。

请按以下步骤排查:

  1. 先用本地播放器播放该视频,确认视频确实包含音轨,并且有清晰的人声说话内容。如果视频只有背景音乐、静音或无人说话,则无法转录。
  2. 将视频移动到纯英文简单路径。当前路径 C:/Users/Administrator/Desktop/视频/3.mp4 含中文目录名,部分 ffmpeg/底层组件对中文和特殊字符兼容性较差,可能导致音频提取异常。建议改为类似 C:/videos/3.mp4 后再重新执行。
  3. 如果视频有声音但人声较小或噪声较大:在主界面点击“设置更多参数”,勾选“降噪”;也可以勾选“分离人声背景声”,让软件先分离出人声再识别。
  4. 更换识别渠道或模型交叉验证:例如将 faster-whisper(内置) 换成 openai-whisper(内置),模型从 large-v3-turbo 换成 large-v3medium,排除模型/渠道兼容性问题。
  5. 如果以上均无效,请提供 软件安装目录/logs/ 下最新的日志文件(复制底部约 30 行),重点确认 ffmpeg 是否成功抽取出音频、以及抽出的 wav 是否为空或异常。

请查阅相关文档:

硬字幕、软字幕是什么意思
嵌入硬字幕双是什么意思
嵌入软字幕双是什么意思

硬字幕:将字幕永久"烧录"到视频画面中,无法关闭,在任何播放器、任何设备上播放都会显示。

软字幕:将字幕作为独立轨道封装进视频文件,播放器可手动选择开启/关闭;但网页播放器通常无法显示软字幕。

嵌入硬字幕双(即硬字幕双语):将"原始语言字幕 + 目标语言字幕"两行一起永久烧录到画面中,两行同时显示,无法关闭。

嵌入软字幕双(即软字幕双语):将"原始语言字幕 + 目标语言字幕"两行作为可开关的字幕轨道封装进视频,播放器自行选择显示与否。

不懂 口语化一点

硬字幕:字幕直接“印”在画面里,像视频本身自带的字幕一样,播放时永远显示,关不掉。适合发给别人看,不管他用什么播放器都能看到字幕。

软字幕:字幕是“藏”在视频文件里的一个独立轨道,用播放器(如 PotPlayer、VLC)打开时,可以自己选择显示或隐藏。但如果你把视频发到微信或传到网上用网页播放,很可能看不到字幕。

硬字幕双:画面里同时印着两行字:上面是原语言(比如英文),下面是翻译后的话(比如中文),都关不掉。

软字幕双:视频里带了两行字幕(原语言+翻译),播放器里可以自己开关显示哪行,或两行都显示。但网页上播放可能看不到。

一句话总结:

  • 硬字幕 = 字幕焊死在画面上
  • 软字幕 = 字幕是独立轨道,可开关
  • 双 = 原话和翻译各一行,硬双就是两行都焊死,软双就是两行都可开关

也即是软字幕看不到字幕是吧

不是,软字幕是能看到的。它不是隐形了,而是把字幕单独做成一条轨道塞进视频里。用电脑本地播放器(PotPlayer、VLC 等)打开,默认就会显示字幕,也可以手动关掉;但如果你把视频传到网页上播放,或者用某些不支持字幕轨道的播放器,就可能看不到,因为网页播放器一般不认这种内嵌字幕轨道。所以软字幕不是看不到,而是“看播放器心情”。硬字幕就是不管谁看,字幕都在画面上。双也是一个道理:两行字幕(原话和翻译)而已。

网页的播放视频是什么意思,别人微信给我发的视频是网页版的吗?如果我想做的二次开发,我应该是用硬字幕还是软字幕,我也想让别人看到字幕

网页播放视频:就是在浏览器里看视频,比如刷抖音、B站、微信里点开别人发的视频,这些都叫网页播放。这种播放器一般只能显示画面里"焊死"的字幕(硬字幕),不认软字幕轨道,所以软字幕在网页上会看不到。别人微信给你发的视频:微信里的视频播放器也是这种"网页式"的,不支持软字幕轨道。所以如果视频用的是软字幕,对方在微信里打开很可能看不到字幕;用硬字幕的话,就一定显示。你想二次开发,还要确保别人都看到字幕:直接用硬字幕。硬字幕是直接把文字画在画面里,任何播放器、任何设备、任何平台打开都一定会显示。软字幕虽然可以开关,但很多人用微信、网页打开就等于没有,不够保险。一句话:想让所有人看到,选硬字幕。

那硬字幕二次开发怎么开

在软件主界面第五行“同步对齐和字幕”区域,直接勾选“嵌入硬字幕”,或勾选“嵌入硬字幕(双)”即可。如果想在命令行/二次开发中调用,使用 CLI 参数 --subtitle_type 1(硬字幕)或 --subtitle_type 3(硬字幕双语)。硬字幕会把文字直接绘制到画面像素上,视频合成后字幕就永久固定在画面里,任何播放器都能看到。

分离人声背景声的区别是什么

“分离人声背景声”是把视频里的声音拆成两路:一路是人声(vocal),一路是背景伴奏(instrument)。勾选后,软件会用 人声 去做语音识别和翻译,这样识别更准,不容易被音乐噪声干扰;翻译完成配音后,再选择是否把之前拆出来的背景音重新混回去,这叫“重新嵌入背景”。具体区别:

不勾选“分离人声背景声”:软件直接把原始混合音频拿去做识别、配音、合成。速度快,但如果视频有音乐/噪声,识别容易出错,配音合成后背景音也无法单独处理。

勾选“分离人声背景声”,但不勾“重新嵌入背景”:软件先用纯人声识别,翻译配音后,最终视频里 只有新配音,没有原背景音,背景伴奏会被丢掉,视频会变得“很安静”。

勾选“分离人声背景声”,同时勾选“重新嵌入背景”:软件先用纯人声识别,翻译配音后,再把原来的背景伴奏和新配音混合,最终视频既有新配音,又保留原背景音,效果更自然。

简单记忆:分离 = 先把人声和伴奏拆开,识别更准;嵌入背景 = 翻译配音后,把原来的伴奏加回来。如果不需要保留原背景音乐,可以只勾分离;一般推荐两个都勾上。

你把你的这个软件的详细教程跟我讲一下,方便运营使用,比如image
这几个的作用是什么,什么情况下使用,怎么使用

视频翻译完整流程:选视频 → 选语音识别渠道和模型 → 选发音语言 → 选目标语言 → 选翻译渠道 → 选配音渠道和角色 → 选字幕嵌入方式 → 点“开始”。

主界面各行作用:

  • 第1行:选择要翻译的视频/音频。可单个或多个,也可勾“文件夹”批量处理。
  • 第2行:语音识别渠道。负责把视频里的人声转成字幕。常用 faster-whisper(内置),模型选 large-v3 或 large-v3-turbo。
  • 第3行:翻译渠道。负责把字幕翻译成目标语言。常用 DeepSeek、Google(需代理)或本地 M2M100。
  • 第4行:配音渠道和角色。负责把翻译后的字幕读出来。默认 Edge-TTS 免费且自然。
  • 第5行:同步对齐和字幕方式。解决配音变长/变短导致的音画不同步问题,同时选择字幕嵌入类型。
  • 第6行:开始执行。有 N 卡并装好 CUDA 时务必勾选“CUDA加速”。
  • 第7行:进度条。完成后点击可打开输出文件夹。
  • 第8行:设置更多参数… 下图里的选项都在这里。

你截图里这些选项的作用和使用场景:

  1. 识别说话人:勾选后会在识别后区分这句话是谁说的(准确度有限)。单视频模式下有效。右边数字可预设说话人数量,提前知道人数能提高准确度。适合采访、多人对话类视频。
  2. 配音语速:调整整体配音语速。填 50 表示加快 50%,填 -50 表示减慢 50%。当中文翻译成英文时,可填 +10~+15 让配音更紧凑。
  3. 音量+:调整最终配音音量。填 50 表示音量增大 50%,-50 表示降低 50%。默认 0 即可。
  4. 音调+:调整配音音调高低。填 20 音调变尖锐,填 -20 音调变低沉。一般不需要动。
  5. 修改硬字幕样式:点击可设置硬字幕的字体、颜色、描边、位置等。只有选了“嵌入硬字幕”或“硬字幕双”时才需要。
  6. 分离人声背景声:把视频里的“人声”和“背景伴奏”拆开。拆出的人声用于识别,更准;拆出的背景音可保留。适合视频里有音乐、噪声的情况。
  7. 嵌入背景:如果勾了“分离人声背景声”,再勾此项,最终合成时会把你原来的背景伴奏混回视频里。不勾则最终只有新配音,原背景音会丢失。推荐两个都勾。
  8. 循环背景音:如果原背景音长度不够覆盖整个视频,勾选后会把背景音循环播放,否则后面用静音填充。一般配合“嵌入背景”使用。
  9. 背景音量:重新嵌入背景音后,设置背景音量大小。默认 0.8,即降低为原来的 80%。
  10. 额外添加背景音频:可以手动选择一个本地音频文件,作为新背景音替换原背景音乐。适合想完全换背景音乐的场景。
  11. 降噪:清除音频中的环境噪声、电流声等。如果同时勾了“分离人声背景声”,只对分离出的人声做降噪。适合录音环境嘈杂的视频。
  12. 恢复标点/删除标点:恢复标点:识别后自动补上句号逗号;删除标点:去掉所有标点。默认不选即可,视字幕用途决定。

整体运营建议:

  • 最稳定的配置:faster-whisper(内置) + large-v3-turbo + DeepSeek翻译 + Edge-TTS配音 + 硬字幕。
  • 如果视频有背景音乐,打开“设置更多参数”,勾选“分离人声背景声”和“嵌入背景”。
  • 如果视频音频噪声大,再勾选“降噪”。
  • 如果想保留原说话人音色,配音角色选“clone”(需 TTS 渠道支持,如 OmniVoice、Qwen-TTS、F5-TTS 等)。
  • 如果最终视频要发给别人在微信、网页上看,字幕方式选“嵌入硬字幕”或“嵌入硬字幕(双)”。
  • 批量处理多个视频时,可同时交叉执行;如果想一个一个来,去“菜单→工具/选项→高级选项→通用设置”里把“批量翻译视频时每批数量”改为 1。

还有你这个什么情况下使用 什么情况下不能使用的视频内容和我讲一下

适合用的情况:视频里有人清晰说话,比如:课程讲座、会议录像、采访对话、短视频口播、电影/剧集(带干净对白)、带字幕或不带字幕的视频都可以(软件会识别语音生成新字幕)。只要音频里有人声,且能听清楚,就能翻译、配音、出字幕。支持常见视频格式 mp4/mkv/avi/mov/webm/ts/flv/wmv 等,音频格式 wav/mp3/m4a/flac/aac/ogg 等。

不适合用的情况:只有背景音乐、纯音乐、环境音,没有人声说话的视频 —— 识别不到任何语音,必然报“无转录结果”。人声极小、被音乐或噪声完全盖住的视频 —— VAD 可能判为静音,识别不出来。目标语言不在软件支持列表内 —— 目前支持约 40 种语言,包括中英日韩法德俄西等,如果源语言或目标语言不在列表里,无法直接处理。视频画面里已经烧死的“硬字幕” —— 软件不能直接提取或抹除画面内嵌字幕。如果要提取硬字幕,需另外用 OCR 工具;如果要抹除,需用视频字幕去除工具。超长时间视频 —— 不是不能处理,而是耗时极长,且本地大模型对显存/内存要求高,容易中途失败。建议长视频先切成片段再处理。音画不同步严重的视频、损坏的视频文件 —— ffmpeg 无法正常抽取音频时也会失败。

一句话总结:凡是“听得到人说话”的视频都能处理;“没人说话”或“人声听不清”的视频不能处理。

使用步骤跟我讲一下 完整的仔细的

好的,以下是 pyVideoTrans 完整使用步骤,从打开软件到拿到最终成品,一步一步讲清楚。


一、准备工作

  1. 确保软件能正常打开,双击 sp.exe,等待 5 秒到 2 分钟进入主界面。
  2. 建议把要处理的视频放到一个纯英文路径下,例如 D:\videos\3.mp4,不要放在带中文或特殊符号的路径中。
  3. 如果有 NVIDIA 显卡并已装好 CUDA 12.8+ 和 cuDNN 9.11+,在开始前先勾选主界面第 6 行的 CUDA加速,识别速度会快很多。

二、主界面逐行配置(翻译视频/音频)

第 1 行:选择要翻译的视频

点击 选择视频或音频,选中要处理的视频文件。也可以按住 Ctrl 多选,或勾选 文件夹 批量处理整个文件夹。

第 2 行:语音识别

  • 语音识别渠道:一般选 faster-whisper(内置) 即可。
  • 模型:选 large-v3-turbo(速度与质量兼顾),显存够大可用 large-v3(效果最好)。
  • 发音语言:必须手动选择原视频中人物说话的语言。例如视频里说的是英语,就选“英语”。
  • 断句方式一般保持默认即可。

第 3 行:字幕翻译

  • 目标语言:选择你想翻译成的语言,比如“简体中文”。
  • 翻译渠道:推荐 DeepSeek(需先在菜单→翻译设置→DeepSeek中填写 API Key),或 Google 翻译(国内需代理),或 M2M100(内置)零配置。
  • 如果是用 AI 翻译渠道,建议勾选 发送完整字幕,翻译更自然。

第 4 行:配音

  • 配音渠道:一般选 Edge-TTS(免费) 即可,无需任何配置。
  • 配音角色:选一个发音人。比如目标语言是中文,可以选 Xiaoxiao(Female/CN)Yunyang(Male/CN)
  • 如果不想配音,只换字幕,就把配音角色选为 No

第 5 行:同步对齐和字幕

  • 音频加速:建议勾选。当某句配音比原视频长时,自动加速配音以匹配画面。
  • 视频慢速:一般不用勾,勾了处理很慢且文件体积会变大。
  • 字幕方式:推荐选 嵌入硬字幕嵌入硬字幕(双),这样发到微信/网页上也一定显示字幕。

第 6 行:开始

点击 开始 按钮,等待执行。


三、更多参数(可选)

点击主界面第 8 行的 设置更多参数...

  • 视频里有背景音乐/噪声 → 勾选 分离人声背景声,同时勾选 嵌入背景,这样识别更准,最终视频还保留原背景音。
  • 视频质检很吵 → 勾选 降噪
  • 想微调配音 → 调 配音语速音量+音调+,一般保持 0 即可。
  • 多人对话视频 → 勾选 识别说话人,可填预知人数。

设置完后再点主界面的 开始


四、等待处理

字幕会显示在右侧预览区,整体进度在底部进度条显示。处理时间取决于视频时长、模型大小、是否GPU加速。任务完成后,点击进度条区域会打开输出文件夹。


五、获取成品

默认输出位置:

  • 单个视频:原视频同级目录下的 _video_out 文件夹内,例如 D:\videos\_video_out\3-mp4
  • 最终翻译完成的视频就在里面,文件名与原视频相同,格式为 mp4。

六、常见配置速查

场景推荐配置
最佳效果faster-whisper large-v3-turbo + DeepSeek 翻译 + Edge-TTS 配音 + 硬字幕 + CUDA加速
视频有背景音乐勾“分离人声背景声” + “嵌入背景”
视频噪声大勾“降噪”
保留原说话人音色配音角色选“clone”(需 TTS 渠道支持,如 OmniVoice、F5-TTS 等)
发微信/网页给别人看字幕方式选“嵌入硬字幕”或“嵌入硬字幕(双)”
大批量逐条处理菜单→工具/选项→高级选项→通用设置→“批量翻译视频时每批数量”改为 1

如果在任何一步遇到报错,请把软件安装目录下 logs/ 文件夹里最新的日志文件内容发出来,我帮你分析。

如果我文件夹里第一个视频是韩文、第二个视频是英文 ,可以批量处理吗

不能。批量处理时,软件所有视频共用同一套设置,尤其是“发音语言”只能指定一个。第一批设成韩文,第二个英文视频也会按韩文去识别,结果必然错误。正确做法:按语言分组处理。先把韩文视频放一个文件夹,发音语言选“韩语”,批量跑完;再把英文视频放另一个文件夹,发音语言改为“英语”,再批量处理。如果只有几个视频,也可以一个一个分开处理,每次改发音语言。

二次语音识别,完成后关机是什么意思你都没有说,还有就是转译翻译、语音转录、文字配音、翻译字幕、角色配音、媒体合并
这些使用步骤也要非常详细,完整

二次语音识别

在主界面第 5 行“同步对齐和字幕”区域,勾选“二次识别”。

作用:配音全部完成后,软件会对新生成的配音音频再做一次语音识别,根据实际配音生成时间轴更精准的字幕,再嵌入视频。适合对字幕和配音对齐要求很高的情况。

使用条件:必须已选择配音角色(不能是 No),并且字幕方式选了“嵌入单字幕”(非双语)。如果不满足这两个条件,二次识别不会生效。

注意:二次识别会使用主界面第 2 行所选语音识别渠道和模型,所以该渠道必须能识别“目标语言”。例如原视频是中文,翻译成日语,所选识别渠道却是“Firered中文”,它不支持日语,二次识别出的字幕就会乱码或完全错误。此时应换用支持目标语言的识别渠道(如 faster-whisper 内置 large-v3)。

完成后关机

在软件主界面第 1 行,勾选“完成后关机”。

作用:所有视频任务全部处理完后,自动关闭电脑。适合晚上睡觉前批量翻译大量视频,第二天直接看结果。注意:请确保任务开始后不要再操作电脑,以免影响关机判断;如果中途出错退出,系统不会关机。


左侧各功能详细使用步骤

1. 语音转录

用途:把视频或音频中的人声转成带时间轴的 SRT 字幕文件,不翻译、不配音。

使用场景:只需要字幕文件,比如做字幕组、会议记录、采访整理。

操作步骤:

  1. 点击左侧“语音转录”面板。
  2. 点击“选择音视频”按钮,选择一个或多个音视频文件(也可勾选“文件夹”批量处理)。
  3. 选择“语音识别渠道”(推荐 faster-whisper 内置)和“模型”(large-v3-turbo)。
  4. 选择发音语言,如英语、中文;不确定时可选“自动检测”。
  5. 可选设置:降噪、识别说话人、恢复标点等。
  6. 点击“开始”。
  7. 完成后在输出目录(默认软件目录下 output 文件夹,可在“菜单→工具/选项→高级选项→独立功能输出目录”修改)中查看 SRT 字幕。

2. 文字配音

用途:把纯文本或 SRT 字幕文件,用 TTS 语音合成为音频。

使用场景:把文章朗读成音频、给字幕文件配声音。

操作步骤:

  1. 点击左侧“文字配音”面板。
  2. 导入字幕文件(SRT)或直接粘贴文本内容。
  3. 选择“配音渠道”(推荐 Edge-TTS 免费)和目标语言,然后选择“配音角色”。
  4. 可调节语速、音量、音调。
  5. 点击“开始”。
  6. 输出音频文件到默认 output 目录。

注意:如果导入 SRT 字幕,软件会按每一条字幕逐句配音,并尽量按时间轴处理;如果导入的是纯文本,则会连续朗读,不按时间轴切分。

3. 翻译字幕

用途:批量把 SRT 字幕文件从一种语言翻译成另一种语言,不识别、不配音。

使用场景:已有现成字幕,只想翻译成其他语言。

操作步骤:

  1. 点击左侧“翻译字幕”面板。
  2. 点击选择 SRT 字幕文件(可多选)。
  3. 选择源语言(源字幕语言)和目标语言。
  4. 选择翻译渠道(如 DeepSeek、Google、M2M100 等)。
  5. 点击“开始”。
  6. 翻译结果保存在输出目录中。

4. 角色配音

用途:导入一个 SRT 字幕文件,按每行字幕的说话人,为不同角色分配不同的配音音色。

使用场景:多人对话的视频,想让每个人用不同声音配音。

操作步骤:

  1. 点击左侧“角色配音”面板。
  2. 导入一个 SRT 字幕文件。
  3. 软件会根据字幕内容或说话人标记列出角色列表,为每个角色指定一个配音渠道和角色。
  4. 点击“开始”,软件会按行为每个角色生成对应配音音频。

5. 媒体合并

用途:将已有的视频、音频、字幕三个文件合并为一个视频文件。

使用场景:已有无声视频 + 配音音频 + 字幕文件,想合成最终视频。

操作步骤:

  1. 点击左侧“媒体合并”面板。
  2. 分别选择视频文件、音频文件、字幕文件(字幕可选)。
  3. 选择是否硬字幕或软字幕等选项。
  4. 点击“开始”,最终合并后的视频会输出到你指定的目录。

6. 视频翻译(主功能)

就是软件打开后默认的面板,完整流程已在前面讲过的“主界面逐行配置”:选择视频 → 语音识别 → 发音语言 → 目标语言 → 翻译渠道 → 配音渠道/角色 → 对齐与字幕 → 设置更多参数 → 开始。如果一次只选一个视频,会自动进入单视频交互编辑模式,可在每个阶段修改字幕或重新配音;如果一次选多个视频,则自动批量执行,不会暂停。

这个完成的流程完整的整理给到我

以下是 pyVideoTrans 完整使用手册,覆盖全部主要功能、适用场景、详细步骤和注意事项。

pyVideoTrans 完整使用手册

一、什么情况下能用 / 什么情况下不能用

能用的情况:视频或音频中有人清晰说话,例如课程讲座、会议录像、采访对话、短视频口播、电影剧集对白等。无人声则无法处理。

不能用的情况:

  • 只有背景音乐、纯音乐、环境音,没有人声
  • 人声被音乐/噪声完全盖住
  • 源语言或目标语言不在软件支持列表中
  • 视频画面里已经内嵌的硬字幕无法被提取或抹除
  • 视频文件损坏或音画严重异常

二、视频翻译(最核心功能)

完整流程

选择视频 → 配置语音识别 → 配置翻译 → 配置配音 → 配置字幕嵌入方式 → 设置更多参数 → 点击开始 → 获取成品

步骤一:选择视频

  • 点击“选择视频或音频”,选择单个或多个视频(按住 Ctrl 多选)
  • 勾选“文件夹”可批量处理整个文件夹内的视频
  • 建议把视频放到纯英文路径,如 D:\videos\3.mp4

步骤二:语音识别(第 2 行)

将视频中的人声转成字幕文件。

  • 语音识别渠道:推荐 faster-whisper(内置)
  • 模型:推荐 large-v3-turbo(速度质量均衡),显存充足可用 large-v3
  • 发音语言:必须手动选择视频中人物说话的语言,例如韩文视频选“韩语”,英文视频选“英语”
  • 断句方式:一般保持默认

步骤三:字幕翻译(第 3 行)

将识别出的字幕翻译为目标语言。

  • 目标语言:选择你想翻译成的语言,如“简体中文”
  • 翻译渠道:

    • DeepSeek:效果好,需在 菜单→翻译设置→DeepSeek 填写 API Key
    • Google 翻译:免费,但国内需代理
    • M2M100(内置):完全离线,第一次使用需下载模型
  • 使用 AI 翻译渠道时建议勾选“发送完整字幕”,翻译更自然

步骤四:配音(第 4 行)

将翻译后的字幕朗读出来。

  • 配音渠道:推荐 Edge-TTS(免费),无需配置
  • 配音角色:选择发音人。目标语言为中文时可选 Xiaoxiao(女)/Yunyang(男)
  • 如果不想配音只换字幕,配音角色选 No

步骤五:对齐与字幕(第 5 行)

  • 音频加速:建议勾选。配音比原视频长时自动加速匹配
  • 视频慢速:一般不用勾,处理慢且文件体积增大
  • 字幕方式:

    • 硬字幕:字幕永久烧在画面里,发微信/网页也一定显示
    • 软字幕:字幕是独立轨道,可开关,但微信/网页打不开
    • 双:原语言 + 翻译语言两行同时显示
    • 推荐选“嵌入硬字幕”或“嵌入硬字幕(双)”
  • 二次语音识别:勾选后会在配音完成后对配音文件再次识别,生成时间轴更精准的字幕。需满足:已选配音角色(不能是 No),且字幕方式为单字幕。同时语音识别渠道必须支持识别目标语言
  • 完成后关机:所有任务完成后自动关闭电脑,适合夜间批量处理

步骤六:CUDA 加速与开始

  • 有 NVIDIA 显卡并装好 CUDA 12.8+ 和 cuDNN 9.11+ 时,务必勾选“CUDA加速”
  • 点击“开始”执行

步骤七:设置更多参数(可选)

点击主界面第 8 行“设置更多参数…”:

  • 识别说话人:多人对话视频可勾选,数字填预知人数
  • 配音语速:填 50 加快 50%,-50 减慢 50%
  • 音量+:填 50 增大 50%,-50 降低 50%
  • 音调+:调整音调高低,一般不动
  • 修改硬字幕样式:设置硬字幕字体、颜色、描边等
  • 分离人声背景声:视频有背景音乐时勾选,先拆出人声再识别更准确
  • 嵌入背景:勾选后把原背景伴奏混回最终视频;不勾则背景音会被丢掉。推荐两个都勾
  • 循环背景音:背景音不够长时循环播放
  • 背景音量:嵌入背景音的音量大小,默认 0.8
  • 额外添加背景音频:手动指定一个本地音频替代原背景音乐
  • 降噪:清除环境噪声,适合嘈杂录音
  • 恢复标点/删除标点:按需选择

步骤八:获取成品

  • 默认输出:所选视频同级目录下 _video_out 文件夹内,例如 D:/videos/_video_out/3-mp4
  • 任务完成后点击底部进度条区域可打开输出文件夹

批量处理限制

同一批视频必须使用同一套设置,尤其是“发音语言”只能统一指定一种。韩文视频和英文视频不能混在同一批处理,需按语言分组逐个执行。

单视频交互模式

一次只选一个视频时,会自动进入单视频交互模式,在每个阶段弹出编辑窗口,可修改字幕错别字、分配角色、试听和重新配音。如果不想弹出编辑窗口,可在“菜单→工具/选项→高级选项→单视频交互翻译暂停倒计时”改为 0。

三、语音转录

用途

把视频/音频中的人声转成带时间轴的 SRT 字幕文件,不翻译、不配音。

使用场景

只需要字幕文件,如字幕组、会议记录、采访整理。

步骤

  1. 点击左侧“语音转录”面板
  2. 点击“选择音视频”,选择一个或多个音视频文件(可勾“文件夹”批量)
  3. 选择语音识别渠道(推荐 faster-whisper)和模型(large-v3-turbo)
  4. 选择发音语言;不确定时可选“自动检测”
  5. 可选:降噪、识别说话人、恢复标点
  6. 点击“开始”
  7. 输出位置:默认软件目录下 output 文件夹,可在“菜单→工具/选项→高级选项→独立功能输出目录”修改

四、文字配音

用途

把纯文本或 SRT 字幕文件用 TTS 合成语音音频。

使用场景

文章朗读成音频、给字幕文件配音。

步骤

  1. 点击左侧“文字配音”面板
  2. 导入 SRT 字幕文件,或直接粘贴/输入纯文本内容
  3. 选择配音渠道(推荐 Edge-TTS)和目标语言
  4. 选择配音角色
  5. 可调节语速、音量、音调
  6. 点击“开始”
  7. 输出到默认 output 目录

注意:导入的是 SRT 字幕时,软件会按时间轴逐句配音;导入纯文本时,则会连续朗读不按时间切分。

五、翻译字幕

用途

批量把 SRT 字幕文件从一种语言翻译成另一种语言。

使用场景

已有现成字幕,只需翻译。

步骤

  1. 点击左侧“翻译字幕”面板
  2. 点击选择 SRT 字幕文件(可多选)
  3. 选择源语言(字幕原本语言)和目标语言
  4. 选择翻译渠道(如 DeepSeek、Google、M2M100 等)
  5. 点击“开始”
  6. 翻译结果保存在默认 output 目录

六、角色配音

用途

导入一个 SRT 字幕文件,按每行字幕的说话人分配不同配音音色。

使用场景

多人对话视频,想让每个人用不同声音配音。

步骤

  1. 点击左侧“角色配音”面板
  2. 导入一个 SRT 字幕文件
  3. 软件列出角色列表,为每个角色指定配音渠道和音色
  4. 点击“开始”,逐行生成对应配音

七、媒体合并

用途

将已有的视频、音频、字幕三个文件合并为一个视频文件。

使用场景

已有无声视频 + 配音音频 + 字幕文件,需合成最终成品。

步骤

  1. 点击左侧“媒体合并”面板
  2. 分别选择视频文件、音频文件、(可选)字幕文件
  3. 选择字幕嵌入方式(硬字幕/软字幕)
  4. 点击“开始”
  5. 成品输出到指定目录

八、输出位置速查

功能默认输出位置
视频翻译所选视频同级目录 _video_out/{视频名}-{后缀}
语音转录 / 文字配音 / 翻译字幕软件目录下 output 文件夹
角色配音软件目录下 output 文件夹
媒体合并所选输出目录

九、常用配置速查

场景推荐配置
最稳定效果faster-whisper large-v3-turbo + DeepSeek + Edge-TTS + 硬字幕 + CUDA 加速
视频有背景音乐勾选“分离人声背景声”+“嵌入背景”
视频噪声大勾选“降噪”
保留原说话人音色配音角色选 clone(需支持克隆的 TTS 渠道,如 OmniVoice、F5-TTS 等)
发微信/网页给别人看字幕方式选“嵌入硬字幕”或“嵌入硬字幕(双)”
批量视频逐条处理菜单→工具/选项→高级选项→通用设置→“批量翻译视频时每批数量”改为 1
夜间无人值守勾选“完成后关机”

附:日志与报错

若运行中报错,请前往软件安装目录下 logs/ 文件夹,复制最新的日志文件内容(底部约 30 行),提交给技术支持分析,以确定具体失败原因。

意:凡是“听得到人说话”的视频都能处理;“没人说话”或“人声听不清”的视频不能处理。
一、使用步骤
一、准备工作

  1. 确保软件能正常打开,双击 sp.exe,等待 5 秒到 2 分钟进入主界面。
  2. 建议把要处理的视频放到一个纯英文路径下,例如 D:\videos\3.mp4,不要放在带中文或特殊符号的路径中。
  3. 如果有 NVIDIA 显卡并已装好 CUDA 12.8+ 和 cuDNN 9.11+,在开始前先勾选主界面第 6 行的 CUDA加速,识别速度会快很多。

二、主界面逐行配置(翻译视频/音频)
第 1 行:选择要翻译的视频
点击 选择视频或音频,选中要处理的视频文件。也可以按住 Ctrl 多选,或勾选 文件夹 批量处理整个文件夹。
第 2 行:语音识别

  • 语音识别渠道:一般选 faster-whisper(内置) 即可。
  • 模型:选 large-v3-turbo(速度与质量兼顾),显存够大可用 large-v3(效果最好)。
  • 发音语言:必须手动选择原视频中人物说话的语言。例如视频里说的是英语,就选“英语”。
  • 断句方式一般保持默认即可。
    第 3 行:字幕翻译
  • 目标语言:选择你想翻译成的语言,比如“简体中文”。
  • 翻译渠道:推荐 DeepSeek(需先在菜单→翻译设置→DeepSeek中填写 API Key)
    [图片]
    [图片]
  • 如果是用 AI 翻译渠道,建议勾选 发送完整字幕,翻译更自然。
    第 4 行:配音
  • 配音渠道:一般选 Edge-TTS(免费) 即可,无需任何配置。
  • 配音角色:选一个发音人。比如目标语言是中文,可以选 Xiaoxiao(Female/CN) 或 Yunyang(Male/CN)等。
  • 如果不想配音,只换字幕,就把配音角色选为 No。
    第 5 行:同步对齐和字幕
  • 音频加速:建议勾选。当某句配音比原视频长时,自动加速配音以匹配画面。
  • 视频慢速:一般不用勾,勾了处理很慢且文件体积会变大。
  • 字幕方式:推荐选 嵌入硬字幕 或 嵌入硬字幕(双),这样发到微信/网页上也一定显示字幕。
    第 6 行:开始
    点击 开始 按钮,等待执行。

三、更多参数(可选)
点击主界面第 8 行的 设置更多参数...:

  • 视频里有背景音乐/噪声 → 勾选 分离人声背景声,同时勾选 嵌入背景,这样识别更准,最终视频还保留原背景音。
  • 视频质检很吵 → 勾选 降噪。
  • 想微调配音 → 调 配音语速、音量+、音调+,一般保持 0 即可。
  • 多人对话视频 → 勾选 识别说话人,可填预知人数。
    设置完后再点主界面的 开始。

四、等待处理
字幕会显示在右侧预览区,整体进度在底部进度条显示。处理时间取决于视频时长、模型大小、是否GPU加速。任务完成后,点击进度条区域会打开输出文件夹。


五、获取成品
默认输出位置:

  • 单个视频:原视频同级目录下的 _video_out 文件夹内,例如 D:\videos\_video_out\3-mp4。
  • 最终翻译完成的视频就在里面,文件名与原视频相同,格式为 mp4。

六、常见配置速查
暂时无法在飞书文档外展示此内容
如果在任何一步遇到报错,请把软件安装目录下 logs/ 文件夹里最新的日志文件内容发出来,我帮你分析。\
在我这个基础上添加

你整理的这份内容已经很完整了,以下是在你基础上补充的遗漏部分:


七、左侧各功能详细使用步骤(除视频翻译外)

1. 语音转录

用途: 把视频/音频中的人声转成带时间轴的 SRT 字幕文件,不翻译、不配音。

使用场景: 只需要字幕文件,如字幕组、会议记录、采访整理。

步骤:

  1. 点击左侧“语音转录”面板
  2. 点击“选择音视频”,选择一个或多个音视频文件(可勾“文件夹”批量)
  3. 选择语音识别渠道(推荐 faster-whisper 内置)和模型(large-v3-turbo)
  4. 选择发音语言;不确定时可选“自动检测”(注意:仅语音转录面板有自动检测,视频翻译面板必须手动指定发音语言)
  5. 可选:降噪、识别说话人、恢复标点
  6. 点击“开始”

输出位置: 默认软件目录下 output 文件夹,可在“菜单→工具/选项→高级选项→独立功能输出目录”修改。


2. 文字配音

用途: 把纯文本或 SRT 字幕文件用 TTS 合成语音音频。

使用场景: 文章朗读成音频、给已有字幕配声音。

步骤:

  1. 点击左侧“文字配音”面板
  2. 导入 SRT 字幕文件,或直接粘贴/输入纯文本内容
  3. 选择配音渠道(推荐 Edge-TTS 免费)和目标语言
  4. 选择配音角色
  5. 可调节语速、音量、音调
  6. 点击“开始”

注意: 导入 SRT 字幕时会按时间轴逐句配音;导入纯文本时会连续朗读,不按时间切分。导入的字幕必须符合标准 SRT 格式,否则时间轴会被当成文本读出来。


3. 翻译字幕

用途: 批量把 SRT 字幕文件从一种语言翻译成另一种语言。

使用场景: 已有现成字幕,只需翻译。

步骤:

  1. 点击左侧“翻译字幕”面板
  2. 点击选择 SRT 字幕文件(可多选)
  3. 选择源语言(字幕原本语言)和目标语言
  4. 选择翻译渠道(如 DeepSeek、Google、M2M100 等)
  5. 点击“开始”

输出位置: 默认 output 目录。


4. 角色配音

用途: 导入一个 SRT 字幕文件,按每行字幕的说话人分配不同配音音色。

使用场景: 多人对话视频,想让每个人用不同声音配音。

步骤:

  1. 点击左侧“角色配音”面板
  2. 导入一个 SRT 字幕文件
  3. 软件列出角色列表,为每个角色指定配音渠道和音色
  4. 点击“开始”,逐行生成对应配音

5. 媒体合并

用途: 将已有的视频、音频、字幕三个文件合并为一个视频文件。

使用场景: 已有无声视频 + 配音音频 + 字幕文件,需合成最终成品。

步骤:

  1. 点击左侧“媒体合并”面板
  2. 分别选择视频文件、音频文件、(可选)字幕文件
  3. 选择字幕嵌入方式(硬字幕/软字幕)
  4. 点击“开始”

八、批量处理的重要限制

同一批视频必须使用同一套设置,尤其是“发音语言”只能统一指定一种。

例如: 韩文视频和英文视频不能混在同一批处理。需按语言分组:先处理韩文视频,再把发音语言改为英语,再处理英文视频。


九、单视频交互模式说明

一次只选一个视频时,会自动进入单视频交互编辑模式,在每个处理阶段弹出编辑窗口,可手动修改字幕错别字、分配角色、试听和重新配音。

如果不想弹出编辑窗口,可在“菜单→工具/选项→高级选项→单视频交互翻译暂停倒计时”改为 0。


十、输出位置速查

功能默认输出位置
视频翻译所选视频同级目录 _video_out/{视频名}-{后缀}
语音转录 / 文字配音 / 翻译字幕软件目录下 output 文件夹
角色配音软件目录下 output 文件夹
媒体合并所选择的输出目录

十一、二次语音识别与完成后关机补充说明

二次语音识别: 勾选后会在配音完成后对配音文件再次做语音识别,生成时间轴更精准的单字幕嵌入视频。前提:必须已选择配音角色(不能是 No),且字幕方式选了单字幕(非双语)。同时语音识别渠道必须支持识别目标语言,否则二次识别出的字幕会乱码或错误。

完成后关机: 勾选后,所有视频任务处理完毕后自动关闭电脑。适合夜间批量处理大量视频,第二天直接看结果。注意任务开始后不要再操作电脑,若中途出错退出则不会关机。


十二、日志报错

若运行中报错,请前往软件安装目录下 logs/ 文件夹,复制最新的日志文件内容(底部约 30 行),提交给技术支持分析。同时请备注软件左上角的版本号数字。

导出的视频老师超出,怎么办

“导出的视频老超出”应是指文件体积太大,超出期望大小(比如微信、网盘或平台限制)。常见原因和解决办法如下:

1. 不要勾选“视频慢速”

如果在“同步对齐和字幕”里勾选了“视频慢速”,FFmpeg 会切片后大幅降速并重新编码,文件体积会指数级增大,可能比原视频大数倍。
解决办法:取消“视频慢速”,只保留“音频加速”。

2. 调整视频输出质量控制(CRF)

进入 菜单 → 工具/选项 → 高级选项 → 视频输出控制

  • 把“视频输出质量控制”从默认值调大到 25~30
  • 数值越大,画质轻微下降,但文件体积明显减小
  • 一般 28 左右可大幅压缩体积

3. 切换 H.265 编码

同一高级选项面板中,把“264/265编码”从 264 改为 265(HEVC)。
在相同清晰度下,H.265 可精简约 30%~50% 的体积。

4. 只保留最终视频

主界面第 1 行勾选“仅输出mp4”,这样输出文件夹中只保留最终视频,不保留过程中生成的字幕、配音等素材,可避免目录内多文件占用空间,但视频本身的体积还需要按上面办法压缩。

5. 控制配音时长,避免末尾被截断

如果配音后时长大于原视频时长,且没有启用“音频加速”,视频末尾会被强制截断或补静音,此时也可能间接导致最终文件异常变大。
建议在“同步对齐和字幕”中勾选“音频加速”,或适当设置“配音语速”+10~+15。


如果不方便自行判断,请提供以下信息,我再帮你确认具体原因:

  1. 软件版本号(左上角如 v4.09)
  2. 是否勾选了“视频慢速”/“分离人声背景声”
  3. 导出的视频格式和大小,以及你觉得“超出”的具体是哪个限制(如微信传不了、超过100MB等)

请查阅相关文档:

视频里面的字幕超出来了怎么办

这是硬字幕过大或位置超出画面边界导致的。解决方法如下:1. 调整字幕字体大小和位置点击主界面“设置更多参数...” → “修改硬字幕样式”在样式编辑器中调小字体大小,并将字幕位置设为底部居中等安全区域,避免文字被画面边缘截断。2. 控制每行字幕字符数进入 菜单 → 工具/选项 → 高级选项 → 字幕声音画面对齐:将“中日韩字幕单行字符数”(中文/日文/韩文)或“其他语言字幕单行字符数”(英文等)调小一些,例如从默认值调为 15~20,这样长句会自动换行,避免一行文字过宽超出画面。3. 如果使用的是软字幕软字幕显示是否溢出由播放器的字幕样式决定,软件内无法直接控制;建议改选“嵌入硬字幕”并统一调整样式。若以上方法仍无法解决,请提供以下信息,我进一步判断:软件版本号(左上角 v4.09)出现超出的字幕语言和视频分辨率(如 1920x1080)是否使用双层字幕(双语)无法判断时可附上输出视频截图。

什么时候用到LLM重新断句和默认断句。跟我讲一下

默认断句和 LLM 重新断句的区别,取决于你需要“保留原始识别时间轴”还是“追求更通顺的文本”。默认断句:使用场景——大多数常规视频翻译都推荐用它。已经能满足需求时,不需要额外AI处理,速度快,且不会改变识别出的原始时间轴。必须使用默认断句的情况:配音角色选择 clone(克隆原音色)时,绝对不要用 LLM 重新断句,因为 LLM 会重建时间轴,导致截取的参考音频与说话时间错位,克隆音质大幅下降。启用“识别说话人”时,软件会自动禁用 LLM 重新断句,因为重新断句会降低说话人识别精度。LLM 重新断句:使用场景——识别结果断句很差、长句过多、存在明显错别字,希望字幕语义更通顺、断句更自然时使用。前提:必须配置 DeepSeek 或 OpenAI ChatGPT 等 AI 模型,并在 菜单 → 工具/选项 → 高级选项 → 通用设置 → LLM断句模型 中选择。注意:LLM 断句会重新划分时间轴,可能让字幕时间与画面声音错位;且效果取决于所用大模型智能水平,结果也可能更糟糕。如果识别结果本身可用,就不要开启。一句话建议:默认断句适合绝大多数用户和所有克隆/说话人分离场景;LLM 重新断句只在识别文本质量差、需要 AI 修正错别字和优化断句时尝试,但必须避开克隆和说话人分离。如果你是做“原音色克隆”或“多角色配音”,直接保持默认断句即可。

简单的说一下

默认断句:大多数情况都用它,识别出来是什么样就用什么样,速度快,不改时间轴。LLM重新断句:识别出来的文字乱、断句差、有错别字时使用,让AI重新整理得更通顺,但会改时间轴,效果看AI本事。注意两点:配音角色选clone(克隆原音色)时,千万别用LLM重新断句,否则克隆出来声音是乱的。勾选了识别说话人时,LLM重新断句会自动禁用。一般用户就用默认断句,除非识别结果实在太差再考虑LLM。

  • 多人对话视频 → 勾选 识别说话人,可填预知人数。
    如:视频里有几个人说话可勾选几人
    是这个意思吗

是的,你这个理解完全正确。视频里有几个人说话,就在“识别说话人”后的数字框里填几,比如视频里有3个人对话,就填 3,软件会尝试把字幕按3个说话人的角色分开,准确度会更高。如果拿不准具体人数,可以保持默认不限制,让它自动识别。注意:这个功能只在“单视频模式”(一次只选一个视频翻译)下有效,批量翻译多个视频时会自动跳过。

转录翻译里的默认标点、恢复标点、删除标点是什么意思

这三个选项控制的是语音识别后字幕文本里的标点符号处理方式,具体如下:

默认(不选):保持识别模型直接输出的结果,模型自带什么标点就保留什么,不做额外处理。大多数情况下用这个即可。

恢复标点:如果识别结果没有标点或标点不完整,软件会尝试按语义补上句号、逗号、问号等,让字幕更通顺。适合识别结果整段文字挤在一起、缺少停顿的情况。

删除标点:识别完成后,把所有标点符号全部去掉。适合只需要纯文字内容(比如做关键词统计、字符数限制严格、或后续要用其他工具重新加标点)的场景。

一句话:默认 = 不管;恢复标点 = 把标点补全;删除标点 = 全部去掉。

转录翻译的srt文件是啥的image

SRT 文件就是一种最常见的字幕文件格式,里面记录了每一句字幕的文字内容和这条字幕在视频中显示的起止时间。比如:

1
00:00:01,000 --> 00:00:04,000
你好,欢迎观看

2
00:00:05,000 --> 00:00:08,000
这是一个视频翻译工具

在“语音转录”功能里,软件把视频/音频中的人声识别成文字后,会生成一个这种格式的字幕文件(后缀为 .srt)。这个文件可以单独使用,也可以用于:导入到视频剪辑软件中做字幕轨;用“文字配音”功能给这个 SRT 文件配音;用“翻译字幕”功能翻译成其他语言;用“媒体合并”功能把视频、音频、这个 SRT 字幕合成带字幕的视频。你截图里如果是在“语音转录”界面,输出结果就是这样的 SRT 字幕文件,默认保存在软件目录下的 output 文件夹里。

我的视频名字是4.srt和4-ko.srt 的区别是什么,要用哪一个

4.srt 和 4-ko.srt 的区别:4.srt:通常是“源语言字幕”,也就是原始视频/音频里人声识别出的字幕。4-ko.srt:是翻译成韩语后的字幕,-ko 代表韩语语言代码(Korean)。要用哪一个,取决于你的场景:如果只是查看原始识别结果:用 4.srt。如果需要已翻译成韩语的字幕文件:用 4-ko.srt。如果要导入视频翻译中,让软件跳过识别或翻译阶段:这两个文件名都不是标准命名,软件只认“语言代码.srt”格式。源语言字幕应命名为发音语言代码.srt,例如英语是 en.srt、中文是 zh-cn.srt;目标语言字幕应命名为目标语言代码.srt,例如韩语是 ko.srt。假设你的视频发音是中文、目标是韩语,那应该这样放:_video_out/4-mp4/zh-cn.srt ← 源语言字幕(中文)_video_out/4-mp4/ko.srt ← 目标语言字幕(韩语)所以,如果你要把4.srt和4-ko.srt用于视频翻译,请按上面的规则重命名后放到对应输出目录中。

生成的这个srt 文件夹有什么用

SRT 文件本身就是字幕文件,相当于一个“带时间的文稿”。它的作用主要有几个:1. 单独保存字幕:以后任何播放器(PotPlayer、VLC 等)都可以加载这个文件显示字幕。2. 配音用:在“文字配音”功能里导入这个 SRT,可以按时间轴逐句配音。3. 翻译用:在“翻译字幕”功能里导入这个 SRT,可以翻译成其他语言。4. 合成视频用:在“媒体合并”里把这个 SRT 和视频、音频合并,生成带字幕的视频。5. 视频翻译时复用:如果你对已有字幕质量满意,可以在视频翻译时把它作为“发音语言字幕”或“目标语言字幕”放到输出目录中,软件会自动跳过语音识别或翻译阶段,直接使用这个字幕。一句话:SRT 文件是中间产物,可以拿来直接用、配音、翻译、合成视频,也可以在后续翻译视频时复用,避免重复识别。

转录翻译的文档说明给我一下

“语音转录”功能就是把视频或音频中的人声听写成带时间轴的字幕文件(SRT),不做翻译、不做配音。以下是完整说明:

语音转录(ASR 转字幕)

用途

将视频/音频中的人物说话声自动转成字幕文件,便于做字幕、会议记录、采访整理等。

适用场景

  • 只需要字幕文件,不需要翻译或配音
  • 视频/音频中有人清晰说话,无人声则无法转录
  • 支持格式:视频 mp4/mov/avi/mkv/webm/mpeg/ogg/mts/ts/wmv/flv,音频 wav/mp3/m4a/flac/aac/wma/ogg

操作步骤

  1. 点击左侧功能面板“语音转录”
  2. 点击“选择音视频”,选择一个或多个音视频文件(可勾选“文件夹”批量处理)
  3. 选择“语音识别渠道”:

    • 推荐 faster-whisper(内置),速度和精度均衡
    • 中文视频可选 Qwen-ASR(内置)FunASR(内置),中文识别效果好
    • 日语视频可选 parakeet日语(内置)
    • 不确定可多看几个渠道,在线渠道需自备 API Key
  4. 选择“模型”:

    • tiny:最快但准确度低
    • base/small:平衡
    • medium:较好
    • large-v3-turbo:推荐,速度质量兼顾
    • large-v3:最佳效果,需 8GB+ 显存
  5. 选择“发音语言”:

    • 可选择具体语言,如“中文”“英语”
    • 不确定时可选择“自动检测”(仅语音转录面板支持自动检测)
  6. 设置“断句方式”:

    • 默认断句:保留模型原始时间轴,一般够用
    • LLM 重新断句:用 AI 修复错别字、重新断句,需在高级选项配置 DeepSeek/OpenAI,速度较慢
  7. 可选设置:

    • 降噪:去除背景噪声,适合嘈杂录音
    • 识别说话人:区分每句话由谁说的
    • 恢复标点/删除标点:按需选择
  8. 点击“开始”

输出结果

  • 生成带时间轴的标准 SRT 字幕文件,默认保存到软件目录下 output 文件夹
  • 可在“菜单→工具/选项→高级选项→独立功能输出目录”中修改输出位置

常见问题

  • 转录结果为空:视频中无人声、人声太小、语言选择错误或视频路径含中文/特殊符号,建议改到纯英文路径再试
  • 识别结果错别字较多:换用更合适的识别渠道/模型,或启用降噪/分离人声后再转录
  • 自动检测语言失败:某些模型对背景音敏感可能返回错误语言,可手动指定发音语言

注意事项

  • 有 NVIDIA 显卡并装好 CUDA 12.8+ 时,勾选“CUDA加速”可大幅提升转录速度
  • 本地模型第一次使用需在线下载,可能耗时较长
  • 转录时长与实际视频时长基本一致,等待时间主要取决于模型和硬件配置

注意:凡是“听得到人说话”的视频都能处理;“没人说话”或“人声听不清”的视频不能处理。
一、准备工作

  1. 确保软件能正常打开,双击 sp.exe,等待 5 秒到 2 分钟进入主界面。
  2. 建议把要处理的视频放到一个纯英文路径下,例如 D:\videos\3.mp4,不要放在带中文或特殊符号的路径中。
  3. 如果有 NVIDIA 显卡并已装好 CUDA 12.8+ 和 cuDNN 9.11+,在开始前先勾选主界面第 6 行的 CUDA加速,识别速度会快很多。

二、主界面逐行配置(翻译视频/音频)
第 1 行:选择要翻译的视频

  • 点击 选择视频或音频,选中要处理的视频文件。也可以按住 Ctrl 多选,或勾选 文件夹 批量处理整个文件夹。
    [图片]
  • 输出到:输出文件指定位置
    [图片]
    第 2 行:语音识别
  • 语音识别渠道:一般选 faster-whisper(内置) 即可。
    [图片]
  • 模型:选 large-v3-turbo(速度与质量兼顾),显存够大可用 large-v3(效果最好)。
    [图片]
  • 发音语言:必须手动选择原视频中人物说话的语言。例如视频里说的是英语,就选“英语”。
    [图片]
  • 断句方式一般保持默认即可。
    [图片]
    注:
    默认断句:大多数情况都用它,识别出来是什么样就用什么样,速度快,不改时间轴。
    LLM重新断句:识别出来的文字乱、断句差、有错别字时使用,让AI重新整理得更通顺,但会改时间轴,效果看AI本事。
    注意两点:配音角色选clone(克隆原音色)时,千万别用LLM重新断句,否则克隆出来声音是乱的。勾选了识别说话人时,LLM重新断句会自动禁用。一般用户就用默认断句,除非识别结果实在太差再考虑LLM。
    第 3 行:字幕翻译
  • 目标语言:选择你想翻译成的语言,比如“简体中文”。
    [图片]
  • 翻译渠道:推荐 DeepSeek(需先在菜单→翻译设置→DeepSeek中填写 API Key)
    [图片]

[图片]
[图片]

  • 如果是用 AI 翻译渠道,建议勾选 发送完整字幕,翻译更自然。
    第 4 行:配音
  • 配音渠道:一般选 Edge-TTS(免费) 即可,无需任何配置。
    [图片]
  • 配音角色:选一个发音人。比如目标语言是中文,可以选 Xiaoxi
    ......
    时可选“自动检测”(注意:仅语音转录面板有自动检测,视频翻译面板必须手动指定发音语言)
    [图片]
  • 可选:降噪、识别说话人、恢复标点
    [图片]
  • 点击“字幕翻译阶段”
    [图片]
    输出位置: 默认软件目录下 output 文件夹。
    [图片]
    4.srt:通常是“源语言字幕”,也就是原始视频/音频里人声识别出的字幕。
    4-ko.srt:是翻译成目标语言后的字幕

  1. 文字配音
    用途: 把纯文本或 SRT 字幕文件用 TTS 合成语音音频。
    使用场景: 文章朗读成音频、给已有字幕配声音。
    步骤:
  2. 点击左侧“文字配音”面板
  3. 导入 SRT 字幕文件,或直接粘贴/输入纯文本内容
  4. 选择配音渠道(推荐 Edge-TTS 免费)和目标语言
  5. 选择配音角色
  6. 可调节语速、音量、音调
  7. 点击“开始”
    注意: 导入 SRT 字幕时会按时间轴逐句配音;导入纯文本时会连续朗读,不按时间切分。导入的字幕必须符合标准 SRT 格式,否则时间轴会被当成文本读出来。

  1. 翻译字幕
    用途: 批量把 SRT 字幕文件从一种语言翻译成另一种语言。
    使用场景: 已有现成字幕,只需翻译。
    步骤:
  2. 点击左侧“翻译字幕”面板
  3. 点击选择 SRT 字幕文件(可多选)
  4. 选择源语言(字幕原本语言)和目标语言
  5. 选择翻译渠道(如 DeepSeek、Google、M2M100 等)
  6. 点击“开始”
    输出位置: 默认 output 目录。

  1. 角色配音
    用途: 导入一个 SRT 字幕文件,按每行字幕的说话人分配不同配音音色。
    使用场景: 多人对话视频,想让每个人用不同声音配音。
    步骤:
  2. 点击左侧“角色配音”面板
  3. 导入一个 SRT 字幕文件
  4. 软件列出角色列表,为每个角色指定配音渠道和音色
  5. 点击“开始”,逐行生成对应配音

  1. 媒体合并
    用途: 将已有的视频、音频、字幕三个文件合并为一个视频文件。
    使用场景: 已有无声视频 + 配音音频 + 字幕文件,需合成最终成品。
    步骤:
  2. 点击左侧“媒体合并”面板
  3. 分别选择视频文件、音频文件、(可选)字幕文件
  4. 选择字幕嵌入方式(硬字幕/软字幕)
  5. 点击“开始”

八、批量处理的重要限制
同一批视频必须使用同一套设置,尤其是“发音语言”只能统一指定一种。
例如: 韩文视频和英文视频不能混在同一批处理。需按语言分组:先处理韩文视频,再把发音语言改为英语,再处理英文视频。


九、单视频交互模式说明
一次只选一个视频时,会自动进入单视频交互编辑模式,在每个处理阶段弹出编辑窗口,可手动修改字幕错别字、分配角色、试听和重新配音。
如果不想弹出编辑窗口,可在“菜单→工具/选项→高级选项→单视频交互翻译暂停倒计时”改为 0。


十、输出位置速查
暂时无法在飞书文档外展示此内容


十一、二次语音识别与完成后关机补充说明
二次语音识别: 勾选后会在配音完成后对配音文件再次做语音识别,生成时间轴更精准的单字幕嵌入视频。前提:必须已选择配音角色(不能是 No),且字幕方式选了单字幕(非双语)。同时语音识别渠道必须支持识别目标语言,否则二次识别出的字幕会乱码或错误。
完成后关机: 勾选后,所有视频任务处理完毕后自动关闭电脑。适合夜间批量处理大量视频,第二天直接看结果。注意任务开始后不要再操作电脑,若中途出错退出则不会关机。


十二、常见问题

  • 视频里面的字幕超出来了怎么办?
    这是硬字幕过大或位置超出画面边界导致的。解决方法如下:
    方法一: 调整字幕字体大小和位置点击主界面“设置更多参数...” → “修改硬字幕样式”在样式编辑器中调小字体大小,并将字幕位置设为底部居中等安全区域,避免文字被画面边缘截断。
    方法二: 控制每行字幕字符数进入 菜单 → 工具/选项 → 高级选项 → 字幕声音画面对齐:将“中日韩字幕单行字符数”(中文/日文/韩文)或“其他语言字幕单行字符数”(英文等)调小一些,例如从默认值调为 15~20,这样长句会自动换行,避免一行文字过宽超出画面。
    方法三: 如果使用的是软字幕软字幕显示是否溢出由播放器的字幕样式决定,软件内无法直接控制;建议改选“嵌入硬字幕”并统一调整样式。若以上方法仍无法解决,请提供以下信息,我进一步判断:软件版本号(左上角 v4.09)出现超出的字幕语言和视频分辨率(如 1920x1080)是否使用双层字幕(双语)无法判断时可附上输出视频截图。

转录翻译
跟这里面的结合,写在语音转录上面

这是把「语音转录(转录翻译)」完整接入你的手册后的整合版,可直接使用。转录翻译的详细说明已放在「左侧各功能详细使用步骤」的第一节,且放在所有独立功能最前面。pyVideoTrans 完整使用手册一、适用范围凡是“听得到人说话”的视频都能处理;“没人说话”或“人声听不清”的视频不能处理。支持视频格式:mp4/mkv/avi/mov/webm/ts/flv/wmv 等;音频格式:wav/mp3/m4a/flac/aac/ogg 等。二、使用步骤(主界面翻译视频)1. 准备工作确保软件能正常打开,双击 sp.exe,等待 5 秒到 2 分钟进入主界面。建议把要处理的视频放到纯英文路径下,例如 D:\videos\3.mp4。有 NVIDIA 显卡并已装好 CUDA 12.8+ 和 cuDNN 9.11+ 时,勾选主界面第 6 行的 CUDA加速。2. 主界面逐行配置第 1 行:选择要翻译的视频点击“选择视频或音频”,选中视频文件。可 Ctrl 多选,或勾“文件夹”批量处理。“输出到”:可指定输出文件夹;点击取消可恢复默认位置。第 2 行:语音识别渠道:推荐 faster-whisper(内置)。模型:推荐 large-v3-turbo,显存充足可用 large-v3。发音语言:必须手动选择原视频中人物说话的语言,例如英语视频选“英语”。断句方式:保持默认断句即可,除非识别结果过差再尝试 LLM 重新断句。第 3 行:字幕翻译目标语言:选择想翻译成的语言,如“简体中文”。翻译渠道:推荐 DeepSeek(需先在菜单→翻译设置→DeepSeek 填写 API Key)或 Google(需代理),也可用 M2M100(内置)离线翻译。使用 AI 翻译渠道时建议勾选“发送完整字幕”。第 4 行:配音配音渠道:推荐 Edge-TTS(免费)。配音角色:选一个发音人,如 Xiaoxiao(女)/Yunyang(男)。若只换字幕不配音,配音角色选 No。第 5 行:同步对齐和字幕音频加速:建议勾选,配音比原视频长时自动加速匹配。视频慢速:一般不用勾,处理慢且文件体积增大。字幕方式:推荐“嵌入硬字幕”或“嵌入硬字幕(双)”,发微信/网页也一定显示。二次语音识别:需要对配音后字幕精确定位时勾选,需搭配配音角色,且识别渠道须支持目标语言。完成后关机:夜间批量处理时勾选,任务结束自动关机。第 6 行:开始点击“开始”执行。3. 更多参数(可选)点击“设置更多参数...”:视频有背景音乐/噪声 → 勾“分离人声背景声”+“嵌入背景”。噪声大 → 勾“降噪”。微调配音 → 调“配音语速/音量+/音调+”,默认 0。多人对话 → 勾“识别说话人”,填预知人数。修改硬字幕样式 → 调整字体、大小、位置等。4. 等待处理字幕显示在右侧,进度在底部进度条。完成后点击进度条区域可打开输出文件夹。5. 获取成品默认输出位置:原视频同级目录下 _video_out 文件夹内,例如 D:\videos\_video_out\3-mp4。三、左侧各功能详细使用步骤1. 语音转录(转录翻译)用途把视频/音频中的人声转成带时间轴的标准 SRT 字幕文件,不翻译、不配音。使用场景只需要字幕文件,如字幕组、会议记录、采访整理。步骤点击左侧“语音转录”面板。点击“选择音视频”,选择一个或多个音视频文件(可勾“文件夹”批量)。选择语音识别渠道:推荐 faster-whisper(内置);中文视频可选 Qwen-ASR、FunASR,日语视频可选 parakeet日语。选择模型:large-v3-turbo 推荐;large-v3 最佳但需 8GB+ 显存。选择发音语言:可手动指定;不确定时可选“自动检测”。设置断句方式:默认断句适用于大多数情况;LLM 重新断句需配置 DeepSeek/OpenAI,用于修复错别字、优化断句,但会改时间轴。可选设置:降噪、识别说话人、恢复标点/删除标点。点击“开始”。输出结果:生成的 SRT 字幕文件默认保存在软件目录下 output 文件夹,可在“菜单→工具/选项→高级选项→独立功能输出目录”修改。常见问题转录结果为空:可能视频无人声、人声太小、语言选择错误,或路径含中文/特殊符号,建议移入纯英文路径。识别错别字多:换用更合适的渠道/模型,或启用降噪/分离人声。注意:有 N 卡并装好 CUDA 时勾选“CUDA加速”可大幅提速;本地模型首次使用需下载。2. 文字配音用途:把纯文本或 SRT 字幕文件用 TTS 合成语音音频。步骤:导入 SRT 字幕或粘贴文本 → 选择配音渠道(Edge-TTS)和目标语言 → 选择配音角色 → 调节语速/音量/音调 → 点击“开始”。注意:导入 SRT 时按时间轴逐句配音;导入纯文本时连续朗读。3. 翻译字幕用途:批量把 SRT 字幕文件从一种语言翻译成另一种语言。步骤:选择 SRT 文件(可多选) → 选择源语言和目标语言 → 选择翻译渠道(DeepSeek、Google、M2M100 等) → 点击“开始”。4. 角色配音用途:导入一个 SRT 字幕文件,按每行字幕的说话人分配不同配音音色。步骤:导入 SRT → 软件列出角色列表 → 为每个角色指定配音渠道和音色 → 点击“开始”。5. 媒体合并用途:将已有的视频、音频、字幕合并为一个视频文件。步骤:分别选择视频、音频、(可选)字幕文件 → 选择字幕嵌入方式(硬/软) → 点击“开始”。四、批量处理限制同一批视频必须使用同一套设置,尤其是“发音语言”只能统一指定一种。韩文视频和英文视频不能混在同一批,需按语言分组处理。五、单视频交互模式一次只选一个视频时,自动进入单视频交互编辑模式,可手动修改字幕、分配角色、试听配音等。若不想弹出编辑窗口,可在“菜单→工具/选项→高级选项→单视频交互翻译暂停倒计时”改为 0。六、输出位置速查功能默认输出位置视频翻译所选视频同级 _video_out/{视频名}-{后缀} 内语音转录/文字配音/翻译字幕软件目录下 output 文件夹角色配音软件目录下 output 文件夹媒体合并所选输出目录七、二次语音识别与完成后关机二次语音识别:配音完成后再次识别,生成时间轴更精准的字幕。前提:已选配音角色,且字幕方式为单字幕;识别渠道须支持目标语言。完成后关机:所有任务完成后自动关机。任务开始后请勿操作电脑,中途出错不会关机。八、常见问题视频里的字幕超出画面怎么办?点击“设置更多参数...”→“修改硬字幕样式”,调小字号并设置合适位置。进入“菜单→工具/选项→高级选项→字幕声音画面对齐”,调小“中日韩字幕单行字符数”或“其他语言字幕单行字符数”(如 15~20),让长句自动换行。软字幕显示异常是播放器样式问题,建议改选“嵌入硬字幕”。若仍无法解决,请提供软件版本号、字幕语言、视频分辨率及截图。运行报错时,请前往软件安装目录下 logs/ 文件夹,复制最新日志文件底部约 30 行内容提交技术支持,并备注软件版本号。

写成文档的形式

pyVideoTrans 完整使用文档

一、适用范围

凡是“听得到人说话”的视频都能处理;“没人说话”或“人声听不清”的视频不能处理。

支持视频格式:mp4/mkv/avi/mov/webm/ts/flv/wmv 等;音频格式:wav/mp3/m4a/flac/aac/ogg 等。


二、视频翻译(主界面核心功能)

1. 准备工作

  • 确保软件能正常打开,双击 sp.exe,等待 5 秒到 2 分钟进入主界面。
  • 建议把要处理的视频放到纯英文路径下,例如 D:\videos\3.mp4,避免中文、空格、特殊符号导致的兼容问题。
  • 如果有 NVIDIA 显卡并已安装 CUDA 12.8+ 和 cuDNN 9.11+,勾选主界面第 6 行的 CUDA加速,识别速度会大幅提升。

2. 主界面逐行配置

第 1 行:选择要翻译的视频

  • 点击“选择视频或音频”,选中要处理的视频文件。
  • 按住 Ctrl 可多选,或勾选“文件夹”批量处理整个文件夹。
  • 点击“输出到”可单独指定输出目录;再点击“输出到”后取消选择,可恢复默认位置。

第 2 行:语音识别

  • 语音识别渠道:一般选 faster-whisper(内置) 即可。
  • 模型:选 large-v3-turbo(速度与质量兼顾),显存够大可用 large-v3(效果最好)。
  • 发音语言:必须手动选择原视频中人物说话的语言,例如英语视频选“英语”。
  • 断句方式:一般保持默认即可。

    • 默认断句:大多数情况都用它,速度快,不改时间轴。
    • LLM重新断句:识别结果乱、断句差、有错别字时使用,让 AI 重新整理更通顺,但会修改时间轴。

      • 注意:配音角色选 clone(克隆原音色)时,千万别用 LLM 重新断句,否则克隆声音会乱。
      • 勾选了“识别说话人”时,LLM 重新断句会自动禁用。

第 3 行:字幕翻译

  • 目标语言:选择想翻译成的语言,如“简体中文”。
  • 翻译渠道

    • 推荐 DeepSeek(需先在 菜单→翻译设置→DeepSeek 中填写 API Key)。
    • Google 翻译:免费,但国内需代理。
    • M2M100(内置):完全离线,第一次使用会下载模型。
  • 使用 AI 翻译渠道时建议勾选“发送完整字幕”,翻译更自然。

第 4 行:配音

  • 配音渠道:推荐 Edge-TTS(免费),无需配置。
  • 配音角色:选一个发音人。目标语言为中文时,可选 Xiaoxiao(Female/CN)Yunyang(Male/CN)
  • 若只换字幕不配音,配音角色选 No

第 5 行:同步对齐和字幕

  • 音频加速:建议勾选。当某句配音比原视频长时,自动加速配音以匹配画面。
  • 视频慢速:一般不用勾,勾了处理很慢且文件体积会明显增大。
  • 字幕方式

    • 嵌入硬字幕:字幕烧录在画面里,任何播放器/微信/网页都显示。
    • 嵌入软字幕:字幕是独立轨道,播放器可开关,但微信/网页可能无法显示。
    • 嵌入硬字幕(双):原语言 + 目标语言两行都烧录。
    • 嵌入软字幕(双):两行作为可选字幕轨道。
  • 二次语音识别:配音完成后对配音再次识别,生成时间轴更精准的字幕。需满足:已选配音角色(不能是 No),字幕方式为单字幕,且识别渠道支持目标语言。
  • 完成后关机:所有任务完成后自动关闭电脑,适合夜间批量处理。

第 6 行:开始

点击“开始”按钮执行。如有 N 卡并装好 CUDA,请勾选“CUDA加速”。

3. 更多参数(可选)

点击“设置更多参数...”:

  • 视频有背景音乐/噪声 → 勾选“分离人声背景声”+“嵌入背景”,识别更准且保留原背景音。
  • 噪声大 → 勾选“降噪”。
  • 微调配音 → 调“配音语速”、“音量+”、“音调+”,一般保持 0 即可。
  • 多人对话视频 → 勾选“识别说话人”,并填入预知人数(如视频有 3 人说话就填 3)。仅在单视频模式下有效。
  • 修改硬字幕样式 → 调整字体大小、颜色、位置等。

4. 等待处理

字幕显示在右侧预览区,进度在底部进度条。完成后点击进度条区域可打开输出文件夹。

5. 获取成品

默认输出位置为原视频同级目录下 _video_out 文件夹内,例如 D:\videos\_video_out\3-mp4


三、左侧各功能详细使用步骤

1. 语音转录(转录翻译)

用途:把视频/音频中的人声转成带时间轴的标准 SRT 字幕文件,不翻译、不配音。

使用场景:只需要字幕文件,如字幕组、会议记录、采访整理。

步骤

  1. 点击左侧“语音转录”面板。
  2. 点击“选择音视频”,选择一个或多个音视频文件(可勾选“文件夹”批量)。
  3. 选择语音识别渠道:

    • 通用推荐:faster-whisper(内置)
    • 中文视频:Qwen-ASR(内置)FunASR(内置)
    • 日语视频:parakeet日语(内置)
  4. 选择模型:large-v3-turbo 推荐;large-v3 效果最佳但需 8GB+ 显存。
  5. 选择发音语言:可手动指定;不确定时可选“自动检测”(仅语音转录面板支持自动检测)。
  6. 设置断句方式:默认断句;LLM 重新断句需配置 DeepSeek/OpenAI,用于修复错别字、优化断句,但会改时间轴。
  7. 可选设置:降噪、识别说话人、恢复标点/删除标点。
  8. 点击“开始”。

输出结果:生成的 SRT 字幕文件默认保存在软件目录下 output 文件夹,可在“菜单→工具/选项→高级选项→独立功能输出目录”中修改。

常见问题

  • 转录结果为空:可能视频无人声、人声太小、语言选择错误,或路径含中文/特殊符号,建议移到纯英文路径再试。
  • 识别错别字多:换更合适的渠道/模型,或启用降噪/分离人声。

注意:有 N 卡并装好 CUDA 时勾选“CUDA加速”可大幅提速;本地模型首次使用需下载。


2. 文字配音

用途:把纯文本或 SRT 字幕文件用 TTS 合成语音音频。

使用场景:文章朗读成音频、给已有字幕配声音。

步骤

  1. 点击左侧“文字配音”面板。
  2. 导入 SRT 字幕文件,或直接粘贴/输入纯文本内容。
  3. 选择配音渠道(推荐 Edge-TTS 免费)和目标语言。
  4. 选择配音角色。
  5. 可调节语速、音量、音调。
  6. 点击“开始”。

注意:导入 SRT 字幕时会按时间轴逐句配音;导入纯文本时会连续朗读,不按时间切分。导入的字幕必须符合标准 SRT 格式,否则时间轴会被当成文本读出来。


3. 翻译字幕

用途:批量把 SRT 字幕文件从一种语言翻译成另一种语言。

使用场景:已有现成字幕,只需翻译。

步骤

  1. 点击左侧“翻译字幕”面板。
  2. 点击选择 SRT 字幕文件(可多选)。
  3. 选择源语言(字幕原本语言)和目标语言。
  4. 选择翻译渠道(如 DeepSeek、Google、M2M100 等)。
  5. 点击“开始”。

输出位置:默认 output 目录。


4. 角色配音

用途:导入一个 SRT 字幕文件,按每行字幕的说话人分配不同配音音色。

使用场景:多人对话视频,想让每个人用不同声音配音。

步骤

  1. 点击左侧“角色配音”面板。
  2. 导入一个 SRT 字幕文件。
  3. 软件列出角色列表,为每个角色指定配音渠道和音色。
  4. 点击“开始”,逐行生成对应配音。

5. 媒体合并

用途:将已有的视频、音频、字幕三个文件合并为一个视频文件。

使用场景:已有无声视频 + 配音音频 + 字幕文件,需合成最终成品。

步骤

  1. 点击左侧“媒体合并”面板。
  2. 分别选择视频文件、音频文件、(可选)字幕文件。
  3. 选择字幕嵌入方式(硬字幕/软字幕)。
  4. 点击“开始”。

四、批量处理限制

同一批视频必须使用同一套设置,尤其是“发音语言”只能统一指定一种。例如:韩文视频和英文视频不能混在同一批处理。需按语言分组:先处理韩文视频,再把发音语言改为英语,再处理英文视频。


五、单视频交互模式

一次只选一个视频时,会自动进入单视频交互编辑模式,在每个处理阶段弹出编辑窗口,可手动修改字幕错别字、分配角色、试听和重新配音。若不想弹出编辑窗口,可在“菜单→工具/选项→高级选项→单视频交互翻译暂停倒计时”改为 0。


六、输出位置速查

功能默认输出位置
视频翻译所选视频同级 _video_out/{视频名}-{后缀}
语音转录 / 文字配音 / 翻译字幕软件目录下 output 文件夹
角色配音软件目录下 output 文件夹
媒体合并所选输出目录

七、二次语音识别与完成后关机

  • 二次语音识别:配音完成后对配音文件再次识别,生成时间轴更精准的单字幕嵌入视频。前提:必须已选配音角色(不能是 No),且字幕方式为单字幕(非双语);同时语音识别渠道必须支持识别目标语言,否则二次识别出的字幕会乱码或错误。
  • 完成后关机:所有视频任务处理完毕后自动关闭电脑。适合夜间批量处理。任务开始后请勿再操作电脑,若中途出错退出则不会关机。

八、常见问题

1. 视频里面的字幕超出画面怎么办?

  • 点击“设置更多参数...”→“修改硬字幕样式”,调小字号并设置合适位置。
  • 进入“菜单→工具/选项→高级选项→字幕声音画面对齐”,调小“中日韩字幕单行字符数”或“其他语言字幕单行字符数”(如 15~20),让长句自动换行。
  • 如果使用软字幕,显示溢出是播放器样式问题,建议改选“嵌入硬字幕”。
  • 若仍无法解决,请提供软件版本号、字幕语言、视频分辨率及截图。

2. 导出的视频文件体积过大怎么办?

  • 不要勾选“视频慢速”,只保留“音频加速”。
  • 进入“菜单→工具/选项→高级选项→视频输出控制”,将“视频输出质量控制”调大到 25~30。
  • 将该面板中“264/265编码”改为 265(HEVC),相同清晰度体积可减少约 30%~50%。
  • 勾选“仅输出mp4”,只保留最终视频文件。

3. 运行报错怎么办?

请前往软件安装目录下 logs/ 文件夹,复制最新的日志文件内容(底部约 30 行),提交给技术支持分析,并备注软件版本号(如 v4.09)。

语音转录和转录翻译的区别

语音转录和转录翻译的教程文档给我一下,要非常的仔细,完整

Post Your Reply
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Dondate via PayPal

Related resource