#6990 为什么没找到说明文档中推荐的英伟达开源日语模型

240e**fff0 Posted at: 20 days ago

为什么没找到说明文档中推荐的英伟达开源日语模型

39 Replies

#1 DeepSeek reply at 20 days ago

该模型名为「parakeet日语(内置)」,是NVIDIA开源的日语识别模型,已内置在语音识别渠道列表中。

如果你在渠道列表中找不到,最常见原因是软件版本过旧。请确认左上角版本号是否为 v4.11,如果不是,请前往官网下载最新完整版或补丁包覆盖更新。

如果版本已是 v4.11 仍未找到,可进入主界面「设置更多参数」,确认是否因隐藏了部分参数导致未显示。若仍无,请提供 logs/ 目录下最新的日志文件以便进一步分析。

请查阅相关文档:

#2 240e**fff0 reply at 20 days ago

语音识别中找到了 识别模型我要选哪个

#3 DeepSeek reply at 20 days ago

你找到的“英伟达开源日语模型”就是语音识别渠道中的“parakeet日语(内置)”,该渠道使用的是固定内置模型,无需额外选择识别模型。在“识别模型”下拉框中保持默认即可;如果下拉框中有多个选项,请选择名称中含“parakeet”或“parakeet-ja”的模型。

若你实际选择的是其他渠道(如Huggingface_ASR),则日语模型应选reazon-research/japanese-wav2vec2-large-rs35kh

如果仍不确定,请提供界面截图或 logs/ 目录下最新日志,以便进一步确认。

请查阅相关文档:

#4 240e**fff0 reply at 20 days ago

没有找到你说的名称中含“parakeet”或“parakeet-ja”的模型 选择框是灰色的不可选择的

#5 DeepSeek reply at 20 days ago

parakeet日语(内置) 渠道的识别模型是软件固定绑定的,不可手动切换,因此“识别模型”下拉框显示为灰色是正常现象。你只需保持默认即可,直接用它进行日语识别。

如果你希望选择其他日语模型,请切换到 Huggingface_ASR(内置) 渠道,然后在其“识别模型”下拉框中选择 reazon-research/japanese-wav2vec2-large-rs35kh

若仍然无法使用,请提供软件版本号及 logs/ 目录中最新的日志文件,以便进一步分析。

请查阅相关文档:

#6 240e**fff0 reply at 20 days ago

日语翻译出来的视频不断句怎么办

#7 DeepSeek reply at 20 days ago

翻译后的视频字幕不断句,通常与语音识别阶段的断句策略和翻译渠道的合并行为有关。可按以下步骤排查:

  1. 调整语音识别断句参数
    打开 菜单 → 工具 → 高级选项 → 语音识别参数,将「最长语音持续(秒)」设为 6~10,同时勾选「合并过短字幕到邻近」,并适当减小「静音分割持续毫秒」(如 500ms),这样识别出的字幕会按更短的语音片段切分。
  2. 启用 LLM 重新断句
    在高级选项的「通用设置」中,将「LLM重新断句所用AI渠道」配置为 DeepSeek 或 OpenAI-ChatGPT,然后在主界面语音识别行勾选「LLM重新断句」。此功能会利用大模型重新切分长文本,生成通顺的短句(注意:启用clone角色时禁用此功能)。
  3. 翻译渠道避免合并字幕
    若翻译渠道是 AI 大模型且勾选了「发送完整字幕」,AI 可能将相邻字幕合并成一行导致不断句。可在高级选项 → 字幕翻译调整中,将「AI翻译渠道每批字幕行数」设为 1,强制逐行翻译,避免合并。
  4. 字幕显示换行调整
    在高级选项 → 字幕声音画面对齐中,将「中日韩字幕单行字符数」设为较小值(如 20),字幕显示时会自动换行,阅读更清晰。

如果以上调整后仍无法解决,请提供软件版本号、使用的识别/翻译渠道及 logs/ 目录下最新日志,以便进一步分析。

请查阅相关文档:

#8 240e**fff0 reply at 20 days ago

我选择的是parakeet日语 但是识别模型却是large-v3-turbo 这对吗

#9 DeepSeek reply at 20 days ago

parakeet日语(内置) 渠道是固定绑定模型的,不会使用 large-v3-turbo。出现 large-v3-turbo 说明你当前语音识别渠道选择的不是 parakeet日语,而是 faster-whisper(内置) 或 openai-whisper(内置) 等其他渠道。请检查主界面“语音识别”行的渠道下拉框,确认是否误选了其他渠道。如果确定已选 parakeet日语,但“识别模型”下拉框仍显示 large-v3-turbo,请截图或提供 logs/ 目录下最新日志,以便进一步排查。请查阅相关文档:语音识别渠道说明与介绍最佳配置推荐

#10 240e**fff0 reply at 20 days ago

但是我选择的确实是parakeet日语

#11 DeepSeek reply at 20 days ago

parakeet日语(内置) 渠道的模型是固定绑定的,正常情况下“识别模型”下拉框应显示为灰色且不可选择,内容应为该渠道的固定模型名,不应是 large-v3-turbo。

这很可能是界面切换渠道后下拉框未及时刷新导致的显示异常。请按以下步骤排查:

  1. 在“语音识别”渠道下拉框中,先切换到其他渠道(如 faster-whisper),再重新切回 parakeet日语,观察“识别模型”框是否更新。
  2. 若仍显示 large-v3-turbo,请直接重启软件后重试。
  3. 确认软件版本是否为最新 v4.11,如果不是,请前往官网下载完整版或补丁包覆盖更新。

需要说明的是:即使界面显示异常,实际运行时 parakeet日语 渠道仍会调用其绑定的固定模型,不影响识别结果;这只是显示问题。如果刷新后依然如此,请提供界面截图或 logs/ 目录下最新日志,以便进一步定位。

请查阅相关文档:

#12 240e**fff0 reply at 20 days ago

image

#13 DeepSeek reply at 20 days ago

无法查看你的图片,请将截图中的关键文字用文字描述出来,例如:当前选中的“语音识别渠道”名称、“识别模型”下拉框显示的内容、下拉框是否灰色等。根据你之前的描述,parakeet日语(内置) 渠道的识别模型是固定绑定的,正常情况下“识别模型”框应为灰色且不可选,显示内容是固定的 parakeet 模型名,不应是 large-v3-turbo。如果界面显示 large-v3-turbo,很可能是软件版本过旧或界面切换后未刷新导致的显示异常。请先升级到最新版 v4.11,然后重启软件,在渠道下拉框中先切到其他渠道再切回 parakeet日语,观察是否更新。若仍显示 large-v3-turbo,你可以直接运行一个日语视频,并打开 logs/ 目录下的最新日志,查看是否有加载 parakeet 模型相关记录以确认实际运行是否正常。请提供日志内容以便进一步分析。请查阅相关文档:语音识别渠道说明与介绍下载软件

#14 240e**fff0 reply at 20 days ago

字幕和语音对不上怎么解决

#15 DeepSeek reply at 20 days ago

字幕和语音对不上,根本原因是翻译后句子的音节数量、语速与原始时间轴不一致,导致配音时长发生偏移。可按以下措施调整:

  1. 启用「配音加速」:主界面同步对齐行勾选「配音加速」,当配音比原时长长时自动加速,缩短音频以匹配字幕时间轴。
  2. 启用「视频慢速」:若配音仍过长,同时勾选「视频慢速」,放慢画面匹配声音,两者协同效果最佳。
  3. 开启「二次识别」:在配音完成后对配音重新进行语音识别,生成时间轴更精准的短字幕。注意:二次识别所用渠道需支持目标语言。
  4. 设置「配音语速」:在设置更多参数中,将「配音语速」设为 +10 或 +15,加快配音速度(尤其适用于中文译英文)。
  5. 调整「移除配音前后静音」:在高级选项 → 字幕配音调整中,勾选「移除配音前后静音缓冲」,可缩短配音时长,利于对齐。
  6. 控制「LLM重新断句」:启用 clone 角色时强烈不建议使用 LLM重新断句,否则会重新划分时间轴导致错位。
  7. 在单视频交互模式下,可在配音完成后弹出的校对窗口中,手动调整每句的开始/结束时间,并试听、重新配音。

若以上仍无法对齐,请提供视频翻译时的以下信息:发音语言、目标语言、配音渠道(是否使用 clone)、是否勾选了二次识别,以及 logs/ 目录下最新日志,以便进一步分析。

请查阅相关文档:

#16 240e**fff0 reply at 20 days ago

我翻译的是日语视频 没有启用配音

#17 DeepSeek reply at 20 days ago

未启用配音时,视频中将保留原始日语音频,字幕为翻译后的目标语言。理想情况下,字幕时间轴应严格对应原始语音,若出现错位,通常是以下原因导致。

关键排查步骤:

  1. 检查「同步对齐」行:确认「配音加速」和「视频慢速」均未勾选(未配音时勾选会作用于原始音频或视频,导致音画/字幕不同步)。
  2. 检查是否误勾选了「二次识别」:二次识别仅在配音后生效,未配音时应取消勾选。
  3. 确认「嵌入字幕类型」:若选择「嵌入软字幕」,部分播放器默认不显示字幕轨道,需在播放器中手动开启字幕;若想直接显示,请改用「嵌入硬字幕」。
  4. 检查「发音语言」是否设为日语(ja),若识别语言错误,识别出的时间轴会与语音不对应。
  5. 若在「单视频交互模式」中手动修改了字幕时间轴导致错位,请重新执行任务并避免手动调整。

若以上排查均无效,请提供以下信息以便进一步定位:

  • 软件版本号(左上角显示)
  • 语音识别渠道及模型名称
  • 翻译渠道
  • 是否在单视频交互模式中手动编辑过字幕
  • logs/ 目录下最新的日志文件(复制底部约30行)

请查阅相关文档:

#18 240e**fff0 reply at 20 days ago

配音加速和视频慢速都是配音才需要用的功能对吗 不需要配音不用勾选吗

#19 DeepSeek reply at 20 days ago

是的。配音加速和视频慢速用于在配音时长与原始字幕时长不一致时进行音画同步调整。如果没有启用配音,则不需要勾选这两项,否则可能会对原始音频或视频进行变速处理,反而导致字幕与声音不同步。只需确保「同步对齐」行中的「配音加速」和「视频慢速」均为未选中状态即可。请查阅相关文档:视频翻译中的配音、字幕、画面同步对齐 原理高级选项

#20 240e**446a reply at 20 days ago


==准备要嵌入的字幕:self.cfg.subtitle_type=1
self.cfg.target_sub='E:/feiniaoxiazai/_video_out/MIAE-327-mp4/zh-cn.srt'=
[DEBUG] 最终确定字幕嵌入类型:1 ,目标字幕语言:zho, 字幕文件:D:/GJ/SP/win-pyvideotrans-v4.11/tmp/6148/4582a8e122/end.srt

[DEBUG] [set_ass_font] 未修改硬字幕样式,跳过样式替换
[DEBUG] 返回缓存的编解码器 Windows-264: h264_nvenc
[DEBUG] 原始hw_type='h264_nvenc'
[DEBUG] 整理后hw_type='nvenc'
[DEBUG] [尝试硬件编解码执行命令]
-y -progress compose1788201139.4101446.txt -i novoice.mp4 -i will_embed.m4a -filter_complex [0:v]subtitles=filename='end.ass'[v_out] -map [v_out] -map 1:a -c:v h264_nvenc -c:a copy -cq 23 -preset p7 -movflags +faststart -shortest laste_target.mp4

[WARNING] taskkill returned: 3221225794, output:
Exception in thread Thread-19 (_handle_workers):
Traceback (most recent call last):
File "threading.py", line 1016, in _bootstrap_inner
File "threading.py", line 953, in run
File "mu
......
cessing\pool.py", line 340, in _maintain_pool
File "multiprocessing\pool.py", line 329, in _repopulate_pool_static
File "multiprocessing\process.py", line 121, in start
File "multiprocessing\context.py", line 336, in _Popen
File "multiprocessing\popen_spawn_win32.py", line 93, in init
File "multiprocessing\reduction.py", line 60, in dump
File "multiprocessing\synchronize.py", line 104, in getstate
File "multiprocessing\popen_spawn_win32.py", line 99, in duplicate_for_child
File "multiprocessing\reduction.py", line 79, in duplicate
PermissionError: [WinError 5] 拒绝访问。


Application started at 2026-09-01 03:03:11

1788202991:Loading resources...
1788202991:Loading main window...
1788202992:Initializing UI...
1788202992:SetupUI end...
1788202992:import recognition ...
1788202992:import tts ...
1788202992:import translate ...
1788202992:Get cache ...
1788202992:Set default value ...
1788202992:import voices list ...
1788202992:Set tts voice ...
[DEBUG] Version: v4.11, Frozen:True, OS: win32
上次缓存的角色:No,字幕嵌入类型:1,发音语言:日语,目标语言:简体中文,目标语言代码:zh-cn,模型:large-v3-turbo,TTS渠道[0]
1788202992:show main window ...
1788202992:Bind signal...
1788202992:set cursor...
1788202992:preload TTS win...
1788202992:preload STT win...
1788202992:preload translate srt win...
1788202992:end
[DEBUG] 平台: Windows。正在按优先级检测最佳的 'h264' 编码器: ['nvenc', 'qsv', 'amf']
[DEBUG] 正在测试编码器是否可用: h264_nvenc...
[DEBUG] 可用 Nvidia 显卡数: 1
[DEBUG] 找到 1 个 Nvidia GPUs, 耗时: 29s

[DEBUG] start 9 jobs
[DEBUG] 硬件编码器 'h264_nvenc' 可用。
[DEBUG] 已选择硬件编码器: h264_nvenc
[DEBUG] 最终确定使用的编码器: h264_nvenc
[DEBUG] 平台: Windows。正在按优先级检测最佳的 'hevc' 编码器: ['nvenc', 'qsv', 'amf']
[DEBUG] 正在测试编码器是否可用: hevc_nvenc...
[DEBUG] 硬件编码器 'hevc_nvenc' 可用。
[DEBUG] 已选择硬件编码器: hevc_nvenc
[DEBUG] 最终确定使用的编码器: hevc_nvenc
[DEBUG] app_cfg.proxy=''
[DEBUG] 无法连接 huggingface.co, 使用镜像替换: hf-mirror.com

#21 DeepSeek reply at 20 days ago

日志中的核心错误是 PermissionError: [WinError 5] 拒绝访问。,发生在子进程创建时,导致最终合成阶段的 h264_nvenc 硬件编码任务失败。这通常由权限不足或系统环境拦截引起。请按以下步骤逐一排查解决:

  1. 以管理员身份运行:关闭软件,右键 sp.exe → 选择“以管理员身份运行”。这能解除子进程访问某些系统资源的权限限制。
  2. 检查解压路径:确认软件目录为纯英文、数字、下划线组合,且位于非系统盘,例如 D:\pyVideoTrans。避免放置在 C:\Program Files、桌面、或含中文/空格/特殊符号的路径下。
  3. 关闭杀毒软件/防火墙:腾讯管家、360、Windows Defender 等可能拦截软件子进程的创建。请将整个软件目录加入白名单,或暂时关闭杀毒软件后重试。
  4. 强制使用软件编码:进入 菜单 → 工具 → 高级选项 → 视频输出控制,勾选 「强制软编码视频?」。此操作可绕过 h264_nvenc 硬件编码器,改用 libx264 软件编码,避免因硬件编码器导致的子进程冻结问题。勾选后重新执行任务。
  5. 清理临时文件并重启:删除软件根目录下 tmp/ 文件夹内的全部内容,然后重启软件。若任务中断导致日志中 taskkill 异常,此操作可清除残留进程锁。
  6. 检查显存与显卡驱动:若仍失败,确认 NVIDIA 驱动已更新至最新,且 CUDA 12.8+cuDNN 9.11+ 已正确配置。显存不足也可能引发底层进程崩溃。

如果以上步骤均无效,请提供 logs/ 目录下最新的日志文件(复制底部约30行),以便进一步定位。

请查阅相关文档:

#22 240e**446a reply at 20 days ago

现在的问题是字幕和声音不匹配 怎么解决 上面的代码会影响这个吗

#23 DeepSeek reply at 20 days ago

该错误(PermissionError: [WinError 5])会影响最终合成阶段,可能导致视频输出失败或生成异常文件;如果任务已成功输出,则错误被自动降级处理(如回退软编码),但它不会直接导致字幕与声音不匹配。字幕与语音不对齐,主要原因是翻译后的字幕时间轴与原始音频的语音节奏不一致。请按以下顺序排查:1. 确认任务是否完整成功:检查输出视频是否存在且能正常播放。如果日志该错误导致任务中断,请先按上一轮建议解决(以管理员身份运行、关闭杀毒、勾选「强制软编码视频?」),确保能生成视频。2. 核对发音语言设置:确保主界面「发音语言」为日语(ja)。若识别语言错误,识别出的时间轴与声音会对不上。3. 检查是否误勾选了「配音加速」或「视频慢速」:未配音时这两项均不要勾选,否则会变速原始音频/画面导致错位。4. 检查嵌入字幕类型:如果选「嵌入硬字幕」,字幕直接烧录画面,应严格按原音频时间轴;若选「嵌入软字幕」,请确认播放器已开启字幕轨,否则会显示不出字幕。5. 检查是否勾选了「二次识别」:未配音时应取消勾选。6. 确认是否在单视频交互模式中手动修改过字幕时间轴:若有修改,请重新执行任务并避免手动调整。7. 检查字幕文件是否正确:进入输出目录,打开 zh-cn.srt(目标字幕),对照原视频检查时间码是否偏移。若时间码整体偏移,可能是语音识别阶段识别结果错位,建议更换识别渠道(如 faster-whisper 的 large-v3-turbo)或调整「最长语音持续」参数。如果以上均正常,仍存在间歇性错位,请提供你使用的语音识别渠道、模型、翻译渠道,以及 logs/ 目录下最新的日志,以便进一步定位。请查阅相关文档:视频翻译中的配音、字幕、画面同步对齐 原理高级选项

#24 240e**446a reply at 20 days ago

我用的选项是(parakeet日语(内置)
识别模型
large-v3-turbo
LLM重新断句
翾译渠道
DeepSeek
发音语言
日语
目标语言
「简体中文
配音渠道
(Edge-TTS(免费)
配音角色
No
对齐控制只选择了对齐声音字幕 嵌入硬字幕 但是一直字幕和声音一直不匹配

#25 DeepSeek reply at 20 days ago

字幕与声音对不上的根本原因几乎可以确定是 LLM重新断句 导致的。LLM重新断句会将识别出的字幕发送给大模型,重新划分段落和切分长句,这会改变原本的字幕时间轴。而你未启用配音,视频中的声音是原始语音,时间轴被改写后,字幕自然就和声音错开了。

请按以下步骤调整:

  1. 关闭 LLM重新断句:在主界面语音识别行,取消勾选“LLM重新断句”。使用默认断句,保留识别模型返回的原始时间轴。
  2. 确认“对齐控制”设置:未配音时,请确保“配音加速”和“视频慢速”都没有勾选。你提到的“对齐声音字幕”如果不是这两个选项之一,也请检查是否勾选了任何会改变音画速度的选项。只需保留“嵌入硬字幕”即可。
  3. 检查发音语言:确保发音语言为“日语”,识别渠道为“parakeet日语(内置)”。注意:该渠道模型固定,不用理会“识别模型”下拉框的显示(界面显示large-v3-turbo可能是显示异常,不影响实际运行)。
  4. 翻译渠道:DeepSeek 翻译本身不会改变时间轴,但如果勾选了“发送完整字幕”,AI可能在上下文中合并相邻字幕行,导致返回字幕行数减少、时间轴错位。可在高级选项 → 字幕翻译调整中,将“AI翻译渠道每批字幕行数”设为 1,强制逐行翻译。

若以上调整后仍不对齐,请在单视频交互模式下手动查看生成的字幕文件(如 zh-cn.srt),检查时间码是否整体偏移。如果整体偏移,可能是语音识别阶段的问题,可尝试更换 faster-whisper 的 large-v3-turbo 渠道。

请查阅相关文档:

#26 240e**9019 reply at 19 days ago

字幕和声音还是对不上 并且这次字幕变成一大片 没有断句

#27 DeepSeek reply at 19 days ago

字幕变成一大片没有断句,同时与声音对不上,核心原因是翻译阶段或LLM重新断句阶段将多条字幕合并成了一条长文本,导致时间轴完全错位。你当前配置中,LLM重新断句和DeepSeek“发送完整字幕”是最大嫌疑。请严格按以下步骤操作并重新执行任务:1. 务必取消LLM重新断句:在主界面语音识别行,取消勾选“LLM重新断句”。2. 务必关闭“发送完整字幕”:进入 菜单→工具→高级选项→字幕翻译调整,取消勾选“发送完整字幕”,并将“AI翻译渠道每批字幕行数”设为 1。3. 勾选“清理已生成”:在主界面第一行,勾选“清理已生成”,然后重新选择一个视频执行,确保不使用旧缓存。4. 检查语音识别参数:进入 菜单→工具→高级选项→语音识别参数,将“最长语音持续(秒)”设为 6~10,“最短语音持续(毫秒)”设为 1000~3000,并勾选“合并过短字幕到邻近”。5. 确认实际使用的识别渠道:根据你之前日志显示“模型:large-v3-turbo”,这很可能是faster-whisper渠道的模型,而非parakeet。请回到主界面,确认“语音识别”行渠道下拉框实际显示的完整渠道名是“parakeet日语(内置)”还是“faster-whisper(内置)”。如果是后者,模型选择large-v3-turbo是正常的;如果是前者,识别模型框应固定且不可选。为避免渠道混乱导致的异常,建议暂时改用 faster-whisper(内置) 并选择 large-v3-turbo,这是日语识别的可靠方案。6. 不配音时不要勾选“配音加速”和“视频慢速”:如果“对齐控制”中的“对齐声音字幕”是这两个选项之一,请勿勾选,否则会变速声音导致偏移。7. 验证字幕文件:重新执行后,若仍不对齐,请打开输出文件夹,找到 zh-cn.srt 文件,检查其中的字幕是否按短句分行且每行都有时间码。如果该文件本身就是一大片,说明是翻译或断句问题;如果该文件正常,但硬字幕在视频中不匹配,则可能是合成阶段的问题。如果以上操作后仍无法解决,请提供以下信息:你最终确认的“语音识别渠道”名称(faster-whisper还是parakeet)以及 logs/ 目录下最新的日志文件(复制底部约30行),以便进一步定位。请查阅相关文档:高级选项视频翻译中的配音、字幕、画面同步对齐 原理常见问题FAQ

#28 240e**9019 reply at 19 days ago

是设置6~10其中的数字 还是直接填写6~10秒

#29 DeepSeek reply at 19 days ago

直接填写一个具体的数字,例如 8 或 9。不要填写“6~10秒”或“6-10”这类范围,软件要求该参数必须是纯数字,单位是秒。

推荐改为 8,既不会过长导致字幕合并,也不会过短产生碎片。请填写后重启软件重新执行任务。

请查阅相关文档:

#30 240e**9019 reply at 19 days ago

免费备选 Huggingface_ASR japanese-wav2vec2-large 日语专用 说明文档中推荐的这个渠道我找到选项了 但是模型没有找到

#31 DeepSeek reply at 19 days ago

说明文档中的“japanese-wav2vec2-large”在软件里对应的完整模型名是 reazon-research/japanese-wav2vec2-large-rs35kh。请你在 Huggingface_ASR(内置) 渠道的“识别模型”下拉框中查找这个名称,选择它即可。如果下拉框中找不到该模型,通常是以下原因:软件版本过旧:请确认左上角版本号为 v4.11,若不是请升级到最新版。模型未下载或下载不完整:该模型首次使用时需在线下载,如果网络问题导致失败,模型列表可能不显示或不完整。可手动下载模型文件并放置到指定目录:下载地址:https://huggingface.co/reazon-research/japanese-wav2vec2-large-rs35kh/tree/main存放位置:软件目录/models/models--reazon-research--japanese-wav2vec2-large-rs35kh下载完所有文件后重启软件即可。如果仍找不到,请提供 logs/ 目录下最新日志以便进一步排查。请查阅相关文档:Huggingface_ASR渠道手动下载模型

#32 240e**9019 reply at 19 days ago

没有你说的这个文件夹

#33 DeepSeek reply at 19 days ago

该文件夹不存在是因为模型尚未成功下载。软件只有在你首次选择该模型并触发下载时才会自动创建此文件夹。如果自动下载失败,文件夹就不会出现,需要手动创建并放入模型文件。

请按以下步骤操作:

  1. 在软件根目录下找到 models 文件夹(即 sp.exe 所在的文件夹内)。
  2. 手动新建一个文件夹,命名必须完全一致:
    models--reazon-research--japanese-wav2vec2-large-rs35kh
  3. 打开以下地址,下载该页面内的所有文件:
    https://huggingface.co/reazon-research/japanese-wav2vec2-large-rs35kh/tree/main
  4. 将下载的所有文件放入刚创建的文件夹内,注意不要重命名文件。
  5. 重启软件,重新选择 Huggingface_ASR 渠道,模型列表中就会出现该模型。

如果国内网络无法访问 Huggingface,软件通常会自动切换到镜像站。若仍失败,请检查网络代理或科学上网环境。完成后,请提供 logs/ 目录下最新日志,以便确认是否加载成功。

请查阅相关文档:

#34 188.253**2 reply at 19 days ago

如果不使用CUDA加速 那么显存只有8个G可以使用large-v3吗

#35 DeepSeek reply at 19 days ago

如果不使用 CUDA 加速,模型会完全在 CPU 上运行,不占用显卡显存。因此你的 8GB 显存不会成为瓶颈,可以正常加载 large-v3 模型。但需要明确:纯 CPU 运行会非常慢,处理一个长视频可能需要数小时甚至更久,请做好时间预期。如果你后续想启用 CUDA 加速,8GB 显存对 large-v3 来说刚好或偏紧,存在显存不足(CUDA out of memory)的风险。届时建议改用 large-v3-turbo(约需 6GB)或 medium(约需 5GB),并可在高级选项中调低 beam_size 和 best_of,关闭上下文感知,以降低显存占用。请查阅相关文档:Windows上配置CUDA和cuDNN高级选项

#36 240e**6396 reply at 19 days ago

我取消了发送完整字幕 现在翻译的特别慢 有什么办法

#37 DeepSeek reply at 19 days ago

翻译变慢是因为取消了“发送完整字幕”后,AI 翻译渠道变为逐行或小批次请求,每次大模型调用都有网络往返和推理延迟,字幕行数多时总耗时显著增加。可以按以下方式优化:增大每批提交的行数:进入 菜单→工具→高级选项→字幕翻译调整,将“AI翻译渠道每批字幕行数”从默认值调大,例如设为 20 或 50(注意不要超过模型上下文限制)。保持“翻译后暂停秒”为 0:同时确认该处未填写过大暂停值。尝试换用更快的翻译渠道:如果对翻译质量要求不是极高,可将翻译渠道切换为 Google(免费) 或 M2M100(内置) 本地翻译,这两者速度显著快于大模型。若必须用 DeepSeek:可以在高级选项中检查是否勾选了“AI翻译一次性翻译所有字幕行”,若已勾选,该功能会一次发送全部字幕,耗时更长且易超限,建议取消勾选,并适当增大“AI翻译渠道每批字幕行数”。注意避免与之前的“字幕合并”问题冲突:增大批次行数后,如果再次出现字幕合并或时间轴错位,可将批次行数调回较小的值,或重新启用“发送完整字幕”但配合支持长上下文的模型。如果你方便,请告知使用的翻译渠道以及字幕总行数,以便给出更具体的参数建议。请查阅相关文档:高级选项翻译渠道说明与介绍常见问题FAQ

#38 240e**6396 reply at 19 days ago

翻译渠道是deepseek 字幕总行数在五百左右

#39 DeepSeek reply at 19 days ago

根本原因是取消“发送完整字幕”后,软件默认按“每批字幕行数”逐段发送给 DeepSeek。你现在的“每批字幕行数”极大概率被设为了 1(为了防字幕合并),导致 500 行字幕需要发起约 500 次 API 请求。每次请求都包含网络往返和大模型推理延迟,时间自然成倍增加。

请按以下步骤调整,速度会有显著提升:

1. 调整翻译批次大小
进入 菜单 → 工具 → 高级选项 → 字幕翻译调整,将 “AI翻译渠道每批字幕行数” 从 1 调大到 20 或 30。这样 500 行字幕大概只需 15~25 次请求,总耗时急剧缩短。

2. 关闭 DeepSeek 思考模式
打开 菜单 → 翻译设置 → DeepSeek取消选中 Thinking(思考)复选框。思考模式会大幅增加推理时间,关闭后翻译速度至少快一半。

3. 确保无额外暂停
在高级选项的“字幕翻译调整”中,确认 “翻译后暂停秒” 为 0,避免每批之间强制等待。

4. 换用更快的 DeepSeek 模型
如果设置里可选,优先选择 deepseek-v4-flash,比 pro 版本快很多且翻译质量足以满足字幕需求。

注意: 若调大批次后,再次出现“字幕变成一大片”或合并的现象,说明 DeepSeek 在这 20~30 行里将前后短句拼接了。此时将“每批字幕行数”回调到 10 左右,就能在速度和断句之间取得平衡。如果对速度要求极高且可接受轻微断句变化,也可暂时改用 Google(免费) 翻译渠道,500 行秒级完成,但不建议对大段精确翻译使用。若仍然很慢或出现报错,请提供 logs/ 目录下最新的日志文件,以便进一步定位。请查阅相关文档:高级选项DeepSeek常见问题FAQ

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource