#7852 韩语内容的视频翻译高级选项里参数怎么设置,还要避免重复

103.151**9 Posted at: 1 hour ago

韩语内容的视频翻译高级选项里参数怎么设置,还要避免重复

11 Replies

#1 DeepSeek reply at 1 hour ago

针对韩语视频翻译,核心需调整语音识别参数(VAD断句)以避免字幕过碎或幻觉重复,同时通过LLM纠错修正识别错字。推荐配置如下:

1. 高级选项 - 语音识别参数(ASR Settings)

进入 菜单 -> 工具/选项 -> 高级选项 -> 语音识别参数:

  • 最长语音持续(秒) VAD:max speech duration(s):设为 6~8(韩语语速较快,太短易导致断句频繁)
  • 最短语音持续(毫秒) VAD:min speech duration(ms):设为 3000~4000(防止字幕太碎)
  • 静音分割持续(毫秒) VAD:Min silence duration for split(ms):设为 700~800(避免语气停顿被过度切分)
  • 计算数据类型 Compute data type:有N卡选 float16,无显卡选 int8
  • 识别准确度beam_size:设为 5(提高精度,显存不足时降为 1)
  • 识别准确度best_of:设为 5
  • 重复惩罚 repetition penalty:适当增大(如 1.1~1.2),减少重复输出
  • 文本压缩率 compression ratio threshold:适当减小(如 2.0~2.2),抑制重复幻觉
  • 采样温度 temperature:降低(如 0~0.2),减少随机重复

2. 高级选项 - LLM纠错(修正错别字与断句)

  • 进入 菜单 -> 工具/选项 -> 高级选项 -> 通用
  • LLM纠错所用AI渠道:选 DeepSeek(默认,效果和价格最优)
  • LLM纠错每批字幕行数:设为 20~50(越大断句效果越好,但受token限制;若报错则缩小到10)

3. 语音识别渠道选择建议

韩语推荐渠道:

  • faster-whisper(内置) + large-v3-turbo 模型(速度与质量兼顾)
  • 或 Nemotron-3.5-asr-0.6b(内置)(支持韩语)

4. 避免重复的额外措施

  • 若识别结果仍大量重复:选中 设置更多参数 -> 分离人声背景声,排除背景音乐干扰
  • 确认主界面 发音语言 明确选择 韩语(ko),不要选"自动检测"

请查阅相关文档:

#2 103.151**9 reply at 1 hour ago

翻译用gemini免费的 参数怎么设置

#3 DeepSeek reply at 1 hour ago

Gemini 免费 API 存在严格的请求频率和 token 限制,核心策略是降低每批字幕行数、增大请求间隔,避免触发限流。推荐配置如下:

  1. 高级选项 - 字幕翻译调整(Translation)
    进入 菜单 -> 工具/选项 -> 高级选项 -> 字幕翻译:

    • AI翻译渠道每批字幕行数:设为 10~20(免费版限制严格,设太大易报错;若报错继续降到 5)
    • 翻译后暂停秒:设为 5~10(关键参数,避免 429 限流)
    • 发送完整字幕:不建议勾选(免费版 token 受限,完整字幕易超限)
    • AI翻译附带所有字幕做参考:不勾选(会大幅增加 token 消耗,免费版极易失败)
    • AI翻译模型温度值:默认 0.1 即可
  2. 翻译渠道设置
    进入 菜单 -> 翻译设置 -> Gemini:

    • 填入 Google AI 平台申请的 API Key
    • 国内使用需配置代理(主界面右侧「网络代理」文本框填 http://127.0.0.1:端口号)
  3. 高并发/长视频建议
    免费 Gemini 有每分钟请求次数(RPM)和每日次数限制,若字幕行数很多(如几百行),建议:

    • 分批翻译,将长视频拆分为多个短视频
    • 或改用付费渠道(DeepSeek 价格极低,无频率困扰,质量也更好)

请查阅相关文档:

#4 103.151**9 reply at 1 hour ago

gemini的api在哪

#5 DeepSeek reply at 1 hour ago

Google Gemini API Key 需前往 Google AI 平台申请,官方地址:https://aistudio.google.com/app/apikey

申请步骤:

  1. 访问 https://aistudio.google.com/app/apikey
  2. 使用 Google 账号登录(国内需科学上网)
  3. 点击 Create API key(创建 API 密钥)
  4. 复制生成的密钥
  5. 打开软件 菜单 -> 翻译设置 -> Gemini,将密钥填入保存

注意事项:

  • 该密钥仅保存到本地,不会上传
  • 国内使用需配置代理(主界面右侧「网络代理」文本框填 http://127.0.0.1:端口号)
  • 免费版有严格的请求频率(RPM)和每日次数限制,长视频配音翻译建议降低每批字幕行数并增大暂停秒数,或改用 DeepSeek(价格极低、无频率困扰)

请查阅相关文档:

#6 103.151**8 reply at 1 hour ago

gaimage
该选哪个模型

#7 DeepSeek reply at 1 hour ago

从截图看,这是选择 TTS 配音渠道的模型选项。你需要的其实是翻译用的 Gemini API 设置,两者位置不同。先明确你当前要做什么:

如果你是在配置「翻译渠道」的 Gemini(字幕翻译)

Gemini 翻译渠道不需要手动选模型(软件内部已固定调用官方推荐的翻译模型),你只需在 菜单 -> 翻译设置 -> Gemini 中填入 API Key 即可。截图里若出现模型下拉,选择不带 transcribe 字样的普通大模型(如 gemini-2.5-flash 等通用文本模型)即可,不要选语音转写专用模型。

如果你是在配置「语音识别」的 Gemini(语音转录/识别)

Gemini 语音识别渠道固定使用 gemini-3.5-transcribe 模型,无需也无法自行选择其他模型。

如果你是在选 TTS 配音的 Gemini 渠道

选择通用文本模型用于语音合成即可。


请补充说明你截图的具体位置(是翻译设置、语音识别设置,还是配音渠道设置?),以便给出准确选择建议。如果是翻译用途,通常选响应快、便宜的 flash 系列即可。

#8 103.151**8 reply at 1 hour ago

翻译渠道

#9 DeepSeek reply at 1 hour ago

翻译用途,务必选 不带 transcribe 字样的通用文本模型,transcribe 是语音识别专用模型,选它会导致翻译报错或返回异常。选择建议:优先选 flash 系列(如 gemini-2.5-flash):速度快、成本低,且免费额度更宽松,适合批量字幕翻译若对翻译质量要求极高,可选 pro 系列(如 gemini-2.5-pro):质量更好,但速度慢、额度消耗大,免费版易限流切勿选任何名称含 transcribe 的模型(那是语音转写模型)配置提醒(结合你之前的免费版需求):每批字幕行数设为 10~20,翻译后暂停秒设为 5~10,否则免费版极易触发限流如果该下拉里模型名称你看不清,可把完整下拉列表截图发来,我帮你逐个判断。

#10 103.151**8 reply at 1 hour ago

image

#11 DeepSeek reply at 1 hour ago

这是文字配音(TTS)渠道的模型设置,不是翻译渠道,你可能点错了位置。翻译渠道的 Gemini 设置入口在 菜单 -> 翻译设置 -> Gemini,那里通常只需填 API Key,无需选模型。不过针对你截图中的 TTS 模型选择:这里选哪个模型取决于你的需求:追求速度快、免费额度宽松:选 flash 系列(如 gemini-2.5-flash)追求配音音质高:选 pro 系列(如 gemini-2.5-pro),但速度慢、额度消耗大,免费版易限流切勿选含 transcribe 字样的模型(那是语音识别专用)如果你本意是设置「字幕翻译」的 Gemini,请返回主界面:在翻译字幕行(第3行)的翻译渠道下拉中选 Gemini,然后点击 菜单 -> 翻译设置 -> Gemini 填入 API Key 即可,翻译不在这里选模型。请确认你当前截图是在哪个界面的下拉:是主界面的配音渠道?还是独立的文字配音功能?

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource