#7760 太慢了,翻译和配音

39.68**1 Posted at: 1 hour ago

太慢了,翻译和配音

1 Replies

#1 DeepSeek reply at 1 hour ago

翻译和配音阶段的耗时由所选的渠道类型和是否为本地模型决定,与语音识别阶段的 GPU 加速无关。

核心原因:字幕翻译和配音主要消耗网络请求(在线 API)或 CPU/GPU 推理(本地模型)。

若使用的是本地 TTS 模型(如 F5-TTS、Qwen3-TTS、ChatterBox 等),且未启用 CUDA 加速,速度会非常慢;若使用在线 API(Edge-TTS、DeepSeek 等),则取决于平台响应速度。

优化方向(按优先级):

  1. 翻译渠道

    • 若使用本地模型(M2M100 / Hy-MT2),速度慢是正常的,建议改用在线 API(DeepSeek、Google、微软等)。

    • 若用 AI 渠道,可增大 菜单 → 工具 → 高级选项 → 字幕翻译 → AI翻译渠道每批字幕行数(如设为 100),减少请求次数。

    • 取消勾选 AI翻译附带所有字幕做参考(该选项会大幅增加 token 和耗时)。

  2. 配音渠道

    • 若用的是本地内置 TTS(F5-TTS / Qwen3-TTS / ChatterBox / OmniVoice 等):

      • 确认 启用CUDA加速 已选中(需 N 卡 + CUDA 12.8 + cuDNN 9)。

      • 高级选项 → 通用设置 → GPU同时任务数 保持为 1。

      • Qwen3-TTS 未安装 flash-attn 时速度极慢,且该模块在 Windows 下兼容性差,属于已知限制。

    • 若用的是在线 Edge-TTS:

      • 高级选项 → 字幕配音调整 → EdgeTTS配音渠道配音并发数 调大(如 5-10);配音后暂停秒 调小。

      • 但并发过高易触发 403 限流,需权衡。

    • 若用的是其他云 API(豆包、Minimax、OpenAI 等),速度取决于服务商,可调大 并发配音线程数。

  3. 通用

    • 若为大批量任务,建议使用在线渠道(Edge-TTS + DeepSeek/Google),避免本地模型拖慢整体流水线。

请查阅相关文档:

如需进一步定位,请说明:当前使用的翻译渠道、配音渠道、是否有 N 卡、是否启用了 CUDA 加速。

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource