#6777 Qwen/Qwen3-TTS-12Hz-1.7B-Base 该模型生成速度非常慢 一直克隆不出来 请问作者大大有解决办法吗

166.88.**1 Posted at: 1 hour ago

image
Qwen/Qwen3-TTS-12Hz-1.7B-Base 该模型生成速度非常慢 一直克隆不出来 请问作者大大有解决办法吗

7 Replies

#1 DeepSeek reply at 1 hour ago

这是因为你使用的是更大的 Qwen3-TTS-12Hz-1.7B-Base 模型,而软件内置默认推荐的是 0.6B 版本,模型参数越多,生成越慢;若未正确启用 CUDA 或显存不足,克隆模式还会额外动态裁切参考音频,进一步放大耗时,导致长时间卡在“克隆”阶段。

可依次尝试以下方法:

  1. 改回默认 0.6B 模型:仅保留 软件目录/models/models--Qwen--Qwen3-TTS-12Hz-0.6B-Base 模型,删除或移走 1.7B 模型目录,避免优先加载大模型。
  2. 确认 CUDA 已启用:必须是 NVIDIA 显卡,并安装 CUDA 12.8+ 与 cuDNN 9.11+;在“高级选项 → 语音识别参数”中将“计算数据类型”设为 float16,可显著提升生成速度。
  3. 检查克隆参考音频设置:参考音频时长应控制在 3-10 秒;进入“高级选项 → 语音识别参数”,确保“最短语音持续毫秒”≥3000,并勾选“合并过短字幕到邻近”。
  4. 不要使用 LLM 重新断句:克隆模式下会重新切分时间轴,导致参考音频与说话时间错位,并增加额外处理时间。
  5. 若日志中出现 CUDA error: device-side assert triggered:优先检查显存是否充足、参考音频时长是否合规;仍无法解决请升级到 v4.05-0709 或更新版本。

如果以上调整后仍然无法克隆成功,请提供软件安装目录下 logs/ 文件夹内最新日志的末尾约 30 行,并告知软件左上角的版本号,以便进一步定位。

请查阅相关文档:

#2 166.88.**1 reply at 1 hour ago

image

#3 DeepSeek reply at 1 hour ago

无法读取您发送的图片内容,但根据您描述的 Qwen3-TTS-12Hz-1.7B-Base 克隆慢的问题,核心原因仍是:模型体积过大、未正确启用 CUDA,或克隆时参考音频时长/断句设置不合理。请优先检查以下几点:

  1. 改用默认 0.6B 模型:Qwen3-TTS 本地推荐版是 Qwen3-TTS-12Hz-0.6B-Base,1.7B 参数翻倍,生成速度会明显更慢。建议删除或移走 软件目录/models/models--Qwen--Qwen3-TTS-12Hz-1.7B-Base 文件夹,仅保留 0.6B 模型。
  2. 确认 CUDA 已启用:必须使用 NVIDIA 显卡,并配置 CUDA 12.8+ 和 cuDNN 9.11+;在“高级选项 → 语音识别参数”中将“计算数据类型”设为 float16。如果显存小于 8GB,建议放弃 1.7B,改用 0.6B。
  3. 检查克隆参考音频设置:“最短语音持续毫秒”需 ≥3000,并勾选“合并过短字幕到邻近”;参考音频过长或过短都会使克隆阶段卡住。
  4. 不要使用 LLM 重新断句:克隆模式下该功能会重新切分时间轴,导致参考音频错位,并显著增加处理时间。

由于无法看到图片中的具体报错,请您补充以下信息,以便进一步定位:

  • 软件左上角版本号;
  • logs/ 文件夹中最新日志文件末尾约 30 行报错信息(直接粘贴文字即可)。
#4 166.88.**1 reply at 1 hour ago

已经切换为0.6B模型 最大重试次数已超限,错误详情为: /api/
models/Qwen/Qwen3-TTS-12Hz-0.6B- Base/revision/main (Caused by SSLError (SSLEOFError (8, ISSL: Unexpected EOF WHILE READINGEOF发生,违反了协议规定 (ssl.c:1010)))) "),(请求ID:76f8868b-c816-4ba6-82e6-2af943dd790f)1)

#5 DeepSeek reply at 1 hour ago

报错原因:模型下载时与 huggingface.co 建立 SSL 连接失败,通常是被墙、代理不稳定或镜像站限流导致网络中断。模型本身没有损坏,只需手动下载后放到指定目录即可解决。

请按以下步骤操作:

  1. 手动下载 0.6B 模型:打开 https://huggingface.co/Qwen/Qwen3-TTS-12Hz-0.6B-Base/tree/main ,下载该页面内的所有文件(需科学上网;若无代理,可先尝试挂代理,或用下方备用提示)。
  2. 将下载的所有文件放入:软件目录/models/models--Qwen--Qwen3-TTS-12Hz-0.6B-Base/

    • 注意:如果浏览器把同名文件自动重命名(如 model(2).safetensors),必须改回原名;如果目录已存在旧文件,先删除后再放入新文件。
  3. 重新启动 sp.exe,再次运行配音任务,软件检测到本地模型后不会再联网下载。

补充说明:国内网络不稳定时,软件会自动尝试 hf-mirror.com 等镜像,但仍可能失败;手动下载最稳妥。若下载超大文件容易中断,建议使用支持断点续传的下载工具。

如果手动放置后仍报错,请提供软件安装目录下 logs/ 文件夹中最新日志末尾约 30 行,以及软件左上角版本号。

请查阅相关文档:

#6 166.88.**1 reply at 1 hour ago

0image
0.6B模型 克隆 不按照参考文本 经常自己多生成一段

#7 DeepSeek reply at 1 hour ago

无法读取您发送的图片内容,但根据您描述“0.6B 模型克隆不按照参考文本、经常自己多生成一段”的现象,核心原因通常是:克隆时参考音频质量不可控,或参考文本与参考音频内容不一致,导致模型无法准确循着参考文本生成。请按以下步骤排查和解决:

  1. 优先使用本地参考音频,而不是动态裁切原视频
    自动 clone 模式会根据每条字幕的起止时间,从原视频中动态裁切参考音频,这个片段可能时长不合适、有背景噪声、开头结尾中断一句话、中间有停顿反复,参考音频质量不可控,模型就会“自己多生成”。建议准备一段 3-10 秒的 WAV 音频,要求:清晰单一人声、无背景噪声、开头结尾无多余静音。将音频放到 软件目录/f5-tts/ 文件夹内,然后在 菜单 → TTS 设置 → 设置参考音频 中填写:

    文件名.wav#音频中的说话文本

    例如 myaudio1.wav#你说四大皆空,却为何紧闭双眼。保存后,在主界面配音角色下拉框中选择 myaudio1.wav

  2. 确保参考文本与实际音频内容完全一致
    参考文本必须和 wav 中朗读的内容逐字一致,不要多字、少字。若不一致,模型会无法对齐参考音频,容易出现多余生成。
  3. 勾选“分离人声背景声”
    主界面 设置更多参数 中勾选 分离人声背景声,再克隆,可显著提升参考音频纯净度和克隆效果。
  4. 调整克隆相关高级选项
    进入 菜单 → 工具 → 高级选项 → 语音识别参数

    • 最短语音持续毫秒:设为 3000-4000
    • 最长语音持续秒数:6-10
    • 勾选 合并过短字幕到邻近
    • 不要使用 LLM重新断句,它会导致时间轴被重排,影响参考音频截取和生成对齐。
  5. 若仍失败,需更换克隆渠道验证
    如果 Qwen3-TTS 0.6B 对某个参考音频始终生成不准确,可换用 OmniVoice、Confucius、F5-TTS、GPT-SoVITS 等渠道对比测试,不同模型对参考音频的跟随能力不同。

以上仍无法解决时,请提供软件 logs/ 文件夹中最新日志末尾约 30 行报错内容,以及软件左上角版本号,以便进一步定位。

请查阅相关文档:

Thinking...
Post Your Reply
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource