#7339 用qwen3.5 tts 0.6b本地内置配音,RTX4050配音后是杂音,CPU配音正常。

2408**b195 Posted at: 1 hour ago

用qwen3.5 tts 0.6b本地内置配音,RTX4050配音后是杂音,CPU配音正常。

11 Replies

#1 DeepSeek reply at 1 hour ago

核心原因是 Qwen3-TTS 在 GPU/显存不足或数据类型不兼容时,声码器解码会产生杂音,而 CPU 模式走的是另一种数值路径所以正常。RTX 4050 笔记本版通常只有 6GB 显存,运行 Qwen3-TTS 容易触发显存溢出或精度问题,导致输出音频损坏。

按以下顺序排查:

  1. 降低显存占用与精度
    进入 菜单 → 工具 → 高级选项 → 语音识别参数,将 计算数据类型float32 改为 float16
    同时确保 GPU同时任务数 设为 1
  2. 缩短参考音频/字幕切片
    若使用 clone 角色,进入 高级选项 → 语音识别参数

    • 最短语音持续 保持在 3000 毫秒以上
    • 最长语音持续 设为 6~10
      参考音频不在 3-10 秒区间内极易产生杂音。
  3. 确认显存是否被占满
    配音时用 nvidia-smi 观察显存,若接近 6GB 上限,说明就是显存不足导致解码异常。
  4. 临时规避
    在 Qwen3-TTS 渠道设置中关闭 GPU 相关选项(若渠道支持),或改用 Edge-TTS 作为过渡验证。
  5. 若以上均无效
    若排除后仍报 CUDA error 类错误,请升级到最新 v4.12 版本,官方日志中已修复多起 GPU 相关 bug。

请查阅相关文档:

#2 2408**b195 reply at 1 hour ago

不是报错 而是生成杂音。本身就选的float16,区区0.6B不可能超过6G显存吧,我试听只占用不到2G显存

#3 DeepSeek reply at 1 hour ago

这是 Qwen3-TTS 在 GPU 下的已知采样/声码器兼容问题,非显存不足所致。可尝试以下处理:

  1. 切换 TTS 渠道的"运行设备"选项:进入 菜单 → TTS设置 → Qwen-TTS 相关配置,确认是否有强制设备的开关;若渠道无此设置,说明该版本 GPU 路径本身存在问题。
  2. 确认参考音频质量:即便显存占用低,若作为克隆参考的音频切片过短(<3s)、含噪声或首尾被硬切,GPU 解码路径放大的瑕疵会表现为杂音。进入 高级选项 → 语音识别参数,将:

    • 最短语音持续 设为 3500~4000 毫秒
    • 最长语音持续 设为 6~8 秒
  3. 关闭上下文感知:高级选项 → 语音识别参数 → 启用上下文感知 设为 False,避免 GPU 路径的数值累积异常。
  4. 检查 CUDA/cuDNN 版本:要求 CUDA 12.8 及以上、cuDNN 9.11 及以上。版本不匹配时 GPU 推理可能不报错但输出异常(静默数值错误)。用 nvcc -Vnvidia-smi 确认。
  5. 升级到最新补丁包:v4.12 更新日志含"修复其他已知bug",且历史上有 GPU 通道数值问题的补丁修复。请下载当前时刻的完整补丁包覆盖一次。
  6. 若仍无效:这是 GPU 路径下模型本身的输出异常,非软件配置能解。临时方案是在 Qwen3-TTS 中保留 CPU 运行(你已确认正常),或改用同样支持 clone 且 GPU 稳定的渠道,如 Confucius-TTS / OmniVoice / F5-TTS

如果上述排查后仍生成杂音,请提供安装目录下 logs/ 中最新日志底部约30行(含 GPU 相关信息),以及你使用的具体补丁包版本号,以便进一步分析。

请查阅相关文档:

#4 2408**b195 reply at 1 hour ago

Microsoft Windows [版本 10.0.26200.9445]
(c) Microsoft Corporation。保留所有权利。

C:\Users\Administrator>nvcc -V
nvcc: NVIDIA (R) Cuda compiler driver
Copyright (c) 2005-2025 NVIDIA Corporation
Built on Fri_Feb_21_20:42:46_Pacific_Standard_Time_2025
Cuda compilation tools, release 12.8, V12.8.93
Build cuda_12.8.r12.8/compiler.35583870_0

C:\Users\Administrator>nvidia-smi
Wed Sep 16 14:44:53 2026
+























-+
| NVIDIA-SMI 595.79 Driver Version: 595.79 CUDA Version: 13.2 |
+









-+





+




--+
| GPU Name Driver-Model | Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. |
| | | MIG M. |
|









=+





+




==|
| 0 NVIDIA GeForce RTX 4050 ... WDDM | 00000000:01:00.0 Off | N/A |
| N/A 40C P0 590W / 85W | 0MiB / 6141MiB | 0% Default |
| | | N/A |
+









-+





+




--+

+























-+
| Processes: |
| GPU GI CI PID Type Process name GPU Memory |
| ID ID Usage |
|





















=|
| No running processes found |
+





















-+
我用的自带角色没用克隆,版本也是4.12最新的,还是播放杂音。

#5 DeepSeek reply at 1 hour ago

从环境看 CUDA 12.8 正确、驱动 595.79、显存充足且未克隆——排除配置与音频切片问题。这是 Qwen3-TTS 内置渠道在 RTX 40 系 GPU 下声码器输出的数值异常,属于模型/推理框架层面的已知兼容问题,非软件设置可解。可尝试的规避方案:改用同类内置、GPU 路径稳定的克隆/配音渠道(你未用克隆,普通配音同样适用):Confucius-TTS(内置):支持中英日韩等14种语言,GPU 稳定OmniVoice-TTS:支持大量语言,优先使用 GPUChatterBox(内置):多语言,GPU 支持F5-TTS(内置):中英,GPU 支持若必须用 Qwen3-TTS 且仅 GPU 有杂音:在 TTS设置 中确认是否有"强制设备/CPU 推理"开关,强制走 CPU(你已验证 CPU 正常),代价是速度慢。RTX 40 系 + 该模型杂音属偶发兼容问题,如后续版本修复会体现在更新日志,可关注 v4.12 之后的补丁包。请查阅相关文档:Qwen-TTS(本地内置)全部配音渠道说明

#6 2408**b195 reply at 1 hour ago

你的意思是软件bug吗。或者是模型的问题吗,等待更新修复bug吗

#7 DeepSeek reply at 1 hour ago

二者皆有可能,但根据你已验证的信息(CUDA/cuDNN 正确、显存充足、float16、非克隆、CPU 正常),更可能是模型在 GPU 推理路径下的数值输出异常,而非软件配置层面的 bug。具体判断:模型层面:Qwen3-TTS 的声码器在特定 GPU 架构(如 RTX 40 系)或特定 CUDA/驱动版本组合下,可能产生数值溢出/精度丢失,导致输出杂音。这不是必然发生,而是环境组合相关,属于上游模型问题。软件层面:软件负责调度模型与拼接参数,若参数传递或数据类型转换存在缺陷,也会表现为杂音。但官方 v4.12 更新日志未提及 Qwen3-TTS 相关修复,无法确认。是否等待更新:无确切时间表。可行做法:暂用 CPU 运行 Qwen3-TTS(你已确认正常),或改用 Confucius-TTS / OmniVoice / F5-TTS 等其他内置渠道在 GPU 下工作。若希望推动修复,建议前往官方 GitHub 提 Issue,附上你的环境信息(RTX 4050、CUDA 12.8、cuDNN 版本、v4.12、float16、非克隆、CPU 正常而 GPU 杂音)与一段杂音输出样例,便于开发者复现。请查阅相关文档:Qwen-TTS(本地内置)

#8 2408**b195 reply at 1 hour ago

0.6b是本地最小最快的tts内置模型吧?其他占用高更慢

#9 DeepSeek reply at 1 hour ago

是,但你理解有偏差——Qwen3-TTS 0.6B 在 pyVideoTrans 的内置 TTS 里并不是最小/最快的一档,几种常见内置配音渠道对比如下(均支持 GPU,均为本地离线):

  • Qwen3-TTS 0.6B:参数小,但推理并非最轻量,仍需较大显存与较高计算量。
  • Piper(内置):轻量级,CPU 即可快速运行(不支持 GPU,本身就不需要 GPU),速度明显快于 Qwen3-TTS。
  • VITS(内置):中英,CPU 运行,体积小、速度快。
  • ZipVoice(内置):中英,轻量、支持克隆,速度较快。
  • F5-TTS(内置):中英等,参数较大,比 Qwen3-TTS 更重。
  • Confucius-TTS / OmniVoice-TTS / ChatterBox:多语言,资源占用不低于 Qwen3-TTS。

所以若你的诉求是"最小最快",应优先考虑 Piper 或 VITS(CPU 即可,无需纠结 GPU 杂音问题),但二者不支持克隆、语言覆盖有限。若需要 GPU + 多语言 + 较好音质,且想避开 Qwen3-TTS 的杂音,可试 ZipVoice(中英)或 Confucius-TTS。请查阅相关文档:全部配音渠道说明VITS/Piper-TTS(本地内置)

#10 2408**b195 reply at 1 hour ago

你的意思是piper用cpu比qwen3 0.6b的gpu模式还要快吗

#11 DeepSeek reply at 1 hour ago

不能这样一概而论,需要区分"模型推理速度"与"端到端配音速度",两者不等价,且强依赖语言/机器规格,无法给出确定结论。要点:Piper 是轻量 TTS,模型规模远小于 Qwen3-TTS 0.6B,单句推理通常更快,且它固定走 CPU,省去了 GPU 数据传输开销。但配音端到端速度还受 VAD 切片数、并发线程、是否克隆等影响,不是一个模型的推理耗时能代表全部。Qwen3-TTS 虽然参数不算大,但包含更复杂的声学/声码器结构,单句推理比 Piper 重,GPU 加速能缩小差距但不必然反超 Piper 的 CPU 表现。同样,Piper 的音质、语言覆盖、是否支持克隆,都弱于 Qwen3-TTS,速度不是唯一指标。结论:在同语言、同字幕量、同机器下,Piper(CPU) 有可能比 Qwen3-TTS 0.6B(GPU) 更快,但不保证;这需要你实测,无法在知识库层面给出确定答案。你的核心问题是 Qwen3-TTS GPU 杂音。若只是想要"能跑、不炸、够用",直接用 Piper/VITS 走 CPU 是最省事的路径;若坚持 GPU + 多语言 + 音质,建议换 ZipVoice 或 Confucius-TTS 验证。请查阅相关文档:全部配音渠道说明VITS/Piper-TTS(本地内置)

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource