#7021 配音阶段出错 [Higgs-audio-v3(内置)] Audio must be mono, but got 2,Traceback (most recent call last): File

104.28**1 Posted at: 1 hour ago

配音阶段出错 [Higgs-audio-v3(内置)] Audio must be mono, but got 2,Traceback (most recent call last):
File "videotrans\process\higgs_tts.py", line 94, in higgs_fun
File "D:\TTS\win-pyvideotrans-v4.11\_internal\torch\utils\_contextlib.py", line 116, in decorate_context

return func(*args, **kwargs)

File "D:\TTS\win-pyvideotrans-v4.11\models\modules\transformers_modules\models_hyphen__hyphen_multimodalart_hyphen__hyphen_higgs_hyphen_audio_hyphen_v3_hyphen_tts_hyphen_4b_hyphen_transformers\modeling_higgs_multimodal_qwen3.py", line 342, in generate_speech

codes_TN = self._encode_reference(reference_audio, sr)

File "D:\TTS\win-pyvideotrans-v4.11\_internal\torch\utils\_contextlib.py", line 116, in decorate_context

return func(*args, **kwargs)

File "D:\TTS\win-pyvideotrans-v4.11\models\modules\transformers_modules\models_hyphen__hyphen_multimodalart_hyphen__hyphen_higgs_hyphen_audio_hyphen_v3_hyphen_tts_hyphen_4b_hyphen_transformers\modeling_higgs_multimodal_qwen3.py", lin
......
ine 103, in run

File "videotrans\tts\_higgs.py", line 41, in _exec

File "videotrans\configure\base.py", line 270, in _new_process

videotrans.configure.excepts.VideoTransError: Audio must be mono, but got 2,Traceback (most recent call last):
File "videotrans\process\higgs_tts.py", line 94, in higgs_fun
File "D:\TTS\win-pyvideotrans-v4.11\_internal\torch\utils\_contextlib.py", line 116, in decorate_context

return func(*args, **kwargs)

File "D:\TTS\win-pyvideotrans-v4.11\models\modules\transformers_modules\models_hyphen__hyphen_multimodalart_hyphen__hyphen_higgs_hyphen_audio_hyphen_v3_hyphen_tts_hyphen_4b_hyphen_transformers\modeling_higgs_multimodal_qwen3.py", line 342, in generate_speech

codes_TN = self._encode_reference(reference_audio, sr)

File "D:\TTS\win-pyvideotrans-v4.11\_internal\torch\utils\_contextlib.py", line 116, in decorate_context

return func(*args, **kwargs)

File "D:\TTS\win-pyvideotrans-v4.11\models\modules\transformers_modules\models_hyphen__hyphen_multimodalart_hyphen__hyphen_higgs_hyphen_audio_hyphen_v3_hyphen_tts_hyphen_4b_hyphen_transformers\modeling_higgs_multimodal_qwen3.py", line 261, in _encode_reference

codes_BNT = codec.encode(wav).audio_codes

File "D:\TTS\win-pyvideotrans-v4.11\_internal\transformers\models\higgs_audio_v2_tokenizer\modeling_higgs_audio_v2_tokenizer.py", line 534, in encode

raise ValueError(f"Audio must be mono, but got {channels}")

ValueError: Audio must be mono, but got 2
[DubbingSrt]语音合成: self.out_ext='m4a',self.is_multi_role=False
[TaskCfgTTS]
原始输入文件名: C:/Users/Z420-Win-11/Documents/0049 配音 字幕/0049-de_副本.srt,
输出结果保存到文件夹: D:/TTS/win-pyvideotrans-v4.11/output/tts,
临时文件夹: D:/TTS/win-pyvideotrans-v4.11/tmp/10264/3caacfa7f7
已启用CUDA加速
配音渠道:Higgs-audio-v3(内置), 角色:yingyufanben.wav, 配音语言:de
音量:+0%, 语速:-5%, 已选 音频加速
代理地址:http://127.0.0.1:10808


=
system:Windows-10-10.0.26200-SP0
version:v4.11
frozen:True
language:zh
root_dir:D:/TTS/win-pyvideotrans-v4.11

3 Replies

#1 DeepSeek reply at 1 hour ago

问题核心:官方 Higgs-audio-v3 模型强制要求参考音频必须是单声道(mono),但您的参考音频 yingyufanben.wav 是双声道(channels=2),因此编码器直接抛错。

解决方法:

  1. 先将参考音频转换为单声道 WAV。可使用软件内置的 ffmpeg,在命令行执行:

    ffmpeg -i yingyufanben.wav -ac 1 yingyufanben_mono.wav

    或将文件拖入任意音频编辑软件,将声道数设为“单声道”后重新导出为 WAV。

  2. 确保转换后的音频满足最佳克隆条件:

    • 时长控制在 3〜10 秒
    • 只有单一人声,无背景噪声
    • 开头结尾无多余静音
  3. 然后将新文件复制到软件根目录的 f5-tts 文件夹,并在 菜单 -> TTS 设置 -> 设置参考音频 中更新对应文件名,例如填写 yingyufanben_mono.wav#音频中的台词
  4. 回到配音界面重新选择该音色,再执行即可。

注意:如果仍报错,请检查文件是否确实为 WAV 格式,且采样率建议为 16kHz 或更高。若您需要临时规避,可先换用 Edge-TTS 或其他不支持克隆的渠道完成当前任务。

请查阅相关文档:

#2 104.28**1 reply at 1 hour ago

ffmpeg : 无法将“ffmpeg”项识别为 cmdlet、函数、脚本文件或可运行程序的名称。请检查名称的拼写,如果包括路径,请确保路径
正确,然后再试一次。

#3 DeepSeek reply at 1 hour ago

已确认您的软件根目录为 D:/TTS/win-pyvideotrans-v4.11,FFmpeg 可执行文件位于该目录下的 ffmpeg 文件夹中。

请打开命令提示符(CMD),执行以下命令(注意路径中的双引号):

"D:\TTS\win-pyvideotrans-v4.11\ffmpeg\ffmpeg.exe" -i "C:\Users\Z420-Win-11\Documents\0049 配音 字幕\yingyufanben.wav" -ac 1 "D:\TTS\win-pyvideotrans-v4.11\f5-tts\yingyufanben_mono.wav"

执行完成后,将 yingyufanben_mono.wav 复制到软件根目录下的 f5-tts 文件夹,然后在 菜单 -> TTS 设置 -> 设置参考音频 中填写 yingyufanben_mono.wav#音频中的说话文本 保存。

回到配音界面重新选择该音色即可。若转换后仍报错,请检查转换后的文件大小是否正常,或尝试将采样率更改为 -ar 16000(在命令中加入 -ar 16000)。

请查阅相关文档:

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource