#7431 shape '[1, 4494, 1, 32, 2]' is invalid for input of size 262144,Traceback (most recent call last): File

5.8**5 Posted at: 1 hour ago

shape '[1, 4494, 1, 32, 2]' is invalid for input of size 262144,Traceback (most recent call last):
File "D:\workplace\pyvideotrans\videotrans\process\confucius_tts.py", line 75, in confucius_fun

audio = model.generate(it['text'],language ,wavfile, verbose=False)

File "D:\workplace\pyvideotrans.venv\lib\site-packages\torch\utils\_contextlib.py", line 116, in decorate_context

return func(*args, **kwargs)

File "D:\workplace\pyvideotrans\videotrans\confuciustts\cli\inference.py", line 332, in generate

audio = self._synth_segment(

File "D:\workplace\pyvideotrans.venv\lib\site-packages\torch\utils\_contextlib.py", line 116, in decorate_context

return func(*args, **kwargs)

File "D:\workplace\pyvideotrans\videotrans\confuciustts\cli\inference.py", line 246, in _synth_segment

mel = self.s2a_model.inference(

File "D:\workplace\pyvideotrans.venv\lib\site-packages\torch\utils\_contextlib.py", line 116, in decorate_context

return func(*args, **kwar

......
ciustts\flow\DiT\dit.py", line 214, in forward

h = block(h, t1, attn_mask, freqs_cis, skip_in)

File "D:\workplace\pyvideotrans.venv\lib\site-packages\torch\nn\modules\module.py", line 1751, in _wrapped_call_impl

return self._call_impl(*args, **kwargs)

File "D:\workplace\pyvideotrans.venv\lib\site-packages\torch\nn\modules\module.py", line 1762, in _call_impl

return forward_call(*args, **kwargs)

File "D:\workplace\pyvideotrans\videotrans\confuciustts\flow\DiT\modules.py", line 226, in forward

h = x + self.attention(self.attention_norm(x, cond), attn_mask, freqs_cis)

File "D:\workplace\pyvideotrans.venv\lib\site-packages\torch\nn\modules\module.py", line 1751, in _wrapped_call_impl

return self._call_impl(*args, **kwargs)

File "D:\workplace\pyvideotrans.venv\lib\site-packages\torch\nn\modules\module.py", line 1762, in _call_impl

return forward_call(*args, **kwargs)

File "D:\workplace\pyvideotrans\videotrans\confuciustts\flow\DiT\modules.py", line 175, in forward

q = apply_rotary_emb(q, freqs_cis)

File "D:\workplace\pyvideotrans\videotrans\confuciustts\flow\DiT\modules.py", line 129, in apply_rotary_emb

freqs_cis = freqs_cis.view(1, xshaped.size(1), 1, xshaped.size(3), 2)

RuntimeError: shape '[1, 4494, 1, 32, 2]' is invalid for input of size 262144

cfg=[TaskCfgVTT]当前工作模式: 翻译视频 单视频模式
原始输入文件名: D:/视频翻译测试文件夹/未翻译/盲潮预告片-01无字幕.mp4,
输出结果保存到文件夹: D:/视频翻译测试文件夹/盲潮预告片-01无字幕-mp4,
临时文件夹: D:/workplace/pyvideotrans/tmp/22384/4f9d4e0306
已选 清理已存在
已启用CUDA加速
未选 降噪
语音识别:faster-whisper(内置), large-v3-turbo, 发音语言: 英语, 断句方式:默认断句
翻译渠道:DeepSeek,原始语言:英语,目标语言:简体中文, 已选 发送完整字幕
配音渠道:Confucius4(内置), 角色:clone, 配音语言:简体中文, 未选 二次语音识别
音量:+0%, 语速:+0%, 已选 音频加速, 未选 视频慢速
字幕: 嵌入软字幕
代理地址:http://127.0.0.1:8800
video_duration_ms=126533


=
system:Windows-10-10.0.26100-SP0
version:v4.12
frozen:False
language:zh_CN
root_dir:D:/workplace/pyvideotrans
Python: 3.10.19 (main, Oct 31 2025, 22:56:24) [MSC v.1944 64 bit (AMD64)]

1 Replies

#1 DeepSeek reply at 1 hour ago

这是由于使用Confucius4(内置)TTS进行声音克隆(clone角色)时,参考音频切片时长过短或过长,导致模型内部计算出错(shape维度不匹配),属于切片与模型输入要求不符导致的报错。

解决方案(按顺序尝试):

  1. 调整语音识别切片参数(最关键)
    Confucius-TTS的克隆对参考音频时长有较严格的要求。请进入 菜单 -> 工具 -> 高级选项 -> 语音识别参数

    • 最长语音持续(秒) 设为 6 或更大(建议 6~10)
    • 最短语音持续(毫秒) 设为 3000 或更大(建议 3000~4000)
    • 保存后回到主界面,勾选 清理已生成,重新执行任务。
      这样能保证每段字幕对应的原音频切片时长满足克隆所需的 3~10 秒要求。
  2. 改用更稳健的克隆渠道
    若调整参数后仍报错,可更换为 OmniVoice-TTS(内置)Qwen3-TTS(内置) 渠道并选择 clone 角色,它们在切片适应性上更宽容。
  3. 开启人声背景分离提升克隆质量
    点击主界面 设置更多参数,勾选 分离人声背景声,可去除切片中的背景噪声,避免参考音频质量过差引发模型异常。
  4. 确认显存充足
    Confucius-TTS 属于较重的本地模型,若显存不足也可能在内部张量计算时形态异常。请降低 高级选项 -> 语音识别参数 -> 计算数据类型 或降低模型尺寸,并确保 GPU 同时任务数设为 1。

若以上均无效,请提供软件安装目录下的 logs/ 文件夹中对应日期的日志文件内容以便进一步分析。

请查阅相关文档:

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource