shape '[1, 4494, 1, 32, 2]' is invalid for input of size 262144,Traceback (most recent call last):
File "D:\workplace\pyvideotrans\videotrans\process\confucius_tts.py", line 75, in confucius_fun
audio = model.generate(it['text'],language ,wavfile, verbose=False)File "D:\workplace\pyvideotrans.venv\lib\site-packages\torch\utils\_contextlib.py", line 116, in decorate_context
return func(*args, **kwargs)File "D:\workplace\pyvideotrans\videotrans\confuciustts\cli\inference.py", line 332, in generate
audio = self._synth_segment(File "D:\workplace\pyvideotrans.venv\lib\site-packages\torch\utils\_contextlib.py", line 116, in decorate_context
return func(*args, **kwargs)File "D:\workplace\pyvideotrans\videotrans\confuciustts\cli\inference.py", line 246, in _synth_segment
mel = self.s2a_model.inference(File "D:\workplace\pyvideotrans.venv\lib\site-packages\torch\utils\_contextlib.py", line 116, in decorate_context
return func(*args, **kwar......
ciustts\flow\DiT\dit.py", line 214, in forward
h = block(h, t1, attn_mask, freqs_cis, skip_in)File "D:\workplace\pyvideotrans.venv\lib\site-packages\torch\nn\modules\module.py", line 1751, in _wrapped_call_impl
return self._call_impl(*args, **kwargs)File "D:\workplace\pyvideotrans.venv\lib\site-packages\torch\nn\modules\module.py", line 1762, in _call_impl
return forward_call(*args, **kwargs)File "D:\workplace\pyvideotrans\videotrans\confuciustts\flow\DiT\modules.py", line 226, in forward
h = x + self.attention(self.attention_norm(x, cond), attn_mask, freqs_cis)File "D:\workplace\pyvideotrans.venv\lib\site-packages\torch\nn\modules\module.py", line 1751, in _wrapped_call_impl
return self._call_impl(*args, **kwargs)File "D:\workplace\pyvideotrans.venv\lib\site-packages\torch\nn\modules\module.py", line 1762, in _call_impl
return forward_call(*args, **kwargs)File "D:\workplace\pyvideotrans\videotrans\confuciustts\flow\DiT\modules.py", line 175, in forward
q = apply_rotary_emb(q, freqs_cis)File "D:\workplace\pyvideotrans\videotrans\confuciustts\flow\DiT\modules.py", line 129, in apply_rotary_emb
freqs_cis = freqs_cis.view(1, xshaped.size(1), 1, xshaped.size(3), 2)RuntimeError: shape '[1, 4494, 1, 32, 2]' is invalid for input of size 262144
cfg=[TaskCfgVTT]当前工作模式: 翻译视频 单视频模式
原始输入文件名: D:/视频翻译测试文件夹/未翻译/盲潮预告片-01无字幕.mp4,
输出结果保存到文件夹: D:/视频翻译测试文件夹/盲潮预告片-01无字幕-mp4,
临时文件夹: D:/workplace/pyvideotrans/tmp/22384/4f9d4e0306
已选 清理已存在
已启用CUDA加速
未选 降噪
语音识别:faster-whisper(内置), large-v3-turbo, 发音语言: 英语, 断句方式:默认断句
翻译渠道:DeepSeek,原始语言:英语,目标语言:简体中文, 已选 发送完整字幕
配音渠道:Confucius4(内置), 角色:clone, 配音语言:简体中文, 未选 二次语音识别
音量:+0%, 语速:+0%, 已选 音频加速, 未选 视频慢速
字幕: 嵌入软字幕
代理地址:http://127.0.0.1:8800
video_duration_ms=126533
=
system:Windows-10-10.0.26100-SP0
version:v4.12
frozen:False
language:zh_CN
root_dir:D:/workplace/pyvideotrans
Python: 3.10.19 (main, Oct 31 2025, 22:56:24) [MSC v.1944 64 bit (AMD64)]