语音识别阶段出错[Huggingface_ASR(内置)] The expanded size of the tensor (3000) must match the existing size (8363) at non-singleton dimension 1. Target sizes: [128, 3000]. Tensor sizes: [128, 8363]:Traceback (most recent call last):
File "videotrans\process\stt_pipe.py", line 94, in pipe_asr
File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\automatic_speech_recognition.py", line 244, in call
return super().__call__(inputs, **kwargs)File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\base.py", line 1245, in call
outputs = list(final_iterator)File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\pt_utils.py", line 126, in next
item = next(self.iterator)File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\pt_utils.py", line 271, in next
processed = self.infer(next(self.iterator), **self.params)File "D:\win-pyvideotrans-v4.11\_internal\torch\utils\data\dataloader.py", line 733, in next
......
\transformers\pipelines\automatic_speech_recognition.py", line 244, in call
return super().__call__(inputs, **kwargs)File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\base.py", line 1245, in call
outputs = list(final_iterator)File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\pt_utils.py", line 126, in next
item = next(self.iterator)File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\pt_utils.py", line 271, in next
processed = self.infer(next(self.iterator), **self.params)File "D:\win-pyvideotrans-v4.11\_internal\torch\utils\data\dataloader.py", line 733, in next
data = self._next_data()File "D:\win-pyvideotrans-v4.11\_internal\torch\utils\data\dataloader.py", line 789, in _next_data
data = self._dataset_fetcher.fetch(index) # may raise StopIterationFile "D:\win-pyvideotrans-v4.11\_internal\torch\utils\data\_utils\fetch.py", line 43, in fetch
return self.collate_fn(data)File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\base.py", line 173, in inner
padded[key] = _pad(items, key, _padding_value, padding_side)File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\base.py", line 109, in _pad
tensor[i, : len(item[key][0])] = item[key][0]RuntimeError: The expanded size of the tensor (3000) must match the existing size (8363) at non-singleton dimension 1. Target sizes: [128, 3000]. Tensor sizes: [128, 8363]
[SpeechToText]语音转录: self.out_format='srt',self.copysrt_rawvideo=True,self.spk_insert=True
[TaskCfgSTT]
原始输入文件名: F:/超爱/URE-137CX/[email protected]4,
输出结果保存到文件夹: D:/BaiduNetdiskDownload/win-pyvideotrans-v4.11/output/recogn,
临时文件夹: D:/win-pyvideotrans-v4.11/tmp/2500/22ff35351a
已启用CUDA加速
未选 降噪
语音识别:Huggingface_ASR(内置), kotoba-tech/kotoba-whisper-v2.0 断句方式:默认断句
发音语言:ja
未选 降噪
=
system:Windows-10-10.0.19045-SP0
version:v4.11
frozen:True
language:zh
root_dir:D:/win-pyvideotrans-v4.11