#6894 语音识别阶段出错[Huggingface_ASR(内置)] The expanded size of the tensor (5477) must match the existing size (3000) at non-singleto

171.91.**5 Posted at: 2 hours ago

语音识别阶段出错[Huggingface_ASR(内置)] The expanded size of the tensor (5477) must match the existing size (3000) at non-singleton dimension 1. Target sizes: [128, 5477]. Tensor sizes: [128, 3000]:Traceback (most recent call last):
File "videotrans\process\stt_pipe.py", line 94, in pipe_asr
File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\automatic_speech_recognition.py", line 244, in call

return super().__call__(inputs, **kwargs)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\base.py", line 1245, in call

outputs = list(final_iterator)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\pt_utils.py", line 126, in next

item = next(self.iterator)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\pt_utils.py", line 271, in next

processed = self.infer(next(self.iterator), **self.params)

File "D:\win-pyvideotrans-v4.11\_internal\torch\utils\data\dataloader.py", line 733, in next
......
ternal\transformers\pipelines\automatic_speech_recognition.py", line 244, in call

return super().__call__(inputs, **kwargs)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\base.py", line 1245, in call

outputs = list(final_iterator)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\pt_utils.py", line 126, in next

item = next(self.iterator)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\pt_utils.py", line 271, in next

processed = self.infer(next(self.iterator), **self.params)

File "D:\win-pyvideotrans-v4.11\_internal\torch\utils\data\dataloader.py", line 733, in next

data = self._next_data()

File "D:\win-pyvideotrans-v4.11\_internal\torch\utils\data\dataloader.py", line 789, in _next_data

data = self._dataset_fetcher.fetch(index)  # may raise StopIteration

File "D:\win-pyvideotrans-v4.11\_internal\torch\utils\data\_utils\fetch.py", line 43, in fetch

return self.collate_fn(data)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\base.py", line 173, in inner

padded[key] = _pad(items, key, _padding_value, padding_side)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\base.py", line 109, in _pad

tensor[i, : len(item[key][0])] = item[key][0]

RuntimeError: The expanded size of the tensor (5477) must match the existing size (3000) at non-singleton dimension 1. Target sizes: [128, 5477]. Tensor sizes: [128, 3000]
[SpeechToText]语音转录: self.out_format='srt',self.copysrt_rawvideo=True,self.spk_insert=False
[TaskCfgSTT]
原始输入文件名: C:/Users/1/Desktop/AARM-359J.mp4,
输出结果保存到文件夹: D:/BaiduNetdiskDownload/win-pyvideotrans-v4.11/output/recogn,
临时文件夹: D:/win-pyvideotrans-v4.11/tmp/4244/2a28bce2b8
已启用CUDA加速
未选 降噪
语音识别:Huggingface_ASR(内置), kotoba-tech/kotoba-whisper-v2.0 断句方式:默认断句
发音语言:ja
未选 降噪


=
system:Windows-10-10.0.19045-SP0
version:v4.11
frozen:True
language:zh
root_dir:D:/win-pyvideotrans-v4.11

13 Replies

#1 DeepSeek reply at 2 hours ago

这是由于 Huggingface_ASR 渠道的 kotoba-tech/kotoba-whisper-v2.0 模型在处理音频切片时出现张量尺寸不匹配,属于模型兼容性或模型文件不完整导致的内部错误。

请按以下顺序排查处理:

  1. 重新下载/校验模型文件
    先删除本地缓存中不完整的模型目录,再让软件重新下载。模型存放位置为:
    软件目录/models/models--kotoba-tech--kotoba-whisper-v2.0
    将其整个文件夹删除后,重新执行任务,软件会自动从 Huggingface 或镜像站重新拉取模型。
  2. 更换为更稳定的识别渠道
    建议改用默认推荐渠道 faster-whisper(内置),模型选 large-v3-turbolarge-v3,发音语言设为日语。该渠道兼容性好、速度快、质量高。
  3. 调整语音识别参数(可选)
    如果仍需使用该模型,可在 菜单 → 工具 → 高级选项 → 语音识别参数 中进行如下调整:

    • 勾选 Whisper预分割音频
    • 最长语音持续(秒) 设为 10
    • 最短语音持续(毫秒) 设为 3000
      这有助于避免过长音频切片导致的维度冲突。
  4. 尝试临时关闭 CUDA 加速
    在确认不是显存问题后,可取消主界面 CUDA加速 复选框,改用 CPU 运行以验证是否为 CUDA 兼容性问题。若 CPU 下正常,则说明是模型在 GPU 环境下存在的缺陷。

若以上操作后仍报同样错误,请确认你使用的模型列表是否包含该模型,并检查 logs/ 目录下最新日志,索要完整日志进一步分析。

请查阅相关文档:

#2 182.147.**2 reply at 2 hours ago

语音识别阶段出错[Huggingface_ASR(内置)] The expanded size of the tensor (5477) must match the existing size (3000) at non-singleton dimension 1. Target sizes: [128, 5477]. Tensor sizes: [128, 3000]:Traceback (most recent call last):
File "videotrans\process\stt_pipe.py", line 94, in pipe_asr
File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\automatic_speech_recognition.py", line 244, in call

return super().__call__(inputs, **kwargs)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\base.py", line 1245, in call

outputs = list(final_iterator)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\pt_utils.py", line 126, in next

item = next(self.iterator)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\pt_utils.py", line 271, in next

processed = self.infer(next(self.iterator), **self.params)

File "D:\win-pyvideotrans-v4.11\_internal\torch\utils\data\dataloader.py", line 733, in next
......
ost recent call last):
File "videotrans\process\stt_pipe.py", line 94, in pipe_asr
File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\automatic_speech_recognition.py", line 244, in call

return super().__call__(inputs, **kwargs)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\base.py", line 1245, in call

outputs = list(final_iterator)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\pt_utils.py", line 126, in next

item = next(self.iterator)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\pt_utils.py", line 271, in next

processed = self.infer(next(self.iterator), **self.params)

File "D:\win-pyvideotrans-v4.11\_internal\torch\utils\data\dataloader.py", line 733, in next

data = self._next_data()

File "D:\win-pyvideotrans-v4.11\_internal\torch\utils\data\dataloader.py", line 789, in _next_data

data = self._dataset_fetcher.fetch(index)  # may raise StopIteration

File "D:\win-pyvideotrans-v4.11\_internal\torch\utils\data\_utils\fetch.py", line 43, in fetch

return self.collate_fn(data)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\base.py", line 173, in inner

padded[key] = _pad(items, key, _padding_value, padding_side)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\base.py", line 109, in _pad

tensor[i, : len(item[key][0])] = item[key][0]

RuntimeError: The expanded size of the tensor (5477) must match the existing size (3000) at non-singleton dimension 1. Target sizes: [128, 5477]. Tensor sizes: [128, 3000]
[SpeechToText]语音转录: self.out_format='srt',self.copysrt_rawvideo=True,self.spk_insert=False
[TaskCfgSTT]
原始输入文件名: C:/Users/1/Desktop/AARM-359J.mp4,
输出结果保存到文件夹: D:/BaiduNetdisk


/win-pyvideotrans-v4.11/output/recogn,
临时文件夹: D:/win-pyvideotrans-v4.11/tmp/4244/2a28bce2b8
已启用CUDA加速
未选 降噪
语音识别:Huggingface_ASR(内置), kotoba-tech/kotoba-whisper-v2.0 断句方式:默认断句
发音语言:ja
未选 降噪

#3 DeepSeek reply at 2 hours ago

该错误是 Huggingface_ASR 渠道中 kotoba-tech/kotoba-whisper-v2.0 模型在音频切片拼接(padding)时发生的张量尺寸冲突,属于该模型与当前 Transformers 版本兼容性问题或模型文件不完整导致。

请按以下顺序处理:

  1. 删除模型并重新下载
    找到软件目录下的 models/models--kotoba-tech--kotoba-whisper-v2.0 文件夹,将其整个删除,然后重新执行任务让软件自动下载。若自动下载失败,可手动前往 模型下载地址 下载所有文件覆盖到该目录。
  2. 替换为更稳定的日语识别渠道
    该模型在 v4.11 中兼容性较差,建议改用以下渠道替代:

    • parakeet日语(内置):仅支持日语,效果好
    • openai-whisper(内置) 模型选 large-v3:通用识别质量最高
    • faster-whisper(内置) 模型选 large-v3-turbo:速度与质量兼顾
  3. 调整语音识别参数(如果继续使用该模型)
    菜单 → 工具 → 高级选项 → 语音识别参数 中:

    • 勾选 Whisper预分割音频
    • 最长语音持续(秒) 设为 10
    • 最短语音持续(毫秒) 设为 3000
      这能避免过长的音频切片进入模型而触发 padding 冲突。
  4. 临时关闭 CUDA 加速
    取消主界面的 CUDA加速 复选框,改为 CPU 运行验证是否为 GPU 环境下的异常。若 CPU 下正常,说明该模型在 CUDA 模式下存在缺陷,需要更换渠道。

若上述操作均无效,请提供 logs/ 文件夹中最新的完整日志,以便进一步定位。

请查阅相关文档:

#4 182.147.**2 reply at 2 hours ago

image
占用这么多内存啊

#5 DeepSeek reply at 2 hours ago

本地AI模型(如 kotoba-whisper-v2.0)运行时需要将模型权重加载到内存/显存中,占用数GB是正常现象。尤其是启用了CUDA加速时,显存和内存会同时被占用。

如果内存占用过高导致系统卡顿或崩溃,可采取以下措施降低资源消耗:

  1. 更换更小的模型:在语音识别渠道中,改用 faster-whisper(内置)tinybasesmall 模型(显存需求约1~2GB),日语识别也支持。
  2. 调整计算数据类型:进入 菜单 → 工具 → 高级选项 → 语音识别参数,将 计算数据类型 改为 int8(最省资源)或 float16(适配GPU)。
  3. 降低识别精度:将 beam_sizebest_of 都设为 1,可显著减少显存占用。
  4. 关闭上下文感知:取消勾选 启用上下文感知
  5. 限制并发任务数:在 高级选项 → 通用设置 中,将 GPU同时任务数 设为 1CPU同时任务数 设为 2~4(不要超过物理核数)。
  6. 关闭CUDA加速(临时验证):取消主界面的 CUDA加速 复选框,改用CPU运行,观察内存占用是否下降。若CPU下正常,说明是GPU环境下的资源问题。

若内存占用依然过高且导致系统不稳定,建议直接更换为 faster-whisper(内置) 渠道,选择 large-v3-turbo 模型,该渠道在速度、精度和资源占用方面更均衡。

#6 182.147.**2 reply at 2 hours ago

2060S适合什么精度

#7 DeepSeek reply at 2 hours ago

RTX 2060 Super 显存为 8GB,推荐使用 float16 精度。float16 专为 GPU 加速优化,显存占用约为 float32 的一半,速度较快,精度损失极小,适合 2060S 这样的中端显卡。若运行 large-v3 等大模型时显存不足,可进一步降为 int8,但精度会略有下降。

设置位置:菜单 → 工具 → 高级选项 → 语音识别参数 → 计算数据类型,选择 float16 即可。此外建议同时将 beam_sizebest_of 设为 1,以降低显存压力。

#8 182.147.**2 reply at 2 hours ago

image
一直卡在37这一条

#9 DeepSeek reply at 2 hours ago

卡在37条大概率是语音识别阶段某个音频切片过长或模型推理卡死,常见于 Huggingface_ASR 渠道的 kotoba 模型在 CUDA 或 CPU 模式下出现兼容性异常。建议立即终止任务并按以下步骤处理:切换到 faster-whisper(内置) 渠道模型选 large-v3-turbo,发音语言设为 ja。该渠道稳定且对日语识别效果好。若仍想用 Huggingface_ASR,请先在 菜单 → 工具 → 高级选项 → 语音识别参数 中勾选 Whisper预分割音频,并将 最长语音持续(秒) 设为 10、最短语音持续(毫秒) 设为 3000,可避免过长切片导致的卡死。关闭 CUDA 加速临时验证:取消主界面的 CUDA加速 复选框,改用 CPU 运行。若 CPU 下不卡,则说明是 GPU 兼容性问题。若卡点出现在单视频交互模式的编辑窗口,请检查是否弹出了字幕编辑界面需要手动操作,或确认“单视频交互模式暂停时间”是否设为了等待状态。若以上操作无效,请提供软件安装目录下 logs/ 文件夹中最新的日志文件(复制底部约30行报错信息),以便进一步分析。

#10 182.147.**2 reply at 1 hour ago

RTX 2060 Super 显存为 8GB,推荐使用 float16 精度 16精度是好一点吗 跟8对比

#11 DeepSeek reply at 1 hour ago

是的,float16(16位浮点)精度比 int8(8位整数)更好,但显存占用和计算资源也更高。

两者对比:

类型精度显存占用速度适用场景
float16约 float32 的一半快(GPU 加速)显存充足时优先使用,音质/字幕识别准确度损失极小
int8较低最低(约为 float32 的 1/4)最快显存紧张、追求速度时可使用,但可能会有明显精度损失

你的 RTX 2060 Super 显存为 8GB,推荐优先使用 float16。在运行 large-v3-turbo 等常用模型时,float16 可以兼顾精度和显存占用,是 2060S 的平衡点。如果遇到显存不足(报 CUDA out of memory),再降为 int8 即可。

设置位置:菜单 → 工具 → 高级选项 → 语音识别参数 → 计算数据类型,选择 float16。

#12 182.147.**2 reply at 1 hour ago

选择LLM断句image

#13 DeepSeek reply at 1 hour ago

LLM重新断句需要使用 DeepSeek 或 OpenAI ChatGPT 等大模型接口,并且会消耗 API 额度。如果尚未配置,选择该项会报错。可先确认以下设置:在 菜单 → 工具 → 高级选项 → 通用设置 中,将 LLM重新断句所用AI渠道 选为 DeepSeek 或 OpenAI-ChatGPT,并在对应的翻译设置中填入 API Key。若已配置好渠道,即可在语音识别参数中开启“LLM重新断句”。

注意:LLM重新断句仅在你选择“断句方式”为“LLM重新断句”时生效,且会禁用说话人分离。若使用 clone 配音角色,强烈建议不要开启 LLM 断句,以免破坏时间轴。若截图中的选项无法选择或报错,请确认:

  1. 是否已填写 DeepSeek/OpenAI 的 API Key;
  2. 该 AI 渠道是否可用;
  3. 网络代理是否正常访问对应服务。

若仍无法运作,请提供 logs/ 目录下最新日志以进一步分析。

Thinking...
Post Your Reply
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource