#7101 kotoba-tech/kotoba-whisper-v2.0 这个模型在models--kotoba-tech--kotoba-whisper-v2.0文件夹下的模型主体是什么格式的?、

159.195**9 Posted at: 1 hour ago

kotoba-tech/kotoba-whisper-v2.0 这个模型在models--kotoba-tech--kotoba-whisper-v2.0文件夹下的模型主体是什么格式的?、

9 Replies

#1 DeepSeek reply at 1 hour ago

该模型是 Hugging Face 格式,通过 transformers 加载。其模型主体文件通常为 model.safetensorspytorch_model.bin,同目录下还应包含 config.json 等配置文件。若下载不完整可能报错 Error no file named pytorch_model.bin, model.safetensors...

存放位置应确保为:软件目录/models/models--kotoba-tech--kotoba-whisper-v2.0

请查阅相关文档:

#2 159.195**9 reply at 1 hour ago

jiimage
就这个文件 ,我不小心改了后戳,忘记他是什么格式了!

#3 DeepSeek reply at 1 hour ago

我无法查看你的截图,但根据该模型(kotoba-whisper-v2.0)在 Hugging Face 上的标准结构,其权重文件通常是以下两种之一:

  • model.safetensors
  • pytorch_model.bin

如果你只是改了后缀,请恢复为原文件名。可先右键查看该文件的大小,通常模型权重文件较大(几百MB到GB)。也可用文本编辑器打开文件头部,如果开头是乱码但包含 safetensors 字样,则应为 .safetensors;若开头是八进制乱码,则可能是 .bin

最稳妥的方法:删除该文件,重新下载完整模型到 软件目录/models/models--kotoba-tech--kotoba-whisper-v2.0,避免因改扩展名导致识别失败。下载地址:https://huggingface.co/kotoba-tech/kotoba-whisper-v2.0/tree/main

#4 159.195**9 reply at 1 hour ago

现在叫 model.safetensors.mv 。好像不对
[图片上传中...]

#5 DeepSeek reply at 1 hour ago

文件后缀被误改成了 .mv。请重命名为 model.safetensors,确保文件名完全一致,不要有多余后缀。

若重命名后仍无法加载,说明文件可能已损坏,建议删除该文件,重新从 https://huggingface.co/kotoba-tech/kotoba-whisper-v2.0/tree/main 下载完整的 model.safetensors,放入 软件目录/models/models--kotoba-tech--kotoba-whisper-v2.0 文件夹内。

#6 182.147**1 reply at 1 hour ago

DEBUG] [新进程任务 结束:title='load kotoba-tech/kotoba-whisper-v2.0'],耗时68.491455078125s
[ERROR] trk=[SpeechToText]语音转录: self.out_format='srt',self.copysrt_rawvideo=True,self.spk_insert=False
[TaskCfgSTT]
原始输入文件名: C:/Users/1/Desktop/BOBB-442J.mp4,
输出结果保存到文件夹: D:/win-pyvideotrans-v4.11/output/recogn,
临时文件夹: D:/win-pyvideotrans-v4.11/tmp/1028/2adbc3d2c8
未启用CUDA加速
未选 降噪
语音识别:Huggingface_ASR(内置), kotoba-tech/kotoba-whisper-v2.0 断句方式:默认断句
发音语言:ja
未选 降噪

File "videotrans\process\stt_pipe.py", line 65, in pipe_asr
File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\automatic_speech_recognition.py", line 244, in call

return super().__call__(inputs, **kwargs)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\base.py", line 1245, in call

......
line 35, in _exec
File "videotrans\recognition\_huggingface.py", line 71, in _pipe_asr
File "videotrans\configure\base.py", line 264, in _new_process
videotrans.configure.excepts.VideoTransError: The expanded size of the tensor (3104) must match the existing size (3000) at non-singleton dimension 1. Target sizes: [128, 3104]. Tensor sizes: [128, 3000]:Traceback (most recent call last):
File "videotrans\process\stt_pipe.py", line 65, in pipe_asr
File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\automatic_speech_recognition.py", line 244, in call

return super().__call__(inputs, **kwargs)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\base.py", line 1245, in call

outputs = list(final_iterator)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\pt_utils.py", line 126, in next

item = next(self.iterator)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\pt_utils.py", line 271, in next

processed = self.infer(next(self.iterator), **self.params)

File "D:\win-pyvideotrans-v4.11\_internal\torch\utils\data\dataloader.py", line 733, in next

data = self._next_data()

File "D:\win-pyvideotrans-v4.11\_internal\torch\utils\data\dataloader.py", line 789, in _next_data

data = self._dataset_fetcher.fetch(index)  # may raise StopIteration

File "D:\win-pyvideotrans-v4.11\_internal\torch\utils\data\_utils\fetch.py", line 43, in fetch

return self.collate_fn(data)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\base.py", line 173, in inner

padded[key] = _pad(items, key, _padding_value, padding_side)

File "D:\win-pyvideotrans-v4.11\_internal\transformers\pipelines\base.py", line 109, in _pad

tensor[i, : len(item[key][0])] = item[key][0]

RuntimeError: The expanded size of the tensor (3104) must match the existing size (3000) at non-singleton dimension 1. Target sizes: [128, 3104]. Tensor sizes: [128, 3000]

#7 DeepSeek reply at 1 hour ago

该报错的核心原因是模型文件损坏或不完整,导致特征提取器与实际音频特征长度不匹配,在处理日语音频时发生张量维度错误。

解决方案:

  1. 确认模型文件 model.safetensors 后缀已恢复正确(不能为 .mv),文件完整放入 D:/win-pyvideotrans-v4.11/models/models--kotoba-tech--kotoba-whisper-v2.0/ 目录下。
  2. 删除整个 models--kotoba-tech--kotoba-whisper-v2.0 文件夹,重新从 https://huggingface.co/kotoba-tech/kotoba-whisper-v2.0/tree/main 下载全部文件(包括 config.jsonpreprocessor_config.jsonmodel.safetensors 等),必须保证文件完整。
  3. 若仍报错,建议改用其他日语识别模型,例如:

    • reazon-research/japanese-wav2vec2-large-rs35kh
    • 或切换到 openai-whisper(内置) 并选用 large-v3 模型。
  4. 同时建议升级到最新版 v4.12,以修复已知兼容性问题。

请查阅相关文档:

#8 182.147**1 reply at 1 hour ago

会不会是我的高级设置错误了~

#9 DeepSeek reply at 1 hour ago

此报错并非高级设置导致,而是模型文件损坏或不完整所致。你之前将权重文件误改为 model.safetensors.mv,即使重命名为 model.safetensors,文件内容也极可能已损坏。这个张量维度不匹配的错误,正是 HuggingFace_ASR 渠道加载该模型时特征尺寸不一致的典型表现。

解决方案:

  1. 删除整个 models--kotoba-tech--kotoba-whisper-v2.0 文件夹。
  2. 重新从 https://huggingface.co/kotoba-tech/kotoba-whisper-v2.0/tree/main 下载全部文件(config.json、preprocessor_config.json、model.safetensors 等),确保完整。
  3. 确认文件名为 model.safetensors,无多余后缀。
  4. 若网络下载困难,可改用其他日语识别模型,如 reazon-research/japanese-wav2vec2-large-rs35kh,或切换到 openai-whisper(内置) 使用 large-v3 模型。

高级设置无需改动,保持默认即可。

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource