#6417 翻译字幕阶段出错 [Hy-MT2-1.8B(本地内置)] Couldn't instantiate the backend tokenizer from one of: (1) a `tokenizers` library serializ

182.129.**1 Posted at: 2 hours ago

翻译字幕阶段出错 [Hy-MT2-1.8B(本地内置)] Couldn't instantiate the backend tokenizer from one of:
(1) a tokenizers library serialization file,
(2) a slow tokenizer instance to convert or
(3) an equivalent slow tokenizer class to instantiate and convert.
You need to have sentencepiece or tiktoken installed to convert a slow tokenizer to a fast one.
Traceback (most recent call last):

File "videotrans\task\job.py", line 35, in run

File "videotrans\task\job.py", line 135, in process_task

File "videotrans\task\_stage_translate.py", line 31, in trans

File "videotrans\translator\_runner.py", line 63, in run

File "videotrans\translator\_base.py", line 68, in run

File "videotrans\translator\_base.py", line 97, in _run_text

File "videotrans\translator\_base.py", line 142, in _hymt2

File "D:\BaiduNetdiskDownload\pyVideoTrans\win-pyvideotrans-v4.07\_internal\transformers\models\auto\tokenization_auto.py", line 773, in from_pretrained

return tokenizer_class.from_pretrained(pretrained_model_name_or_path, *inputs, **kwargs)

File "D:\BaiduNetdiskDownload\pyVideoTrans\win-pyvideotrans-v4.07\_internal\transformers\tokenization_utils_base.py", line 1721, in from_pretrained

return cls._from_pretrained(

File "D:\BaiduNetdiskDownload\pyVideoTrans\win-pyvideotrans-v4.07\_internal\transformers\tokenization_utils_base.py", line 1910, in _from_pretrained

tokenizer = cls(*init_inputs, **init_kwargs)

File "D:\BaiduNetdiskDownload\pyVideoTrans\win-pyvideotrans-v4.07\_internal\transformers\tokenization_utils_tokenizers.py", line 341, in init

raise ValueError(

ValueError: Couldn't instantiate the backend tokenizer from one of:
(1) a tokenizers library serialization file,
(2) a slow tokenizer instance to convert or
(3) an equivalent slow tokenizer class to instantiate and convert.
You need to have sentencepiece or tiktoken installed to convert a slow tokenizer to a fast one.
cfg=[TaskCfgVTT]当前工作模式: 转录并翻译字幕
原始输入文件名: D:/BaiduNetdiskDownload/视频资料/MusicDevelopments - Videos/01. Chords And Progressions On The RapidComposer Master Track.mp4,
输出结果保存到文件夹: D:/BaiduNetdiskDownload/视频资料/MusicDevelopments - Videos/翻译后的/01. Chords And Progressions On The RapidComposer Master Track-mp4,
临时文件夹: D:/BaiduNetdiskDownload/pyVideoTrans/win-pyvideotrans-v4.07/tmp/16716/e03d59e287
未选 清理已存在
已选 启用CUDA加速
未选 降噪
语音识别:阿里FunASR(本地内置), model_name: Fun-ASR-Nano-2512, 发音语言: 英语, 断句方式:默认断句
翻译渠道:Hy-MT2-1.8B(本地内置),原始语言:英语,目标语言:简体中文, 已选 发送完整字幕
输出字幕格式: 单字幕
代理地址:


=
system:Windows-10-10.0.26100-SP0
version:v4.07
frozen:True
language:zh
root_dir:D:/BaiduNetdiskDownload/pyVideoTrans/win-pyvideotrans-v4.07

1 Replies

这是 Hy-MT2-1.8B 本地翻译模型的 tokenizer 加载失败,核心原因是模型文件下载不完整/损坏,或当前打包环境缺少 sentencepiece/tiktoken 组件。

请按以下顺序操作:

  1. 升级到最新版本:当前你的软件是 v4.07,建议升级到 v4.08-0802。若之前只下载过补丁包,请重新下载完整包覆盖,避免旧版本依赖缺失。
  2. 删除并重新下载该模型

    • 删除 软件目录/models/models--tencent--Hy-MT2-1.8B 整个文件夹;
    • 回到软件重新选择 Hy-MT2-1.8B(本地内置) 并开始任务,让软件自动重新下载完整模型;
    • 下载期间保持网络稳定,不要中断。
  3. 手动补全模型文件

  4. 源码部署补充依赖

    • 如果使用的是源码部署,需安装 sentencepiecetiktoken
    • 执行:uv sync --all-extras,或 pip install sentencepiece tiktoken
  5. 临时替代方案

    • 如果模型反复无法加载,可先用 M2M100(内置) 或 DeepSeek 翻译渠道,不影响当前视频翻译任务继续执行。

若升级并重新下载模型后仍报相同错误,请提供 logs/ 目录下最新日志的底部约30行内容。

请查阅相关文档:

Post Your Reply
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Dondate via PayPal

Related resource