#6813 语音识别阶段出错[阿里FunASR(本地内置)] NoneTraceback (most recent call last):

125.67.**8 Posted at: 1 hour ago

语音识别阶段出错[阿里FunASR(本地内置)] None
Traceback (most recent call last):

File "videotrans\task\job.py", line 35, in run

File "videotrans\task\job.py", line 100, in process_task

File "videotrans\task\speech2text.py", line 97, in recogn

File "videotrans\recognition\__init__.py", line 206, in run

File "videotrans\recognition\_base.py", line 92, in run

File "videotrans\recognition\_funasr.py", line 48, in _exec

File "videotrans\recognition\_base.py", line 208, in cut_audio

File "videotrans\recognition\_base.py", line 189, in _vad_split

File "videotrans\configure\base.py", line 272, in _new_process

videotrans.configure.excepts.VideoTransError: None
cfg=TaskCfgSTT(uuid='83dbf58654', name='D:/BaiduNetdiskDownload/Youtube/排列好了的/101.The One Finger Band Ujam Carbon test 2.mp4', dirname='D:/BaiduNetdiskDownload/Youtube/排列好了的', noextname='101.The One Finger Band Ujam Carbon test 2', basename='101.The One Finger Band Ujam Carbon test 2.mp4', ext='mp4', target_dir='D:/BaiduNetdiskDownload/pyVideoTrans/win-pyvideotrans-v4.07/output/recogn', cache_folder='D:/BaiduNetdiskDownload/pyVideoTrans/win-pyvideotrans-v4.07/tmp/10780/83dbf58654', is_cuda=True, source_language=None, source_language_code=None, source_sub=None, source_wav=None, source_wav_output=None, target_language=None, target_language_code=None, target_sub='D:/BaiduNetdiskDownload/pyVideoTrans/win-pyvideotrans-v4.07/output/recogn/101.The One Finger Band Ujam Carbon test 2.srt', target_wav=None, target_wav_output=None, detect_language='en', recogn_type=3, model_name='Fun-ASR-Nano-2512', shibie_audio='D:/BaiduNetdiskDownload/pyVideoTrans/win-pyvideotrans-v4.07/tmp/10780/83dbf58654/101.The One Finger Band Ujam Carbon test 2-1787323300.2911992.wav', remove_noise=False, enable_diariz=False, nums_diariz=0, rephrase=0, fix_punc=0)


=
system:Windows-10-10.0.26100-SP0
version:v4.07
frozen:True
language:zh
root_dir:D:/BaiduNetdiskDownload/pyVideoTrans/win-pyvideotrans-v4.07

1 Replies

#1 DeepSeek reply at 1 hour ago

该错误发生在语音识别的 VAD(静音检测)分割阶段,通常是因为 FunASR 渠道所依赖的 VAD 模型文件缺失、损坏或未下载成功,导致 _vad_split 在启动子进程时抛出 VideoTransError: None

请按以下步骤排查:

1. 检查 VAD 模型文件
进入软件根目录下的 models/onnx/ 文件夹,确认是否存在以下文件(至少包含 VAD 相关文件):

  • seg_model.onnx
  • 以及 3dspeaker_speech_eres2net_large_sv_zh-cn_3dspeaker_16k.onnx
  • nemo_en_titanet_small.onnx

如果文件夹缺失或文件不全,说明模型未下载成功。

2. 手动下载 VAD 模型
访问以下地址,下载对应 .onnx 模型文件:

下载后,将该页面下所有 .onnx 文件放入 models/onnx/ 文件夹内。

3. 检查 FunASR 模型是否完整
进入 models/ 目录,确认 Fun-ASR-Nano-2512 对应的模型文件夹存在。如果模型损坏,可删除后重新让软件自动下载,或参考手动下载模型文档页面手动放置模型。

4. 尝试切换为 faster-whisper
如果以上操作仍无法解决,建议在主界面将语音识别渠道切换为 faster-whisper(内置),选择 large-v3-turbo 模型,这是默认推荐且更稳定的方案。

5. 查看详细日志
若仍报错,请查看 logs/ 目录下日期最新的日志文件,复制底部约30行报错信息提供进一步分析。

请查阅相关文档:

Thinking...
Post Your Reply
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource