#7388 语音识别阶段出错[Nemotron-3.5-asr-0.6b(内置)] Sequence Length: 7197 has to be less or equal than config.max_position_embeddings 50

119.118**0 Posted at: 2 hours ago

语音识别阶段出错[Nemotron-3.5-asr-0.6b(内置)] Sequence Length: 7197 has to be less or equal than config.max_position_embeddings 5000.:Traceback (most recent call last):
File "videotrans\process\stt_nemotron.py", line 46, in nemotron_asr
File "D:\软件\视频相关\win-pyvideotrans-v4.12-0913\_internal\transformers\models\nemotron3_5_asr\generation_nemotron3_5_asr.py", line 35, in generate

return super().generate(inputs=inputs, generation_config=generation_config, **kwargs)

File "D:\软件\视频相关\win-pyvideotrans-v4.12-0913\_internal\transformers\models\nemotron_asr_streaming\generation_nemotron_asr_streaming.py", line 228, in generate

outputs = super().generate(inputs=inputs, generation_config=generation_config, **kwargs)

File "D:\软件\视频相关\win-pyvideotrans-v4.12-0913\_internal\transformers\models\parakeet\generation_parakeet.py", line 256, in generate

outputs = super().generate(inputs=inputs, generation_config=generation_config, **kwargs)

File "D:\软件\视频相关\win-pyvideotrans-v4.12-0913\
......
件\视频相关\win-pyvideotrans-v4.12-0913\_internal\transformers\utils\generic.py", line 911, in wrapper

output = func(self, *args, **kwargs)

File "D:\软件\视频相关\win-pyvideotrans-v4.12-0913\_internal\transformers\models\nemotron_asr_streaming\modeling_nemotron_asr_streaming.py", line 1007, in forward

position_embeddings = self.encode_positions(inputs_embeds, cached_frames=cached_frames)

File "D:\软件\视频相关\win-pyvideotrans-v4.12-0913\_internal\torch\nn\modules\module.py", line 1751, in _wrapped_call_impl

return self._call_impl(*args, **kwargs)

File "D:\软件\视频相关\win-pyvideotrans-v4.12-0913\_internal\torch\nn\modules\module.py", line 1762, in _call_impl

return forward_call(*args, **kwargs)

File "D:\软件\视频相关\win-pyvideotrans-v4.12-0913\_internal\torch\utils\_contextlib.py", line 116, in decorate_context

return func(*args, **kwargs)

File "D:\软件\视频相关\win-pyvideotrans-v4.12-0913\_internal\transformers\models\nemotron_asr_streaming\modeling_nemotron_asr_streaming.py", line 376, in forward

raise ValueError(

ValueError: Sequence Length: 7197 has to be less or equal than config.max_position_embeddings 5000.

self.cfg=[TaskCfgVTT]当前工作模式: 转录并翻译字幕
原始输入文件名: J:/1.最新下载/人妖和女/已下载/nvh-034/nvh-034______________.mp4,
输出结果保存到文件夹: J:/1.最新下载/人妖和女/已下载/nvh-034/_video_out/nvh-034______________-mp4,
临时文件夹: D:/软件/视频相关/win-pyvideotrans-v4.12-0913/tmp/12492/eb81d0383d
已选 清理已存在
已启用CUDA加速
未选 降噪
语音识别:Nemotron-3.5-asr-0.6b(内置), , 发音语言: 简体中文, 断句方式:默认断句
未选 目标语言,不翻译字幕
输出字幕格式: 单字幕


=
system:Windows-10-10.0.19041-SP0
version:v4.12
frozen:True
language:zh_CN
root_dir:D:/软件/视频相关/win-pyvideotrans-v4.12-0913

1 Replies

#1 DeepSeek reply at 2 hours ago

这是由于 Nemotron-3.5-asr-0.6b 模型本身的位置编码上限为 5000,而本次送入模型的音频切片过长(对应序列长度达到 7197),超出了模型的物理上限,导致报错。

解决办法(二选一):

  1. 更换语音识别渠道:Nemotron-3.5-asr-0.6b 定位为轻量级流式模型,对长片段支持有限。中文视频建议改用知识库推荐的:

    • faster-whisper(内置) + large-v3-turbo(速度质量兼顾)
    • Qwen-ASR(内置)(中文效果佳)
    • Firered中文(内置)阿里FunASR(内置)
  2. 若坚持用 Nemotron:需从源头减少单次送入模型的音频长度。进入 菜单 → 工具 → 高级选项 → 语音识别参数,调小以下数值后重试:

    • 最长语音持续(秒):由默认 5 改为 2~3
    • 静音分割持续(毫秒):由默认 600 改为 300~400
    • 若音视频有背景音,建议同时勾选 设置更多参数 → 分离人声背景声,减少 VAD 误切分。

补充建议:软件左上角版本为 v4.12,可先下载最新补丁包覆盖后再试(Nemotron 渠道为 4.12 新增,早期补丁可能存在切片长度适配问题)。

请查阅相关文档:

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource