#7881 语音识别阶段出错[Nemotron-3.5-asr-0.6b(内置)] Sequence Length: 6126 has to be less or equal than config.max_position_embeddings 50

222.131**3 Posted at: 1 hour ago

语音识别阶段出错[Nemotron-3.5-asr-0.6b(内置)] Sequence Length: 6126 has to be less or equal than config.max_position_embeddings 5000.:Traceback (most recent call last):
File "videotrans\process\stt_nemotron.py", line 41, in nemotron_asr
File "D:\program\videotrans\_internal\transformers\models\nemotron3_5_asr\generation_nemotron3_5_asr.py", line 35, in generate

return super().generate(inputs=inputs, generation_config=generation_config, **kwargs)

File "D:\program\videotrans\_internal\transformers\models\nemotron_asr_streaming\generation_nemotron_asr_streaming.py", line 228, in generate

outputs = super().generate(inputs=inputs, generation_config=generation_config, **kwargs)

File "D:\program\videotrans\_internal\transformers\models\parakeet\generation_parakeet.py", line 256, in generate

outputs = super().generate(inputs=inputs, generation_config=generation_config, **kwargs)

File "D:\program\videotrans\_internal\torch\utils\_contextlib.py", line 116, in decorate_context
......
utils\output_capturing.py", line 252, in wrapper

outputs = func(self, *args, **kwargs)

File "D:\program\videotrans\_internal\transformers\utils\generic.py", line 911, in wrapper

output = func(self, *args, **kwargs)

File "D:\program\videotrans\_internal\transformers\models\nemotron_asr_streaming\modeling_nemotron_asr_streaming.py", line 1007, in forward

position_embeddings = self.encode_positions(inputs_embeds, cached_frames=cached_frames)

File "D:\program\videotrans\_internal\torch\nn\modules\module.py", line 1751, in _wrapped_call_impl

return self._call_impl(*args, **kwargs)

File "D:\program\videotrans\_internal\torch\nn\modules\module.py", line 1762, in _call_impl

return forward_call(*args, **kwargs)

File "D:\program\videotrans\_internal\torch\utils\_contextlib.py", line 116, in decorate_context

return func(*args, **kwargs)

File "D:\program\videotrans\_internal\transformers\models\nemotron_asr_streaming\modeling_nemotron_asr_streaming.py", line 376, in forward

raise ValueError(

ValueError: Sequence Length: 6126 has to be less or equal than config.max_position_embeddings 5000.

self.cfg=[TaskCfgVTT]当前工作模式: 转录并翻译字幕
原始输入文件名: D:/Downloads/Videos/!Submaker/HUNTB-340three.stepsis_4.mp4,
输出结果保存到文件夹: D:/Downloads/Videos/!Submaker/HUNTB-340three.stepsis_4-mp4,
临时文件夹: D:/program/videotrans/tmp/26780/e017fce19c
已选 清理已存在
未启用CUDA加速
未选 降噪
语音识别:Nemotron-3.5-asr-0.6b(内置), , 发音语言: 日语, 断句方式:LLM重新断句
翻译渠道:DeepSeek,原始语言:日语,目标语言:简体中文, 未选 发送完整字幕
输出字幕格式: 单字幕
代理地址:http://127.0.0.1:7897


=
system:Windows-10-10.0.26300-SP0
version:v4.14
frozen:True
language:zh_CN
root_dir:D:/program/videotrans

1 Replies

#1 DeepSeek reply at 1 hour ago

这是 Nemotron-3.5-asr-0.6b(内置) 模型的硬性限制导致的:该模型单次能处理的音频序列长度上限为 5000(约合对应时长的音频切片),而当前送入的音频切片长度为 6126,超出上限从而报错。

原因是 VAD 切分出的语音片段时间过长。需缩短单个切片时长:

  1. 打开 菜单(Menu)-工具/选项(Tools/Options)--高级选项(Advanced Options)-语音识别参数(ASR Settings)
  2. 将 最长语音持续(VAD:max speech duration(s)) 改小(例如 3~4)
  3. 将 静音分割持续(VAD:Min silence duration for split(ms)) 适当调小(例如 300~400),使长句更快被切断
  4. 保存后,在主界面勾选 清理已生成(Clear Output) 重新执行

如果调小后仍报同类错误,建议改用 faster-whisper(内置) 或 openai-whisper(内置) 渠道进行识别,这两个渠道对切片长度没有此上限限制。

请查阅相关文档:

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource