#6703 Batch size mismatch: audio=8, context=0:Traceback (most recent call last): File "videotrans\process\stt_fun.py", line 5

27.19.**4 Posted at: 20 hours ago

Batch size mismatch: audio=8, context=0:Traceback (most recent call last):
File "videotrans\process\stt_fun.py", line 559, in qwen3asr_fun
File "torch\utils\_contextlib.py", line 116, in decorate_context

return func(*args, **kwargs)

File "D:\AI\win-pyvideotrans-v4.02-0616\_internal\qwen_asr\inference\qwen3_asr.py", line 345, in transcribe

raise ValueError(f"Batch size mismatch: audio={n}, context={len(ctxs)}")

ValueError: Batch size mismatch: audio=8, context=0
[Qwen-ASR(本地内置), 兼容AI/本地模型, Index-TTS(本地API)]
Traceback (most recent call last):
File "videotrans\task\only_one.py", line 47, in run
File "videotrans\task\trans_create.py", line 317, in recogn
File "videotrans\recognition\__init__.py", line 190, in run
File "videotrans\recognition\_base.py", line 94, in run
File "videotrans\recognition\_qwenasrlocal.py", line 45, in _exec
File "videotrans\configure\base.py", line 268, in _new_process
videotrans.configure.excepts.VideoTransError: Batch si
......
ine 345, in transcribe

raise ValueError(f"Batch size mismatch: audio={n}, context={len(ctxs)}")

ValueError: Batch size mismatch: audio=8, context=0
TaskCfgVTT(uuid='89c424a194', name='E:/ 素材/1/videoplayback.mp3', dirname='E:/素材/1', noextname='videoplayback', basename='videoplayback.mp3', ext='mp3', target_dir='E:/ 素材/1/_video_out/videoplayback-mp3', cache_folder='D:/AI/win-pyvideotrans-v4.02-0616/tmp/53228/89c424a194', is_cuda=True, source_language='英语', source_language_code='en', source_sub='E:/素材/1/_video_out/videoplayback-mp3/en.srt', source_wav='D:/AI/win-pyvideotrans-v4.02-0616/tmp/53228/89c424a194/en.wav', source_wav_output='E:/素材/1/_video_out/videoplayback-mp3/en.m4a', target_language='简体中文', target_language_code='zh-cn', target_sub='E:/素材/1/_video_out/videoplayback-mp3/zh-cn.srt', target_wav='D:/AI/win-pyvideotrans-v4.02-0616/tmp/53228/89c424a194/target.wav', target_wav_output='E:/素材/1/_video_out/videoplayback-mp3/zh-cn.m4a', translate_type=8, tts_type=9, volume='+0%', pitch='+0Hz', voice_rate='+0%', voice_role='clone', voice_autorate=True, video_autorate=False, remove_silent_mid=False, align_sub_audio=True, detect_language='en', recogn_type=2, model_name='1.7B', shibie_audio=None, remove_noise=False, enable_diariz=True, nums_diariz=0, rephrase=0, fix_punc=0, subtitle_language=None, app_mode='biaozhun', subtitles='', targetdir_mp4='E:/ 素材/1/_video_out/videoplayback-mp3/videoplayback.mp4', novoice_mp4='D:/AI/win-pyvideotrans-v4.02-0616/tmp/53228/89c424a194/novoice.mp4', is_separate=True, embed_bgm=False, instrument='D:/AI/win-pyvideotrans-v4.02-0616/tmp/53228/89c424a194/instrument.wav', vocal='D:/AI/win-pyvideotrans-v4.02-0616/tmp/53228/89c424a194/vocal.wav', clear_cache=False, background_music='', subtitle_type=1, only_out_mp4=False, recogn2pass=False, output_srt=0, copysrt_rawvideo=False, loop_backaudio=1, backaudio_volume=0.8)


=
system:Windows-10-10.0.26200-SP0
version:v4.02
frozen:True
language:zh
root_dir:D:/win-pyvideotrans-v4.02-0616

1 Replies

#1 DeepSeek reply at 20 hours ago

该报错发生在 Qwen-ASR(内置) 本地模型推理阶段:Batch size mismatch: audio=8, context=0,即音频片段数量与模型上下文数量不一致,导致转录中断。

暂无法确定这个错误的具体触发原因,但你的版本为 v4.02,与最新版 v4.09 相差较大,建议先按以下步骤排查:

  1. 升级软件到最新版本 v4.09(下载完整包或补丁包覆盖),此报错可能属旧版 bug。
  2. 检查 Qwen-ASR 1.7B 模型文件是否完整:应存放在 软件目录/models/models--Qwen--Qwen3-ASR-1.7B,如不完整请重新下载。
  3. 该日志中同时启用了「说话人分离」,且源语言为英语。若升级后仍失败,可将识别渠道临时切换为 faster-whisper(内置) 的 large-v3-turbo 模型测试,排除 Qwen-ASR 本身异常。

如果以上操作后仍复现,请提供软件安装目录下 logs/ 文件夹中最新的日志文件(复制底部约30行),并确认软件左上角版本号,以便进一步分析。

请查阅相关文档:

Thinking...
Post Your Reply
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource