-
#6876 语音识别阶段出错[openai-whisper(内置)] 分离音频失败,请检查日志或重试Traceback (most recent call last):...
💬 1[Last reply:31 minutes ago] 这是由于视频或软件路径中包含中文(E:/自动翻译/...)导致 FFmpeg 无法正确处理命令而引发的“分离音频失败”。底层工具对中文、空格、特殊符号兼容性较差。解决方案:将 pyVideoTrans 解压到纯英文目录(如 D:\pyVideoTrans),避免中文和特殊符号。视频文件路径也建议改为纯英文/数字命名,例如 video01.mp4。若仍失败,请打开软件目录下的 logs/ 文件夹,查...9.142.**2 Posted at: 31 minutes ago -
#6874 [WinError 32] 另一个程序正在使用此文件,进程无法访问。: 'G:/VideoTrans/tmp/14956/bcf9e8087c/final_audio_temp.wav':G:/VideoTrans/tmp/14956/bcf9e8087c/final_audio_temp.wavTraceback (most recent call las...
💬 1[Last reply:1 hour ago] 这是 Windows 下文件被其他进程占用导致的 PermissionError,通常由杀毒软件实时扫描、残留的 FFmpeg/音频进程或同时运行多个软件实例引起。请按顺序排查:退出所有 pyVideoTrans 实例,确认任务管理器中只有至多一个 sp.exe 在运行。关闭杀毒软件(360、火绒、Windows Defender 等),并将 G:/VideoTrans 目录加入白名单。手动清空临...113.88.**1 Posted at: 1 hour ago -
#6873 500 Server Error: Internal Server Error for url: https://edge.microsoft.com/translate/translatetext?from=&to=zh-Hans&isEnterpriseClient=falseTraceback (most recent call last):...
💬 1[Last reply:1 hour ago] 微软翻译接口已失效,且Google翻译在国内无法直接访问,导致自动回退到微软后报错。建议更换翻译渠道。推荐方案:改用 DeepSeek 渠道,翻译质量最佳。在 菜单 → 翻译设置 → DeepSeek 中填入API密钥(https://platform.deepseek.com/ 可申请),然后在主界面翻译渠道下拉框中选中 DeepSeek。备选方案:使用 M2M100(内置) 本地翻译,无需密钥...113.88.**1 Posted at: 1 hour ago -
#6872 Automatic model download failed. Click [Help Docs] for manual download instructions:...
💬 1[Last reply:1 hour ago] This error is caused by a network interruption during the HuggingFace model download. The connection was closed before the full model file was received (only 1.1GB of the expected 1.5GB was downloaded...2409:**:40a4 Posted at: 1 hour ago -
#6871 连接超时,请检查网络连接是否稳定Traceback (most recent call last):...
💬 1[Last reply:7 hours ago] 此报错的核心原因是:网络无法连接到阿里云百炼的 OSS 存储服务器(dashscope-file-mgr.oss-cn-beijing.aliyuncs.com)。你在使用「阿里百炼API/Qwen3-ASR」语音识别时,需要将本地音频上传到阿里云 OSS,连接超时导致上传失败。请按以下顺序排查:检查网络:确认当前电脑能正常访问外网。可尝试用浏览器打开 https://dashscope-file...116.162.**9 Posted at: 7 hours ago -
#1966 语音识别选项 1整体识别和批量推理的区别?2默认断句和自动修正的区别?...
💬 11[Last reply:8 hours ago] 如果你只是单纯提取日语视频的字幕(语音转录/识别),不涉及配音克隆,那么不必强制设置“最长语音持续秒=10、最短语音持续毫秒=3000”。这两项设置主要是为了在使用 clone(原音色克隆)配音角色时,确保截取的参考音频时长合适、可靠。你当前没有使用克隆音色,所以可以忽略这条建议。不过,如果你希望日语字幕的断句更自然、避免长句被错误切断,可以勾选“Whisper预分割音频?”,并适当调整参数,例如...203.198.**4 Posted at: 8 months ago -
#6870 翻译字幕阶段出错 [Google(免费)] Google 翻译失败Traceback (most recent call last):...
💬 1[Last reply:8 hours ago] Google(免费) 翻译失败的核心原因是:Google 翻译接口在中国大陆无法直接访问,需要有效的代理网络。您的日志中虽已配置代理 http://127.0.0.1:8502,但该代理可能未正确转发请求或 Google 接口被限流。解决方案验证代理是否有效:打开浏览器,访问 https://translate.google.com,确认能正常打开且能翻译。若打不开,说明代理本身未生效,需先修复代...2a01:**:a4d1 Posted at: 8 hours ago -
#6867 语音识别阶段出错[Huggingface_ASR(内置)] The expanded size of the tensor (3000) must match the existing size (8363) at non-singleton dimension 1. Target sizes: [128, 3000]. Tensor sizes: [1...
💬 3[Last reply:9 hours ago] parakeet日语(内置) 渠道不支持 CUDA/GPU 加速,属于纯 CPU 运行,因此即使勾选了 CUDA 加速,实际仍会使用 CPU。 这是因为该渠道基于英伟达开源模型的 ONNX/CPU 推理实现,未集成 GPU 加速模块。如需 GPU 加速,请改用以下支持 CUDA 的识别渠道(需确保已正确配置 NVIDIA 显卡、CUDA 12.8+ 和 cuDNN 9.11+,并在主界面勾选“C...171.91.**5 Posted at: 10 hours ago -
#6869 语音识别阶段出错[Huggingface_ASR(内置)] The expanded size of the tensor (3000) must match the existing size (8363) at non-singleton dimension 1. Target sizes: [128, 3000]. Tensor sizes: [1...
💬 1[Last reply:10 hours ago] 核心原因:这是 Huggingface_ASR(内置) 渠道中 kotoba-tech/kotoba-whisper-v2.0 模型在批量音频填充(padding)时发生的张量维度不匹配错误。该模型与当前 transformers pipeline 存在兼容性问题,并非您的操作错误。解决方案(按推荐顺序):更换识别渠道:您处理的是日语视频,建议改用 openai-whisper(内置) 的 lar...171.91.**5 Posted at: 10 hours ago -
#6868 语音识别阶段出错[Huggingface_ASR(内置)] The expanded size of the tensor (3000) must match the existing size (8363) at non-singleton dimension 1. Target sizes: [128, 3000]. Tensor sizes: [1...
💬 1[Last reply:10 hours ago] 该错误是音频输入长度超过模型最大处理限制导致的。kotoba-whisper-v2.0 模型期望的输入特征长度为 3000 帧(约 30 秒),但实际输入达到了 8363 帧,说明切片时长过长,模型无法正确处理。按以下步骤排查:进入 菜单 → 工具 → 高级选项 → 语音识别参数,将 最长语音持续(秒) 改为 30,并勾选 Whisper预分割音频?,然后重新执行。如果仍有问题,建议更换为其他支持...171.91.**5 Posted at: 10 hours ago -
#6866 语音识别阶段出错[Huggingface_ASR(内置)] The expanded size of the tensor (3000) must match the existing size (3465) at non-singleton dimension 1. Target sizes: [128, 3000]. Tensor sizes: [1...
💬 1[Last reply:10 hours ago] 该错误为 transformers 语音识别 pipeline 内部在批处理音频时发生的张量维度不匹配错误,具体原因无法直接确定。可能涉及所选模型 kotoba-tech/kotoba-whisper-v2.0 对音频输入长度受限、模型文件不完整或 VAD 切分参数设置不当。建议按以下顺序排查:重新下载模型:确认 软件目录/models/models--kotoba-tech--kotoba-wh...171.91.**5 Posted at: 10 hours ago -
#6865 [ERROR] trk.cfg=[TaskCfgVTT]当前工作模式: 翻译视频或音频 批量翻译模式原始输入文件名: D:/ike/新建文件夹/cP1.mp4, 输出结果保存到文件夹: D:/ike/cP1-mp4,临时文件夹: E:/ik......
💬 1[Last reply:10 hours ago] 核心原因:语音识别渠道「阿里百炼API/Qwen3-ASR」在向阿里云 OSS 文件服务上传音频时网络连接超时,导致无法完成识别。这通常是网络环境、代理或防火墙配置问题,而非软件本身的 bug。请按以下步骤排查:检查网络连通性:确认本机能否正常访问 dashscope-file-mgr.oss-cn-beijing.aliyuncs.com。可在 CMD 中执行 ping dashscope-fi...116.162.**9 Posted at: 10 hours ago -
#6864 [DEBUG] 返回缓存的编解码器 Windows-264: libx264[DEBUG] [最终视频合成]不支持硬件编解码或指定了强制软编解码:['-y', '-progress', 'compose1787678390.7306364.......
💬 1[Last reply:10 hours ago] 这段日志表示最终视频合成阶段因“不支持硬件编解码或指定了强制软编解码”,使用了 libx264 软件编码器,属于正常日志,不是错误信息。但仅凭这一小段日志无法确定你遇到的具体问题。请补充以下信息以便判断:软件版本号(主界面左上角显示);操作系统(Windows/macOS/Linux);完整报错信息、错误截图,或 logs/ 文件夹中最新日志的末尾约30行内容。...116.162.**9 Posted at: 10 hours ago -
#6863 必须选择视频文件=system:Windows-10-10.0.19045-SP0version:v4.11frozen:Truelanguage:zhroot_dir:D:/win-pyvideotrans-v4.11...
💬 5[Last reply:10 hours ago] 原因是未启用GPU加速环境,或软件中未勾选“CUDA加速”选项,导致语音识别模型回退到CPU运行,处理速度会明显变慢。解决步骤:确认电脑是否安装了NVIDIA(N卡)独立显卡。AMD/Intel显卡不支持CUDA加速,只能使用CPU。若为N卡,请确保已安装CUDA 12.8及以上版本、cuDNN 9.11及以上,并将CUDA的bin和lib目录加入系统环境变量Path。在软件语音转录(或视频翻译)...171.91.**5 Posted at: 10 hours ago -
#6862 折腾了2天,想知道为什么用qwen-tts内置的不能走gpu模式,显卡、cuda12.8等都装好了...
💬 1[Last reply:13 hours ago] 从你提供的截图看,Qwen3-TTS(内置)渠道的 GPU 加速需要满足特定条件,最可能的原因是以下之一:未勾选 CUDA 加速:在主界面「设置更多参数」或「高级选项」中,需要显式勾选 CUDA 加速 复选框。默认状态下即使你有显卡,软件也不会自动启用 GPU。cuDNN 缺失或版本不匹配:Qwen3-TTS 基于 PyTorch 框架,它底层调用 CUDA 时 必须有 cuDNN 9.11 及以...103.99.**1 Posted at: 13 hours ago -
#6861 No transcription results returned. Please check the original audio/video or model and try again.Traceback (most recent call last):...
💬 1[Last reply:13 hours ago] 这个错误表示语音识别阶段返回了空结果,核心原因是模型没有正确识别出音频中的语音,或音频无法被解析。结合你的日志,最可疑的是文件路径和文件名中含有特殊符号(°、空格、中文),可能导致 FFmpeg 无法正确读取视频文件。请按以下顺序逐一排查:修改路径和文件名(最可能的原因)将视频移动到浅层纯英文路径,例如 D:/test/galileo.mp4文件名中的 °(角度符号)、空格和中文字符全部去除重新导...2409:**:695 Posted at: 13 hours ago -
#6859 pyvideotrans v3.59版本自动翻译时出现报错...
💬 3[Last reply:20 hours ago] 暂无法确定具体原因。您提供的日志截断在“正在分离背景音乐 53.3%”处,真正的报错信息很可能在后续日志中。请先按以下步骤操作:升级软件至最新版 v4.11 —— v3.59 属于过旧版本,存在大量已修复的 Bug,且官方已停止维护。升级后重新执行任务,若仍报错,请提供 软件安装目录下 logs/ 文件夹中最新日期日志文件 的 末尾约30行完整内容(含报错文字)。另外,根据现有日志可初步排查:日志...104.238.**6 Posted at: 20 hours ago -
#3730 TaskCfgVTT(is_cuda=False, uuid='f6e0359f4e', cache_folder='D:/pyvideotrans/tmp/4808/f6e0359f4e', target_dir='D:/Program Files/Desktop/治療2/_video_out/How to release your pec minor w...
💬 1[Last reply:20 hours ago] 翻译阶段出错是因为 Gemini AI 返回了空结果。这通常是由于网络问题、API密钥无效、请求内容触发安全策略或模型暂时不可用导致的。请按以下步骤排查和解决:检查网络代理:Gemini 服务在国内无法直接访问。请确保已在软件主界面的“网络代理地址”中填写了正确的代理地址(格式如 http://127.0.0.1:10808)。验证 API 密钥:前往 菜单 -> 翻译设置 -> Ge...103.108.**1 Posted at: 5 months ago -
#1027 videotrans.configure._except.StopRetry: GPT-SoVITS error-1:{'message': 'prompt_lang: miqi is not supported in version v2'}...
💬 3[Last reply:20 hours ago] 错误原因是 GPT-SoVITS 的 v2 版本 API 不支持你选择的语音角色 miqi。解决方案:在软件主界面,将“配音渠道”从“GPT-SoVITS”切换为其他渠道,例如“Edge-TTS(免费)”。如果必须使用 GPT-SoVITS,请确保你部署的 GPT-SoVITS 服务版本支持 miqi 这个语音角色。你可能需要更新或重新部署 GPT-SoVITS 服务端。在 GPT-SoVITS ...240e:**:fbf Posted at: 10 months ago -
#6857 我有中文短视频,时长约1分钟以内,它们是饰品的中国达人用中文讲解视频,带有中文硬字幕(烧录在上面的,无法直接删除)现在我需要将视频转成英文讲解,最好是跟原来的中国达人相同的音色,另外,带上英文字幕,且将中文字幕去除,后面我会发布到tikto......
💬 3[Last reply:20 hours ago] 字幕翻译性价比最高推荐 DeepSeek:价格极低(可充值1元体验),翻译质量接近顶级大模型,尤其适合中→英。你已有的国内 AI 模型若兼容 OpenAI 接口格式,也可通过“兼容 AI/本地模型”渠道接入。具体操作:打开软件顶部菜单 → 翻译设置,找到 DeepSeek 或 兼容AI/本地模型。填入你的 API Key 与 API 地址(本地部署则填 http://127.0.0.1:端口,云端...113.104.**6 Posted at: 20 hours ago
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.