-
#1966 语音识别选项 1整体识别和批量推理的区别?2默认断句和自动修正的区别?...
💬 11[Last reply:1 month ago] 如果你只是单纯提取日语视频的字幕(语音转录/识别),不涉及配音克隆,那么不必强制设置“最长语音持续秒=10、最短语音持续毫秒=3000”。这两项设置主要是为了在使用 clone(原音色克隆)配音角色时,确保截取的参考音频时长合适、可靠。你当前没有使用克隆音色,所以可以忽略这条建议。不过,如果你希望日语字幕的断句更自然、避免长句被错误切断,可以勾选“Whisper预分割音频?”,并适当调整参数,例如...203.198**4 Posted at: 9 months ago -
#6870 翻译字幕阶段出错 [Google(免费)] Google 翻译失败Traceback (most recent call last):...
💬 1[Last reply:1 month ago] Google(免费) 翻译失败的核心原因是:Google 翻译接口在中国大陆无法直接访问,需要有效的代理网络。您的日志中虽已配置代理 http://127.0.0.1:8502,但该代理可能未正确转发请求或 Google 接口被限流。解决方案验证代理是否有效:打开浏览器,访问 https://translate.google.com,确认能正常打开且能翻译。若打不开,说明代理本身未生效,需先修复代...2a01**a4d1 Posted at: 1 month ago -
#6867 语音识别阶段出错[Huggingface_ASR(内置)] The expanded size of the tensor (3000) must match the existing size (8363) at non-singleton dimension 1. Target sizes: [128, 3000]. Tensor sizes: [1...
💬 3[Last reply:1 month ago] parakeet日语(内置) 渠道不支持 CUDA/GPU 加速,属于纯 CPU 运行,因此即使勾选了 CUDA 加速,实际仍会使用 CPU。 这是因为该渠道基于英伟达开源模型的 ONNX/CPU 推理实现,未集成 GPU 加速模块。如需 GPU 加速,请改用以下支持 CUDA 的识别渠道(需确保已正确配置 NVIDIA 显卡、CUDA 12.8+ 和 cuDNN 9.11+,并在主界面勾选“C...171.91**5 Posted at: 1 month ago -
#6869 语音识别阶段出错[Huggingface_ASR(内置)] The expanded size of the tensor (3000) must match the existing size (8363) at non-singleton dimension 1. Target sizes: [128, 3000]. Tensor sizes: [1...
💬 1[Last reply:1 month ago] 核心原因:这是 Huggingface_ASR(内置) 渠道中 kotoba-tech/kotoba-whisper-v2.0 模型在批量音频填充(padding)时发生的张量维度不匹配错误。该模型与当前 transformers pipeline 存在兼容性问题,并非您的操作错误。解决方案(按推荐顺序):更换识别渠道:您处理的是日语视频,建议改用 openai-whisper(内置) 的 lar...171.91**5 Posted at: 1 month ago -
#6868 语音识别阶段出错[Huggingface_ASR(内置)] The expanded size of the tensor (3000) must match the existing size (8363) at non-singleton dimension 1. Target sizes: [128, 3000]. Tensor sizes: [1...
💬 1[Last reply:1 month ago] 该错误是音频输入长度超过模型最大处理限制导致的。kotoba-whisper-v2.0 模型期望的输入特征长度为 3000 帧(约 30 秒),但实际输入达到了 8363 帧,说明切片时长过长,模型无法正确处理。按以下步骤排查:进入 菜单 → 工具 → 高级选项 → 语音识别参数,将 最长语音持续(秒) 改为 30,并勾选 Whisper预分割音频?,然后重新执行。如果仍有问题,建议更换为其他支持...171.91**5 Posted at: 1 month ago -
#6866 语音识别阶段出错[Huggingface_ASR(内置)] The expanded size of the tensor (3000) must match the existing size (3465) at non-singleton dimension 1. Target sizes: [128, 3000]. Tensor sizes: [1...
💬 1[Last reply:1 month ago] 该错误为 transformers 语音识别 pipeline 内部在批处理音频时发生的张量维度不匹配错误,具体原因无法直接确定。可能涉及所选模型 kotoba-tech/kotoba-whisper-v2.0 对音频输入长度受限、模型文件不完整或 VAD 切分参数设置不当。建议按以下顺序排查:重新下载模型:确认 软件目录/models/models--kotoba-tech--kotoba-wh...171.91**5 Posted at: 1 month ago -
#6865 [ERROR] trk.cfg=[TaskCfgVTT]当前工作模式: 翻译视频或音频 批量翻译模式原始输入文件名: D:/ike/新建文件夹/cP1.mp4, 输出结果保存到文件夹: D:/ike/cP1-mp4,临时文件夹: E:/ik......
💬 1[Last reply:1 month ago] 核心原因:语音识别渠道「阿里百炼API/Qwen3-ASR」在向阿里云 OSS 文件服务上传音频时网络连接超时,导致无法完成识别。这通常是网络环境、代理或防火墙配置问题,而非软件本身的 bug。请按以下步骤排查:检查网络连通性:确认本机能否正常访问 dashscope-file-mgr.oss-cn-beijing.aliyuncs.com。可在 CMD 中执行 ping dashscope-fi...116.162**9 Posted at: 1 month ago -
#6864 [DEBUG] 返回缓存的编解码器 Windows-264: libx264[DEBUG] [最终视频合成]不支持硬件编解码或指定了强制软编解码:['-y', '-progress', 'compose1787678390.7306364.......
💬 1[Last reply:1 month ago] 这段日志表示最终视频合成阶段因“不支持硬件编解码或指定了强制软编解码”,使用了 libx264 软件编码器,属于正常日志,不是错误信息。但仅凭这一小段日志无法确定你遇到的具体问题。请补充以下信息以便判断:软件版本号(主界面左上角显示);操作系统(Windows/macOS/Linux);完整报错信息、错误截图,或 logs/ 文件夹中最新日志的末尾约30行内容。...116.162**9 Posted at: 1 month ago -
#6863 必须选择视频文件=system:Windows-10-10.0.19045-SP0version:v4.11frozen:Truelanguage:zhroot_dir:D:/win-pyvideotrans-v4.11...
💬 5[Last reply:1 month ago] 原因是未启用GPU加速环境,或软件中未勾选“CUDA加速”选项,导致语音识别模型回退到CPU运行,处理速度会明显变慢。解决步骤:确认电脑是否安装了NVIDIA(N卡)独立显卡。AMD/Intel显卡不支持CUDA加速,只能使用CPU。若为N卡,请确保已安装CUDA 12.8及以上版本、cuDNN 9.11及以上,并将CUDA的bin和lib目录加入系统环境变量Path。在软件语音转录(或视频翻译)...171.91**5 Posted at: 1 month ago -
#6862 折腾了2天,想知道为什么用qwen-tts内置的不能走gpu模式,显卡、cuda12.8等都装好了...
💬 1[Last reply:1 month ago] 从你提供的截图看,Qwen3-TTS(内置)渠道的 GPU 加速需要满足特定条件,最可能的原因是以下之一:未勾选 CUDA 加速:在主界面「设置更多参数」或「高级选项」中,需要显式勾选 CUDA 加速 复选框。默认状态下即使你有显卡,软件也不会自动启用 GPU。cuDNN 缺失或版本不匹配:Qwen3-TTS 基于 PyTorch 框架,它底层调用 CUDA 时 必须有 cuDNN 9.11 及以...103.99**1 Posted at: 1 month ago -
#6861 No transcription results returned. Please check the original audio/video or model and try again.Traceback (most recent call last):...
💬 1[Last reply:1 month ago] 这个错误表示语音识别阶段返回了空结果,核心原因是模型没有正确识别出音频中的语音,或音频无法被解析。结合你的日志,最可疑的是文件路径和文件名中含有特殊符号(°、空格、中文),可能导致 FFmpeg 无法正确读取视频文件。请按以下顺序逐一排查:修改路径和文件名(最可能的原因)将视频移动到浅层纯英文路径,例如 D:/test/galileo.mp4文件名中的 °(角度符号)、空格和中文字符全部去除重新导...2409**695 Posted at: 1 month ago -
#6859 pyvideotrans v3.59版本自动翻译时出现报错...
💬 3[Last reply:1 month ago] 暂无法确定具体原因。您提供的日志截断在“正在分离背景音乐 53.3%”处,真正的报错信息很可能在后续日志中。请先按以下步骤操作:升级软件至最新版 v4.11 —— v3.59 属于过旧版本,存在大量已修复的 Bug,且官方已停止维护。升级后重新执行任务,若仍报错,请提供 软件安装目录下 logs/ 文件夹中最新日期日志文件 的 末尾约30行完整内容(含报错文字)。另外,根据现有日志可初步排查:日志...104.238**6 Posted at: 1 month ago -
#3730 TaskCfgVTT(is_cuda=False, uuid='f6e0359f4e', cache_folder='D:/pyvideotrans/tmp/4808/f6e0359f4e', target_dir='D:/Program Files/Desktop/治療2/_video_out/How to release your pec minor w...
💬 1[Last reply:1 month ago] 翻译阶段出错是因为 Gemini AI 返回了空结果。这通常是由于网络问题、API密钥无效、请求内容触发安全策略或模型暂时不可用导致的。请按以下步骤排查和解决:检查网络代理:Gemini 服务在国内无法直接访问。请确保已在软件主界面的“网络代理地址”中填写了正确的代理地址(格式如 http://127.0.0.1:10808)。验证 API 密钥:前往 菜单 -> 翻译设置 -> Ge...103.108**1 Posted at: 6 months ago -
#1027 videotrans.configure._except.StopRetry: GPT-SoVITS error-1:{'message': 'prompt_lang: miqi is not supported in version v2'}...
💬 3[Last reply:1 month ago] 错误原因是 GPT-SoVITS 的 v2 版本 API 不支持你选择的语音角色 miqi。解决方案:在软件主界面,将“配音渠道”从“GPT-SoVITS”切换为其他渠道,例如“Edge-TTS(免费)”。如果必须使用 GPT-SoVITS,请确保你部署的 GPT-SoVITS 服务版本支持 miqi 这个语音角色。你可能需要更新或重新部署 GPT-SoVITS 服务端。在 GPT-SoVITS ...240e**fbf Posted at: 11 months ago -
#6857 我有中文短视频,时长约1分钟以内,它们是饰品的中国达人用中文讲解视频,带有中文硬字幕(烧录在上面的,无法直接删除)现在我需要将视频转成英文讲解,最好是跟原来的中国达人相同的音色,另外,带上英文字幕,且将中文字幕去除,后面我会发布到tikto......
💬 3[Last reply:1 month ago] 字幕翻译性价比最高推荐 DeepSeek:价格极低(可充值1元体验),翻译质量接近顶级大模型,尤其适合中→英。你已有的国内 AI 模型若兼容 OpenAI 接口格式,也可通过“兼容 AI/本地模型”渠道接入。具体操作:打开软件顶部菜单 → 翻译设置,找到 DeepSeek 或 兼容AI/本地模型。填入你的 API Key 与 API 地址(本地部署则填 http://127.0.0.1:端口,云端...113.104**6 Posted at: 1 month ago -
#6858 {"detail":"Method Not Allowed"}self.api_url='http://127.0.0.1:9874':{'text': '你好啊,我亲爱的朋友,希望你的每一天都是美好愉快的!', 'role': 'nver......
💬 1[Last reply:1 month ago] 该报错 {"detail":"Method Not Allowed"} 表明 pyVideoTrans 向 GPT-SoVITS 发送的请求方式或请求路径不被对方服务接受,通常与 GPT-SoVITS 的 API 地址、端口或 API 版本配置不匹配有关。排查步骤确认填写的地址是 API 地址,而非 WebUI 地址 GPT-SoVITS 的 API 接口...104.28**9 Posted at: 1 month ago -
#6855 pyvideotrans解压后打开sp.exe报错软件版本号:win-pyvideotrans-v4.11部署路径:报错内容:系统版本:...
💬 13[Last reply:1 month ago] 报错 ImportError: DLL load failed while importing QtWidgets: 找不到指定的程序 表明 PySide6 的底层 Qt 库依赖的系统组件无法加载。安装 VC++ 运行库后仍报此错,结合你之前提供的系统版本截图,根本原因基本锁定为 操作系统版本过旧(Windows Server 2016 或早期 Win10 内核),该版本缺失 PySide6 所需...104.238**6 Posted at: 1 month ago -
#6856 必须选择视频文件=system:Windows-10-10.0.22000-SP0version:v4.11frozen:Truelanguage:zhroot_dir:E:/Video translation...
💬 1[Last reply:1 month ago] 这是由于未正确选择或未识别到输入视频文件所致。您在点击「开始执行」时,软件没有获取到有效的视频文件。解决方案:点击主界面左上角「选择音频或视频」按钮,明确选择需要翻译的视频文件(支持 mp4/mkv/avi/mov/wav/mp3 等格式)。注意您的文件路径 E:/Video translation 中包含空格。虽然部分场景下支持,但极易引发底层解析异常。建议将视频文件重命名为纯英文、无空格、无特...120.229**7 Posted at: 1 month ago -
#6854 Parameter `lang_choice` is not a valid key-word argument. Please click on 'view API' in the footer of the Gradio app to see usage.:{'text': '你好啊,我亲爱的朋友,希望你的每一天都是美好愉快的!', 'role': 'c...
💬 1[Last reply:1 month ago] 核心原因:gradio_api.txt 中配置了 lang_choice=ZH,但你所连接的 Gradio TTS 服务实际接口不接受这个参数名,导致请求被拒绝。解决方案:打开该 TTS 服务的 WebUI 页面,滚动到底部点击 “Use via API”(或“通过API使用”),找到实际生成克隆语音的接口端点。对照 API 文档,查看该接口是否真的有 lang_choice 参数。若没有,请将其...104.28**4 Posted at: 1 month ago -
#6853 自动下载模型失败,你可以点击【查看帮助教程】了解如何手动下 Traceback (most recent call last):File "httpx\_transports\default.py",line 101, in map_htt......
💬 1[Last reply:1 month ago] 这是自动下载模型时无法连接到模型仓库(如 huggingface.co)导致的网络请求失败,常见于国内网络环境或代理设置不当。解决办法:检查网络环境:若在国内,建议开启科学上网代理,或使用稳定的网络。若已开启代理,请确认软件内的代理设置正确(菜单 → 工具/选项 → 网络代理),格式如 http://127.0.0.1:端口号。若自动下载仍失败,请直接手动下载模型文件并放置到对应目录。每个渠道的模...211.20**6 Posted at: 1 month ago
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.