-
#7133 语音识别阶段出错[faster-whisper(内置)] No human voice detected. Please confirm that human speech is present in the original file. [info.duration_after_vad=0.0s]._kw={'beam_size': 5, 'best_of...
💬 1[Last reply:58 minutes ago] 该报错是因为输入文件为 instrument.wav(背景伴奏,无人声),VAD 检测后语音时长为 0,因此无法进行语音识别。解决步骤:确认待翻译文件应包含清晰的人声。如果此文件是本地分离出的伴奏文件,请改用对应的人声文件 vocal.wav,或直接使用原始视频/音频文件,不要使用 instrument.wav。若你希望通过分离后的文件进行翻译,需确保人声文件 vocal.wav 与伴奏文件 in...2a09**81 Posted at: 58 minutes ago -
#7132 语音识别阶段出错[faster-whisper(内置)] Unable to allocate 1.33 GiB for an array with shape (1, 444787, 400) and data type float64:Traceback (most recent call last): File...
💬 1[Last reply:1 hour ago] 这是显存或内存不足导致的记忆体分配失败,常见于使用了 large-v3-turbo 大模型且显卡显存不够,或计算数据类型占用过高。请依次尝试以下操作:降低模型尺寸:在语音识别渠道中将模型从 large-v3-turbo 改为 medium 或 small。large-v3 系列基础运行需要约 6-8GB 显存。调整计算数据类型:进入 菜单 → 工具 → 高级选项 → 语音识别参数,将 计算数据类型...103.144**0 Posted at: 1 hour ago -
#7131 选择LLM纠正错误,使用DeepSeek渠道,但未填写密钥SK.可在菜单-工具/选项-高级选项-LLM纠错渠道中切换...
💬 1[Last reply:1 hour ago] 这是由于在 高级选项-通用设置-LLM纠错所用AI渠道 中选择了 DeepSeek,但未在软件中配置 DeepSeek 的 API 密钥(SK)所致。LLM 纠错功能默认使用 DeepSeek 渠道,必须先填写密钥才能调用。解决方案:前往 DeepSeek 开放平台 (https://platform.deepseek.com/) 注册并获取 API Key(可自定义充值,最低 1 元)。打开软件...223.152**3 Posted at: 1 hour ago -
#7130 语音识别阶段出错[faster-whisper(内置)] mkl_malloc: failed to allocate memory,Traceback (most recent call last): File...
💬 1[Last reply:1 hour ago] 该报错 mkl_malloc: failed to allocate memory 的根源是 内存分配失败,通常由以下两种原因之一引起:GPU 显存不足:你已启用 CUDA 加速,且使用的是 faster-whisper 的 large-v3-turbo 模型,该模型本身需要约 6GB 显存,如果显存不足或已被其他程序占用,就会报此错。系统内存(RAM)不足:即使使用 CUDA,faster-wh...103.144**0 Posted at: 1 hour ago -
#7129 Proxy configuration issue, check settings or disable proxyTraceback (most recent call last):...
💬 1[Last reply:1 hour ago] 核心原因:你配置的代理地址 http://127.0.0.1:7897 无法连接。WinError 10061 表示目标计算机主动拒绝连接,即 127.0.0.1:7897 端口上没有正在运行的代理服务(代理软件未启动,或端口号填写错误)。解决方案:不需要代理时:在主界面「对齐控制」行右侧的「网络代理」文本框中,将 http://127.0.0.1:7897 清空,保存后重新执行任务。确实需要代理...206.237**5 Posted at: 1 hour ago -
#7128 语音识别阶段出错[faster-whisper(内置)] Unable to open file 'model.bin' in model 'D:/Software/pyvideotrans/models/models--mobiuslabsgmbh--faster-whisper-large-v3-turbo',Traceback (most recent...
💬 1[Last reply:1 hour ago] 这是模型文件缺失或损坏导致的,具体是 faster-whisper-large-v3-turbo 的 model.bin 未能正常写入或下载不完整,软件无法打开该文件。解决方案:先确认网络:你设置了代理 http://127.0.0.1:7897,请确保代理软件已开启且端口正确。模型下载需要科学上网,或使用国内镜像(软件会自动尝试 hf-mirror.com)。删除损坏目录:删除 D:/Softw...15.164**9 Posted at: 1 hour ago -
#7125 v4.12 语音识别的默认参数是最优的吗...
💬 5[Last reply:2 hours ago] 这是 v4.12 当前的界面设计,开始/结束时间以秒数(如 12.34)显示,并非报错。调整方式如下:双击单元格可直接手动输入秒数;右键单元格可“开始/结束时间减小或增大0.1s”进行微调;若想精确定位偏移,可点击该行播放按钮观看对应画面。若你觉得不直观,也可在阶段一或阶段二的字幕编辑窗口中使用“打开字幕文件夹”,用第三方字幕编辑器(如 Subtitle Edit)修改字幕时间轴后再继续。此反馈已...141.11**2 Posted at: 3 hours ago -
#7127 Faster-whisper [1] めっちゃ可愛いじゃん 性格悪くて騙されまくるやんって俺やらせてくれるやつって会うでしょ?で会って金取られてバイバイ えぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇぇ......
💬 3[Last reply:3 hours ago] 你当前设的 VAD 参数组合(语音阈值0.3、非语音阈值0.4)容易让过多碎片被误判为语音,Whisper 会在这些无效/噪声片段上产生幻觉式的重复输出。请按以下方式调整:将“语音阈值”调高到 0.5~0.6,减少噪声被当成语音。将“非语音阈值”调低到 0.2~0.3,且必须小于语音阈值,否则判断逻辑会混乱。勾选主界面的“降噪”或“分离人声背景声”,排除背景干扰再识别。模型建议改为 large-v...139.202**7 Posted at: 3 hours ago -
#7126 [Clone-Voice] 该渠道需另行部署并启动后可用self.api_url='http://127.0.0.1:9988'...
💬 1[Last reply:3 hours ago] 核心原因:Clone-Voice 是本地 API 配音渠道,需你在本机单独部署并启动该服务,软件只是通过 http://127.0.0.1:9988 调用它。当前该服务未启动,所以报错“目标计算机积极拒绝”。解决方案:检查你是否已经安装并运行了 Clone-Voice 服务,确保其监听在 127.0.0.1:9988(可在浏览器打开该地址验证)。若你不需要使用 Clone-Voice,请直接在主界...82.26**7 Posted at: 3 hours ago -
#7124 文件不存在:D:/tmp/11284/8c90c331db/silence_gap_0.wavTraceback (most recent call last):...
💬 1[Last reply:4 hours ago] 这是临时工作目录中的静音文件未能生成导致的。排查建议:关闭所有其他 pyVideoTrans 实例。多实例共享同一个 tmp 临时文件夹,任一实例关闭时都可能清空该文件夹,导致另一个实例正在等待的 silence_gap_0.wav 被误删。检查磁盘空间。临时目录 D:/tmp 所在磁盘空间是否不足,若不足将无法生成任何文件。手动清理残留。关闭软件后,进入 D:/tmp 文件夹,将与本任务相关的临...152.32**9 Posted at: 4 hours ago -
#7123 IMG_0154.MP4没有识别出字幕,请检查:【1】是否包含人类说话声,【2】说话语言是否和所选发音语言一致,【3】所选渠道是否支持该发音语言Traceback (most recent call last):...
💬 1[Last reply:6 hours ago] 这是由于所选语音识别渠道不支持英语导致的。FireRed中文(内置) 渠道仅支持中文及20余种中文方言,不支持英语,因此无法识别英语发音,所以报错“没有识别出字幕”。解决方案:更换语音识别渠道。对于英语视频,请将语音识别渠道改为faster-whisper(内置)(默认推荐)或openai-whisper(内置)等支持英语的渠道。模型建议选择large-v3-turbo或large-v3。确认视频...39.129**1 Posted at: 6 hours ago -
#7122 Unable to open file 'model.bin' in model 'D:/Program Files (x86)/sp4.12/models/models--mobiuslabsgmbh--faster-whisper-large-v3-turbo',Traceback (most recent call last): File...
💬 1[Last reply:6 hours ago] 模型文件 model.bin 缺失或损坏,这通常是由于首次使用时自动下载模型未成功或不完整导致的。解决方案:彻底删除模型文件夹 D:/Program Files (x86)/sp4.12/models/models--mobiuslabsgmbh--faster-whisper-large-v3-turbo;重新运行软件,让其自动重新下载模型;若自动下载仍失败,请手动前往 https://hugg...141.11**2 Posted at: 6 hours ago -
#7121 No audio file was generated during the listening test.:{'text': 'नमस्ते, मेरे प्यारे दोस्त, मुझे आशा है कि आपका हर दिन सुंदर और सुखद हो!', 'rate': '+0%', 'role': 'Madhur(Male/IN)',...
💬 5[Last reply:11 hours ago] The brew formula opengrm-thrax does not exist. For pynini, you need OpenFST:brew install openfstThen rerun:cd "/Users/kumarprashant/Local Files/pyvideotrans" uv syncHowever, the pynini compi...103.206**8 Posted at: 11 hours ago -
#7120 shape '[1, 4138, 1, 32, 2]' is invalid for input of size 262144,Traceback (most recent call last): File...
💬 1[Last reply:14 hours ago] This error is caused by a tensor shape mismatch inside the Confucius-TTS model's rotary embedding layer, typically triggered when the reference audio used for voice cloning is too long or the input se...188.192**8 Posted at: 14 hours ago -
#7119 GPT-SoVITS-v2pro-20250604 下载链接...
💬 1[Last reply:18 hours ago] 暂无法提供该特定版本的下载链接。知识库中未收录 GPT-SoVITS-v2pro-20250604 的官方下载地址。建议:前往 GPT-SoVITS 官方 GitHub 仓库(https://github.com/RVC-Boss/GPT-SoVITS)查看 Release 页面。或参考 pyVideoTrans 的 GPT-SoVITS 接入文档获取配置说明。请查阅相关文档:GPT-SoVITS...188.253**4 Posted at: 18 hours ago -
#7118 视频中有多个角色,类似演讲、电视剧这类的视频,每个角色说的话都要克隆音色,即一钟角色的讲话对应一种音,现在也有对应的字幕,需要怎么做...
💬 1[Last reply:19 hours ago] 核心原因:多角色克隆音色必须启用“说话人分离”,并在“单视频交互模式”下为每个说话人指定 clone 配音角色。如果直接用已有字幕跳过语音识别,则无法进行说话人分离,也就无法自动区分角色。操作步骤:在“翻译视频”界面选择单个视频文件(必须单视频,才会弹出交互编辑窗口)。展开“设置更多参数”,勾选 识别说话人,并设置 最大说话人 数量(≥实际角色数)。不要把已有字幕放入 _video_out 目录,...123.115**0 Posted at: 19 hours ago -
#7117 自动下载模型失败,你可以点击 【查看帮助教程】 了解如何手动下载...
💬 1[Last reply:19 hours ago] 这是模型下载中断导致的。你使用的 biodatlab/whisper-th-large-v3 模型完整大小约 3.2GB,但网络连接在下载到 2.2GB 时就断开了,只下载了一部分。解决步骤:删除不完整的模型文件 删除 D:/BaiduNetdiskDownload/win-pyvideotrans-v4.12/models/models--biodatlab--whisper-th-large...18.162**8 Posted at: 19 hours ago -
#7116 mkl_malloc: failed to allocate memory:Traceback (most recent call last): File...
💬 1[Last reply:1 day ago] 这是系统内存(物理内存或虚拟内存)不足导致的分配失败。你当前使用 faster-whisper(内置) + large-v3-turbo 模型,且未启用 CUDA 加速,纯 CPU 运行,内存消耗较高。错误发生在语音识别的 restore_speech_timestamps(时间戳恢复)阶段,此时一次性加载了较大音频片段。建议操作(按优先级排序)降低模型尺寸 将语音识别模型从 large-v3-...129.153**1 Posted at: 1 day ago -
#7115 没有Nvidia的显卡,只有Intel 的集显Arc 130v, 如何用它加速?...
💬 1[Last reply:1 day ago] Intel 集显无法用于 CUDA 加速。pyVideoTrans 的 GPU 加速仅支持 NVIDIA(N卡),AMD 或 Intel 显卡均不支持 CUDA 加速,因此 Arc 130v 无法用于加速。若你有 AMD 显卡,可尝试源码部署后使用 Whisper.net 渠道(仅限 Windows,支持 Vulkan 加速),但 Intel 核显无对应方案。建议使用 CPU 运行,或更换 NVI...129.153**1 Posted at: 1 day ago -
#7114 最新的4.12版本语音识别,切分更好一些吗?我用的是0.8版本,感觉英语切得断句很多,翻译过来后,没法听...
💬 5[Last reply:1 day ago] v4.12 相比 0.8 版本更新幅度较大,主要涉及语音识别切分算法、LLM 纠错逻辑、二次识别模型固定、修复多个 bug 等。其中与您当前痛点(英语断句碎)直接相关的是:优化了 VAD 切分算法,并将“LLM 重新断句”调整为“LLM 纠错”,只修正错别字和恢复标点,不再重新断句。这可能让字幕更符合原意,翻译后配音更连贯。另外,二次识别固定使用 faster-whisper 的 large-v3...2a14**38b Posted at: 1 day ago
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.