-
#6106 Subprocess Error: Unrecognized configuration class <class 'NoneType'> for this kind of AutoModel: AutoModel.Model type should be one of AfmoeConfig, Aimv2Config, Aimv2VisionConfig,...
💬 1[Last reply:16 minutes ago] 该错误是由于 OmniVoice 本地模型文件缺失、损坏或未被正确识别导致的。AutoModel 在加载时未能找到正确的配置类,通常意味着模型目录不完整或 Hugging Face 缓存异常。解决方案:检查 软件目录/models/models--k2-fsa--OmniVoice 文件夹是否存在且不为空。如果缺失,请手动下载模型:下载地址:https://huggingface.co/k2-fs...2a09:bac5* Posted at: 16 minutes ago -
#6105 自动下载模型失败,你可以点击 【查看帮助教程】 了解如何手动下载...
💬 1[Last reply:53 minutes ago] 模型下载因网络中断失败(已下载187MB,但完整包约1.3GB),这是典型的不稳定网络导致传输中断。解决方案手动下载 F5-TTS 模型文件前往官方模型地址:https://huggingface.co/SWivid/F5-TTS/tree/main/F5TTS_v1_Base下载该目录下 所有文件(注意不要遗漏)将下载的所有文件放入以下文件夹(如无则创建):软件安装目录/models/model...120.244* Posted at: 54 minutes ago -
#6104 翻译字幕阶段出错 [小米] [xiaomi] 无法连接到 https://api.xiaomimimo.com/v1/,可能当前网络不可访问该API, 若是本地服务,请确认已部署并启动Connection error....
💬 1[Last reply:4 hours ago] 此错误是因为您设置了网络代理(http://127.0.0.1:7897)连接到小米AI翻译API时,代理与目标服务器之间的TLS握手失败(EOF occurred in violation of protocol)。小米AI(api.xiaomimimo.com)属于国内服务,无需代理即可直连。开启代理可能干扰SSL连接。解决办法在主界面第5行的「网络代理」文本框中清空所有内容,确保不填写任何代...221.233* Posted at: 4 hours ago -
#6103 语音识别阶段出错[Qwen-ASR(本地内置)] Subprocess Error: Could not read model from C:\Users\86159\Desktop\提取字幕\_internal\nagisa/data/nagisa_v001.modelTraceback (most recent call last):...
💬 1[Last reply:6 hours ago] Could not read model from .../nagisa/data/nagisa_v001.model 表示 Qwen-ASR 内部依赖的日语分词模型文件缺失或损坏,这通常是由于软件解压路径包含中文字符“提取字幕”导致底层文件读取异常,或是打包版遗漏了该组件。解决方案更换语音识别渠道(推荐) 在主界面将语音识别改为 faster-whisper(本地内置),选择 large-v3...112.22* Posted at: 6 hours ago -
#6102 我现在暂停了任务 想更换一个tts模型继续 但是继续后还是原先设定的模型...
💬 3[Last reply:6 hours ago] 任务配置在点击“开始”时一次性锁定并传递给后台工作线程,暂停只是临时挂起线程,不会重新读取界面上的新设置,因此继续后仍使用旧模型。 如需更换 TTS 模型,请先点击停止彻底结束当前任务,然后修改主界面上的配音渠道/角色,再重新点击开始启动新任务。请查阅相关文档:视频翻译流程参数详解(任务配置在开始时锁定)...240e:36d* Posted at: 6 hours ago -
#6101 <urlopen error [WinError 10061] 由于目标计算机积极拒绝,无法连接。>:Traceback (most recent call last): File...
💬 1[Last reply:7 hours ago] 这是由于配置的代理服务器 http://localhost:15236 无法连接,导致 openai-whisper 下载模型文件被拒绝。请按以下步骤排查:清空代理:在主界面「网络代理」文本框删除所有内容(留空),保存后重试。如果无需代理访问国外资源,直接使用直连即可。检查代理服务:如果确实需要代理,请确保 localhost:15236 对应的代理软件(如 Clash/V2Ray)已启动且运行正...2409:8a1a* Posted at: 7 hours ago -
#6100 You exceeded your current quota, please check your plan and billing details. For more information on this error, head to: https://ai.google.dev/gemini-api/docs/rate-limits. To moni...
💬 1[Last reply:10 hours ago] The error is caused by the Gemini API free tier quota being exhausted. The free tier limits you to 20 requests per day per model (gemini-3.6-flash in your case). You are using Gemini for both ASR and ...58.97* Posted at: 10 hours ago -
#6099 本地部署的模型翻译慢 cpu和内存只能跑到百分之20多...
💬 1[Last reply:11 hours ago] 本地部署的模型(如 M2M100、Hy-MT2)在翻译时 CPU/内存利用率低、速度慢,主要因为软件默认将翻译线程锁死为 1,且单批次处理字幕量较小,导致无法充分利用多核资源。解决方案增加并发任务数(需重启软件生效) 打开 菜单 → 工具/选项 → 高级选项 → 通用设置,将 CPU 同时任务数 改大(建议设为 CPU 物理核心数的一半,如 4 核设为 2),保存后关闭软件重开。提高每批字幕行数...221.233* Posted at: 11 hours ago -
#6084 我勾选了说话人识别,并设置了人数为3,但是在日语视频里语音提取后的字幕里说话人都是默认角色,英语就能识别,怎么办...
💬 31[Last reply:12 hours ago] 已确认您提供的两个链接均不可用。当前最稳定、最直接的方案是:彻底放弃 pyannote,改用 Ali CAM++(阿里说话人分离模型)。该模型从国内镜像站 modelscope 自动下载,无需手动处理,支持包括日语在内的多语言。操作步骤如下:1. 删除之前下载的 pyannote 文件夹:删除 H:\pyvideotrans\models\models--pyannote--speaker-dia...240e:39c* Posted at: 18 hours ago -
#6098 'tuple' object has no attribute 'get'[字节语音大模型极速版, 微软(免费), Elevenlabs.io]Traceback (most recent call last):...
💬 1[Last reply:13 hours ago] 该错误是软件内部 bug,发生在多目标语言翻译 + 启用“视频慢速”时,align 阶段数据类型处理异常。解决方案升级到最新版 v4.07:此问题在后续版本中已修复,请从官网下载完整版补丁包覆盖。临时规避:若暂时无法升级,在主界面取消勾选“视频慢速”,仅保留“音频加速”;或避免使用“多目标语言序列”功能(即一次只翻译一种目标语言)。清理缓存:升级后,若仍报错,请勾选主界面“清理已生成”后再重新处理...2409:8a70* Posted at: 13 hours ago -
#6097 ('Connection aborted.', ConnectionResetError(10054, '远程主机强迫关闭了一个现有的连接。', None, 10054, None))[字节语音大模型极速版, Google(免费), Elevenlabs.io]Traceback (most recent call last):...
💬 1[Last reply:13 hours ago] 这是 Microsoft 翻译服务(_microsoft.py)连接被远程服务器强制断开导致的网络错误。尽管你选择了 Google 翻译,但 Google 失败后软件自动回退到了 Microsoft 翻译,而 Microsoft 翻译的请求因网络波动或触发频率限制被中断。解决方法:检查网络稳定性:确保当前网络能够正常访问 api.cognitive.microsofttranslator.com。...2408:8471* Posted at: 13 hours ago -
#6096 :Traceback (most recent call last): File...
💬 1[Last reply:13 hours ago] FailedOperation.UserNotRegistered 表明腾讯云翻译服务尚未开通。请按以下步骤操作:登录 腾讯云控制台,进入机器翻译产品页面。点击“开通服务”,按指引完成实名认证并开通 TMT(机器翻译)服务。回到 pyVideoTrans,在 菜单 → 翻译设置 → 腾讯翻译 中确认 SecretId 和 SecretKey 已正确填写,且余额充足。完成后重启翻译任务即可。...2408:8471* Posted at: 13 hours ago -
#6095 ('Connection aborted.', ConnectionResetError(10054, '远程主机强迫关闭了一个现有的连接。', None, 10054, None))[字节语音大模型极速版, Google(免费), Elevenlabs.io]Traceback (most recent call last):...
💬 1[Last reply:13 hours ago] 这是由于网络连接被微软翻译服务强制中断导致的,通常是因为短时间内请求过于频繁触发了限流。打开 菜单 → 工具/选项 → 高级选项 → 字幕翻译调整。将 传统翻译渠道每批字幕行数 降低为 1-3。将 翻译后暂停秒 设置为 5-10 秒。如果还使用了多目标语言翻译,在高级选项中关闭多任务并行,设为串行。请查阅相关文档:Microsoft翻译使用说明...2408:8471* Posted at: 13 hours ago -
#6094 Expected parameter logits (Tensor of shape (1, 51866)) of distribution Categorical(logits: torch.Size([1, 51866])) to satisfy the constraint IndependentConstraint(Real(), 1), but f...
💬 1[Last reply:14 hours ago] 这个报错是由于显存不足或模型/音频数据异常导致 openai-whisper 在推理时产生了 NaN 值(logits 全部为 NaN)。请按以下步骤依次排查:降低模型尺寸:当前使用 large-v3 需要至少 10GB 以上显存。请切换到 medium 或 small 模型,或改用 faster-whisper 渠道的 large-v3(更省显存)。关闭 GPU 加速测试:取消勾选 CUDA 加...240e:341* Posted at: 14 hours ago -
#6093 语音阈值和非语音阈值多少合适?...
💬 1[Last reply:16 hours ago] 语音阈值控制VAD判定语音的灵敏性,推荐默认值 0.5。调低(如0.2)会更灵敏但易把噪音误判为语音,调高(如0.8)则相反。 非语音阈值控制对静音/噪音的判断,建议也默认 0.5,调低可减少文本“幻觉”但可能漏掉部分有效语音。 如果需要进一步细化,请根据实际转录结果微调:若识别出的字幕含有大量噪音文字,可适当提高语音阈值/降低非语音阈值;若字幕缺漏严重,则反向调整。 由于这两个数值高度依赖...210.79* Posted at: 16 hours ago -
#6092 VAD选tenvad还是silero?...
💬 1[Last reply:16 hours ago] VAD 的选择取决于你的场景:推荐优先使用 Silero-VAD,它基于深度学习,对语音边界的判断更精准,尤其适合背景噪声较大或需要高质量的语音识别场景。如果你对处理速度要求极高且硬件资源有限(如纯 CPU 环境),可尝试 WebRTC VAD(你提到的“tenvad”可能是指 WebRTC VAD),它更快但精度略低。 两种 VAD 均可在「菜单→工具→高级选项→语音识别参数」中切换,建议先使...210.79* Posted at: 16 hours ago -
#6091 生成出来的字幕文件,时间轴错乱(比如 字幕生成到00:13:29后,又突然跳到 00:00:00),这是什么 原因?...
💬 1[Last reply:16 hours ago] 这种时间轴跳跃通常是原始视频的音频流存在多轨或异常导致的,例如视频包含多个音频轨道、合并片段时的时间戳不连续,或语音识别(VAD)在切片时遇到了非标准音频格式,导致生成的字幕时间戳被重置。请先确认以下 3 点:检查视频音频流:用播放器或 ffprobe 查看视频是否含有多个音频轨道,只保留一个主音轨。关闭“清理已生成”:如果之前生成过缓存,建议勾选主界面的“清理已生成”重新处理,避免旧的错误缓存干...220.203* Posted at: 16 hours ago -
#6090 The supported API model names are deepseek-v4-pro or deepseek-v4-flash, but you passed deepseek-chat.https://api.deepsee......
💬 1[Last reply:16 hours ago] 错误原因:你在 DeepSeek 翻译渠道配置中使用了旧的模型名称 deepseek-chat,而当前软件支持的 DeepSeek 模型为 deepseek-v4-pro 或 deepseek-v4-flash。解决方法:打开软件,点击顶部菜单 翻译设置 → 选择 DeepSeek 渠道。在模型名称(Model)输入框中,将 deepseek-chat 改为 deepseek-v4-pro 或 d...210.79* Posted at: 16 hours ago -
#6089 下载仓库里的Distil-Large-V3.5-CT2有很多文件,怎么直接下载到一个文件夹下?...
💬 1[Last reply:17 hours ago] 这是 Distil-Large-V3.5-CT2 模型(用于 faster-whisper 语音识别),需要手动下载到 软件目录/models/models--distil-whisper--distil-large-v3.5-ct2/ 文件夹。请按照以下步骤操作:打开 Hugging Face 仓库页面:https://huggingface.co/distil-whisper/distil-l...210.79* Posted at: 17 hours ago -
#6088 如果要卸载软件,重新安装新版本,如何保留原来的设置?只能重新一个一个设置吗?...
💬 1[Last reply:17 hours ago] 解决方案只需备份并恢复配置文件即可保留所有设置,无需重新逐个配置。操作步骤:备份配置文件: 在卸载旧版本前,找到软件安装目录下的 videotrans/ 文件夹,复制 以下两个核心 JSON 文件到安全位置(如桌面):params.json(保存 API 密钥、偏好设置等)cfg.json(保存高级选项等)卸载旧版本(直接删除整个软件目录即可,无注册表残留)。安装新版本: 下载完整包并解压到同...210.79* Posted at: 17 hours ago
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.