#6892 如果是英语和捷克语.需要精准的视频转字幕~ 应该用什么模型呢 显卡是2060S

171.91.**5 Posted at: 1 hour ago

如果是英语和捷克语.需要精准的视频转字幕~ 应该用什么模型呢 显卡是2060S

55 Replies

#1 DeepSeek reply at 1 hour ago

英语和捷克语均属于常见语种,建议使用 faster-whisper(内置) 的 large-v3-turbo 模型,并开启 CUDA 加速。该模型对多语言(含捷克语)识别精度高,显存需求约 6GB,你的 RTX 2060S(8GB 显存)可以胜任。

如需最高精度,可尝试 large-v3,但显存需求约 8GB,可能接近满负荷,若遇报错可降回 large-v3-turbo

操作步骤:

  1. 主界面语音识别渠道选择 faster-whisper(内置)
  2. 模型选择 large-v3-turbo
  3. 发音语言若不确定可不选自动检测(仅在“语音转录”面板可用自动检测),视频翻译功能中请明确选择英语或捷克语
  4. 确保已配置 CUDA 12.8 和 cuDNN 9.x,并勾选 CUDA 加速

请查阅相关文档:

#2 171.91.**5 reply at 1 hour ago

这里面这么多模型 语音识别里面的模型 可以介绍一下用法吗

#3 DeepSeek reply at 1 hour ago

视频翻译中语音识别渠道的选择,核心依据是视频中的语言、精度需求、显存和是否联网。下面按类别说明各模型用法:


一、本地离线识别(免费,首次使用需下载模型,支持 N 卡 GPU 加速)

渠道用法与适用场景
faster-whisper(内置)默认推荐。模型选择:tiny 最快精度最低,large-v3-turbo 速度与精度兼顾,large-v3 精度最高但最慢。支持所有内置语言,英语/捷克语选 large-v3-turbo 即可。
openai-whisper(内置)与 faster-whisper 类似,准确度略高但速度较慢,适合追求极致精度的场景。模型同样从 tinylarge-v3-turbo
Whisper.cpp(Win内置)仅 Windows 预打包版内置,速度快,适合低显存机器。模型需放在 models 目录下。
Qwen-ASR(内置)中文效果佳,也支持多语言,适合中文视频。
FunASR(内置)中文优化,推荐中文视频批量转录。
Firered中文(内置)仅支持中文及20个中文方言。
Dolphin(内置)支持40多亚洲语言及20中文方言。
Omnilingual(内置)支持1600多种语言,适合极小众语种。
parakeet日语(内置)仅日语专用。
Huggingface_ASR(内置)内置多个专业语音模型,如 zai-org/GLM-ASR-Nano-2512(中文粤语佳)、nvidia/parakeet-ctc-1.1b(英语)等,按需选择。
Moss-Diarize(内置)能同时输出说话人标签,适合需要区分说话人的场景。

使用方法

  1. 主界面“语音识别”行选择渠道(如 faster-whisper)和模型。
  2. 发音语言必须明确选择(如英语选 en,捷克语可查代码,若不确定,可先在左侧“语音转录”面板用“自动检测”试转一次,看识别出的语言代码是什么)。
  3. 若模型下载失败,可手动下载后放入 软件目录/models 文件夹,具体见文末文档。

二、在线识别(需联网,需自备 API Key,部分免费/收费)

渠道用法
OpenAI 语音识别 API效果优秀,需 SK 密钥,填入菜单“翻译设置-OpenAI”中。适合小语种或多语言混合。
阿里百炼 Qwen3-ASR中文效果佳,需开通阿里百炼平台并配置。
字节语音识别大模型极速版中文极佳,需在字节火山引擎开通。
Gemini AI小语种能力强,需科学上网。
Deepgram.com需注册 API Key。
Elevenlabs.io / 302.AI需各自平台账号,免费版限制严格。

用法:在“语音识别”渠道下拉中选择对应项,然后在“菜单-翻译设置”中填入 API Key 即可。需注意网络代理和频率限制。


三、高级自定义(本地 API 部署)

渠道用法
WhisperX / Parakeet-tdt / STT(本地API)需自行部署成服务,然后在软件中填入 API 地址。适合有技术基础、需要定制化的用户。
Whisper.NET支持 AMD 显卡加速,仅源码部署可用,需按文档安装。

针对你的英语+捷克语视频

推荐直接用 faster-whisper(内置) + large-v3-turbo + CUDA 加速

  • RTX 2060S 显存 8GB,运行 large-v3-turbo(约6GB显存)没问题,速度与精度均衡。
  • 如果遇到显存不足,退回 medium 或关闭 CUDA 启用 CPU(速度会慢很多)。
  • 主界面记得勾选 CUDA加速,并在高级选项-语音识别参数中将“计算数据类型”设为 float16(GPU 最合适)。

请查阅相关文档:

#4 171.91.**5 reply at 1 hour ago

kotoba-whisper-v2.0 为什么只有这个版本 我记得已经更新到了2.1 2.2版本~为什么没有呢

#5 DeepSeek reply at 1 hour ago

软件当前版本(v4.11)内置的 Huggingface_ASR 渠道模型列表中只收录了 kotoba-tech/kotoba-whisper-v2.0,并未加入 v2.1/v2.2。这通常是因为内置列表仅包含经过官方测试、验证稳定的版本,并非所有 Huggingface 上的模型都会被自动收录。

若你确认需要 v2.1/v2.2 版本,可尝试另法:

  1. 到 Huggingface 手动下载对应模型文件,放到软件目录下 models/models--kotoba-tech--kotoba-whisper-v2.0 文件夹(或新建对应模型名目录)。但注意:软件未对该版本做适配,大概率无法识别或使用,只能等官方后续版本更新收录。
  2. 直接改用其他日语识别渠道,效果同样优秀且稳定,如 parakeet日语(内置)openai-whisper(内置) + large-v3

建议先用当前内置的 kotoba-whisper-v2.0 测试,若精度不达标再更换渠道。

请查阅相关文档:

#6 171.91.**5 reply at 1 hour ago

parakeet日语(内置) 只能用CPU处理!

#7 DeepSeek reply at 1 hour ago

parakeet日语(内置) 渠道目前确实只支持纯 CPU 处理,软件没有为它提供 GPU(CUDA)加速路径。这是因为该模型并未针对 CUDA 做额外适配,属于纯 CPU 推理实现。如果你希望用 GPU 加速日语识别,建议改用:faster-whisper(内置) + large-v3-turbo 或 openai-whisper(内置) + large-v3。两者均支持 CUDA,且你的 RTX 2060S 8GB 显存可流畅运行 large-v3-turbo。操作时在主界面勾选“CUDA加速”,并在高级选项-语音识别参数中将“计算数据类型”设为 float16。若仍坚持使用 parakeet日语,则只能接受 CPU 模式,处理速度会明显偏慢。请查阅相关文档:Parakeet-tdt语音识别faster-whisper本地

#8 171.91.**5 reply at 1 hour ago

什么时候添加呢

#9 DeepSeek reply at 1 hour ago

目前无法确定具体添加时间。软件是免费开源项目,所有功能更新由开发者根据项目规划和空闲时间决定,官方并未公布该渠道的 GPU 加速支持时间表。若你的日语视频急需 GPU 加速,请直接改用 faster-whisper(内置) 或 openai-whisper(内置) + large-v3-turbo,两者均已支持 CUDA,且效果稳定。可关注官方文档站更新日志或 GitHub Releases 页面,一旦有新版本会在此类渠道中标注。

请查阅相关文档:

#10 171.91.**5 reply at 1 hour ago

在语音转录内 降噪是用CPU处理的吗? 我的CPU是10400F 每次都很慢 怎么办?

#11 DeepSeek reply at 1 hour ago

降噪和人声背景分离在软件中均为纯 CPU 计算,不提供 GPU 加速,因此你的 i5-10400F 处理较大视频时会明显较慢。可按以下方案优化:1. 调高线程数:进入菜单 → 工具/选项 → 高级选项 → 通用设置 → 将“人声背景分离线程数”调大(如设为 4~8),充分利用 CPU 多核。2. 若降噪非必须,取消勾选“降噪”,仅保留“分离人声背景声”或两者都不勾,直接让识别引擎处理,可显著加速。3. 若必须降噪,建议先用第三方 GPU 工具(如 UVR5)在 GPU 上分离好 vocal.wav 和 instrument.wav,再按“导入外部人声和背景声”的方法放入输出目录,软件会跳过内部 CPU 分离流程。具体步骤:将文件重命名为 vocal.wav 和 instrument.wav,放入 _video_out/视频名-格式/ 文件夹,并在主界面勾选“分离人声背景声”和“重新嵌入背景”,同时不要勾选“清理已生成”。请查阅相关文档:导入本地已有的人声和背景声

#12 171.91.**5 reply at 1 hour ago

6核12线程、主频2.9GHz、最大睿频4.3GHz 应该具体怎么设置呢~

#13 DeepSeek reply at 1 hour ago

针对你的 i5-10400F(6核12线程),建议这样设置:1. 进入菜单 → 工具/选项 → 高级选项 → 通用设置。2. 将“人声背景分离线程数”设为 6(或 8)。设为 6 刚好匹配物理核心,线程数过高反而增加调度开销,设为 8 可略微提速但占用更多资源。3. 同时确保不要勾选其他不必要的并行任务:不要勾选“降噪”(若不需要),并检查“CPU同时任务数[重启生效]”建议设为 1,避免多任务争抢 CPU 资源导致更慢。4. 重启软件使修改生效。如果你使用中仍感觉慢,建议改用第三方 GPU 工具(如 UVR5)先分离好 vocal.wav 和 instrument.wav,再按知识库方法导入软件,可大幅缩短耗时。请查阅相关文档:导入本地已有的人声和背景声

#14 171.91.**5 reply at 1 hour ago

设为8 会不会程序崩溃~ ?

#15 DeepSeek reply at 1 hour ago

通常不会直接导致程序崩溃。设为 8 会启用超线程,虽然能提高部分计算速度,但资源占用较高,可能引起系统卡顿或内存占用上升。在极端情况下若内存不足可能引发稳定性问题,但概率较低。更建议设为 6(匹配你 CPU 的物理核心数),效率与稳定性最平衡。若设为 8 后发现程序异常卡死或报错,可进入 软件目录/logs/ 查看最新日志文件排查。请查阅相关文档:高级选项

#16 171.91.**5 reply at 1 hour ago

处理器 Intel(R) Core(TM) i5-10400F CPU @ 2.90GHz 2.90 GHz
机带 RAM 16.0 GB
存储 466 GB HDD MB0500GCEHE, 466 GB SSD WDS500G3X0C-00SJG0, 932 GB HDD WDC WD10EZEX-08WN4A0
显卡 NVIDIA GeForce RTX 2060 SUPER (8 GB)

系统类型 64 位操作系统, 基于 x64 的处理器
这是我的电脑配置,是应该选择6还是8

#17 DeepSeek reply at 1 hour ago

建议设为 6。你的 i5-10400F 物理核心数为 6,设为 6 恰好匹配物理核心,效率最高且最稳定。设为 8 虽启用超线程,但不会带来明显提速,反而会占用更多内存和调度资源;你的内存为 16GB,若同时处理较大视频或运行其他程序,可能造成内存压力,增加卡顿或报错风险。同时建议:高级选项 → 通用设置中,将“CPU同时任务数[重启生效]”设为 1,避免多任务争抢资源。设置完成后重启软件生效。请查阅相关文档:高级选项

#18 171.91.**5 reply at 1 hour ago

降噪和不降噪差距有多大!

#19 DeepSeek reply at 1 hour ago

降噪对识别准确率的影响取决于原始音频的背景噪声程度,没有固定数值。如果视频环境嘈杂(如户外采访、现场录音、有风声/电流声/多人环境音),降噪可显著减少误识别和漏识别,差距可能很大;若视频本身人声清晰、背景安静,则差距很小,几乎可忽略。由于降噪是纯 CPU 计算,在 10400F 上会明显拖慢速度。建议根据实际音源决定:先试跑一个片段不降噪,若识别结果错误率高、漏字多,则开启降噪;若识别结果已准确,则关闭降噪以提速。请查阅相关文档:最佳配置推荐

#20 171.91.**5 reply at 1 hour ago

在语音转录界面中,无法直接拖拽文件到这个界面 系统是WIN10 怎么办‘’、?

#21 DeepSeek reply at 1 hour ago

语音转录界面当前版本不支持拖拽文件导入,请直接点击界面中的 “选择音频或视频” 按钮来手动选择文件。若需批量处理,可勾选对应文件夹选项。如果你想尝试拖放,可先拖到主界面的“翻译视频”工作区试试,但语音转录面板本身不保证支持。若你确认软件此前支持拖拽而突然失效,请提供软件版本号(左上角显示)以及 软件目录/logs/ 下最新日志,以便进一步分析。

请查阅相关文档:

#22 171.91.**5 reply at 1 hour ago

软件推荐配置配置级别 渠道 模型 说明
免费推荐 openai-whisper(内置) large-v3 通用效果好
免费推荐 parakeet日语(内置) 英伟达开源日语模型 效果好
免费备选 Huggingface_ASR japanese-wav2vec2-large 日语专用
收费推荐 OpenAI 语音识别 API — 效果优秀
但是我用的是faster-whisper内置加large-V3 仅日语视频提取字幕 应该用推荐还是按照我现在的来! 哪个效果好,?为什么?

#23 DeepSeek reply at 1 hour ago

你的 RTX 2060S 8GB 下,两种方案均可行,但效果略有差异。建议优先保持你现在的 faster-whisper + large-v3,因为它在保持较高精度的同时,速度明显快于 openai-whisper。两者的核心区别在于:- faster-whisper 是 OpenAI Whisper 的 CTranslate2 优化版,速度提升 4 倍以上,但解码时以牺牲极少量精度换取速度。对于清晰的日语语音,识别准确率已足够高。- openai-whisper 是原始官方实现,解码更精细,理论上对日语这类小语种的错字率更低,但模型体积更大、速度更慢,且在 8GB 显存下可能较为吃力。实际差距通常很小,除非你的视频噪声大或口音重,否则 faster-whisper 已能满足要求。操作建议:1. 先用 faster-whisper + large-v3 跑一段日语视频,检查字幕质量。2. 若发现错字/漏字较多,再切换至 openai-whisper + large-v3 对比。3. 若追求速度与精度平衡,可使用 faster-whisper + large-v3-turbo(比 large-v3 更快,精度略低)。4. 若视频中无背景音且为纯日语,也可考虑 parakeet日语(内置),该模型专为日语优化,效果很好,但仅支持 CPU,速度慢。请查阅相关文档:faster-whisper本地openai-whisper本地parakeet日语(内置)

#24 171.91.**5 reply at 1 hour ago

parakeet日语 没有2.1 2.2版本

#25 DeepSeek reply at 1 hour ago

parakeet日语(内置) 渠道在软件中仅内置了一个固定模型,没有提供 2.1/2.2 等版本选择。这是官方收录时决定的,并非模型本身不存在,而是软件未适配多版本。你的 RTX 2060S 下,若希望使用日语识别效果更好或支持更高版本,可改用其他渠道:- faster-whisper(内置) + large-v3 或 large-v3-turbo(支持 CUDA,速度精度均衡);- openai-whisper(内置) + large-v3(精度最高,但速度较慢);- Huggingface_ASR(内置) 中的 reazon-research/japanese-wav2vec2-large-rs35kh(日语专用模型)。若你确实需要 parakeet 的更新版本,只能等官方后续版本收录,手动下载新版模型放入 models 目录也无法保证被软件识别,不建议尝试。请查阅相关文档:parakeet日语(内置)Huggingface_ASR渠道faster-whisper本地

#26 171.91.**5 reply at 1 hour ago

V3和V3turbo 都会出现一定程度的漏句子~且修改阈值等 .效果平平,现在怎么办呢~

#27 DeepSeek reply at 1 hour ago

漏句子通常不是模型本身的问题,而是语音识别前段的音频分段或预处理参数设置不当导致的。建议按以下步骤排查和优化:

1. 调整语音识别参数(最有效)

进入 菜单 → 工具/选项 → 高级选项 → 语音识别参数,修改:

  • 最长语音持续(秒):设为 10,避免长句被强制截断后识别遗漏。
  • 最短语音持续(毫秒):设为 3000,过短的片段容易被过滤或合并,设为3000可保留更多完整句子。
  • 静音分割持续毫秒:适当调小(如 300~500),避免在短暂停顿处将同一句话误切分成两段导致下半句被忽略。
  • 语音阈值:适当下调(如 0.3~0.4),使引擎更容易识别轻音/清晰人声;但不要过低,否则噪声增多。
  • Whisper预分割音频:勾选此项,让Whisper基于VAD预分割后再识别,常能改善漏句。

2. 启用降噪或分离人声背景声

如果你的视频有背景音乐或环境噪声,VAD会误判静音,导致丢句。在主界面 设置更多参数 中勾选 分离人声背景声降噪。分离人声后识别效果会显著改善,但会耗时。

3. 更换为更适日语识别的渠道

faster-whisper large-v3对日语支持一般,large-v3-turbo精度更低。可尝试:

  • openai-whisper(内置) + large-v3:官方原始模型,对日语识别准确度更高。
  • Huggingface_ASR(内置) + kotoba-tech/kotoba-whisper-v2.0:专为日语优化的模型,效果出色。
  • Huggingface_ASR(内置) + reazon-research/japanese-wav2vec2-large-rs35kh:日语专用,精度高。
  • Dolphin(内置):支持多种亚洲语言,日语亦可,纯CPU处理但速度可接受。

4. 尝试小模型或调整beam_size

有时大模型因显存不足自动降级,可将“计算数据类型”设为 int8,并将“识别准确度beam_size”设为 1 降低资源占用,避免崩溃丢句。

5. 结合“二次识别”

在视频翻译界面勾选“二次识别”,即使首次识别有漏,二次识别可对配音后的音频重新转录生成补充字幕,但请注意二次识别需使用支持日语的渠道。

请先执行第1步的参数调整,再考虑更换渠道。若仍有问题,请提供软件截图或日志,以便进一步分析。

请查阅相关文档:

#28 171.91.**5 reply at 1 hour ago

image

#29 DeepSeek reply at 1 hour ago

从你上传的图片中无法判断具体的问题,截图未附文字说明。请补充以下信息以便分析:1. 图片中显示的具体报错文字或界面异常现象;2. 软件版本号(左上角显示);3. 操作系统(Win10/Win11等)与部署方式(预打包版或源码部署);4. 相关日志:打开 软件目录/logs/ 文件夹,复制最新日志文件底部约30行内容。请直接粘贴文字或描述问题现象,便于精确排查。

#30 171.91.**5 reply at 1 hour ago

image

image
根据图中目前的设置 漏句子 应该怎么设置更好呢

#31 DeepSeek reply at 1 hour ago

从你目前截图中的设置来看,漏句通常由“静音分割”过严或“最短语音持续”过大导致。请按以下数值调整,再试一次:

进入 菜单 → 工具/选项 → 高级选项 → 语音识别参数,修改为:

  • 最长语音持续(秒):10
  • 最短语音持续(毫秒):3000
  • 静音分割持续毫秒:300
  • 语音阈值:0.3
  • 非语音阈值:0.6
  • 取消勾选“Whisper预分割音频”后重新尝试(预分割可能把一个长句切碎丢弃尾部)
  • 取消勾选“删除字幕末尾标点”

同时主界面“设置更多参数”中:

  • 勾选“分离人声背景声”(若视频有背景音)
  • 不要勾选“降噪”(因为降噪是CPU处理慢且可能吞掉轻音)

若调整后仍漏句,建议将识别渠道改为 openai-whisper(内置) + large-v3(对日语更友好),或 Huggingface_ASR(内置) + kotoba-tech/kotoba-whisper-v2.0(日语专用)。你的 RTX 2060S 用 openai-whisper large-v3 也足够。请先按上述数值修改参数,再换渠道对比。请查阅相关文档:高级选项-语音识别参数openai-whisper本地

#32 171.91.**5 reply at 1 hour ago

分离人声背景声在哪里设置

#33 DeepSeek reply at 1 hour ago

分离人声背景声只在翻译视频主界面提供,不在“语音转录”面板中。具体位置:打开软件进入默认的“翻译视频”工作区,在“开始执行”按钮上方找到并点击 “设置更多参数..”,展开后即可勾选 “分离人声背景声”。若你现在正处于左侧的“语音转录”界面,该面板中没有此选项,需切换到“翻译视频”功能使用。如需在翻译视频时使用分离,勾选后建议同时勾选“重新嵌入背景声”以保留原背景音。若只是想转录字幕而不做视频翻译,可先借助第三方工具(如 UVR5)分离好人声/伴奏,再按“导入外部人声和背景声”的方式放入对应输出目录,软件会自动读取,跳过内部 CPU 分离流程。请查阅相关文档:导入本地已有的人声和背景声

#34 171.91.**5 reply at 1 hour ago

当前版本: v4.11 没有找到更多参数和分离人生背景设置~

#35 DeepSeek reply at 1 hour ago

“设置更多参数”按钮位于软件默认的“翻译视频”主界面上,位于“开始执行”按钮的上方。如果你当前处于左侧的“语音转录”面板,则不会出现该按钮,请切换到“翻译视频”功能。如果你已在翻译视频界面仍看不到,请按以下步骤开启:1. 点击顶部菜单“菜单 → 工具/选项 → 高级选项”。2. 在“通用设置”中找到“主界面显示所有参数?”,勾选它。3. 保存设置,回到主界面,此时“设置更多参数”按钮和所有高级选项会直接显示出来。同时,“分离人声背景声”就在“设置更多参数”展开后的列表中,与“降噪”、“重新嵌入背景声”等处于同一区域。请重新查看界面,确保你是在“翻译视频”工作区而不是“语音转录”面板。请查阅相关文档:高级选项使用入门

#36 171.91.**5 reply at 1 hour ago

image

#37 DeepSeek reply at 1 hour ago

从你上传的截图看,你当前确实在“翻译视频”主界面,但“设置更多参数”按钮可能被隐藏了。请按以下步骤操作:1. 点击顶部菜单“菜单 → 工具/选项 → 高级选项”。2. 在“通用设置”中找到“主界面显示所有参数?”并勾选它。3. 点击保存,返回主界面。此时“开始执行”按钮上方会出现“设置更多参数”按钮,点击展开后即可看到“分离人声背景声”选项。若勾选后仍未出现,请确认软件版本号为 v4.11(左上角显示),若版本不符请先升级到最新版本。请查阅相关文档:高级选项

#38 171.91.**5 reply at 1 hour ago

image
勾选设置后 就可以继续语音转录了吗?

#39 DeepSeek reply at 1 hour ago

勾选“主界面显示所有参数?”只是为了在“翻译视频”主界面显示更多高级参数,与左侧“语音转录”功能无关。语音转录仍然可以在左侧面板正常使用,不受影响。如果你是想在“语音转录”时使用“分离人声背景声”,该功能仅在“翻译视频”主界面中提供,语音转录面板不包含此选项。可切换到“翻译视频”功能使用,或先用第三方工具分离好 vocal.wav 和 instrument.wav 再导入。保存设置后一般无需重启即可看到变化,若界面无变化,请重启软件后再试。请查阅相关文档:高级选项导入本地已有的人声和背景声

#40 171.91.**5 reply at 1 hour ago

openai-whisper(内置)-large-v3 和 faster-whisper(内置) + large-v3 哪个效果好呢~?

#41 DeepSeek reply at 1 hour ago

openai-whisper(内置) + large-v3 的准确率更高,尤其对日语等小语种,漏字、错字率低于 faster-whisper。原因在于 openai-whisper 是 OpenAI 官方原始解码实现,推理更精细;而 faster-whisper 是基于 CTranslate2 的优化版,以牺牲少量精度换取 4 倍以上速度,当音频有噪声或口音时更容易出现漏句。你的 RTX 2060S 显存 8GB,运行 openai-whisper large-v3 可以支持,但速度会明显慢于 faster-whisper。建议操作:1. 先用 openai-whisper + large-v3 跑一段日语视频,对比漏句情况;2. 若速度可接受且漏句减少,则固定使用该组合;3. 若显存不足报错,可将“计算数据类型”设为 float16 或 int8,关闭“启用上下文感知”;4. 若仍不满意,可尝试 Huggingface_ASR(内置) 中的 kotoba-whisper-v2.0(日语专用)或 reazon-research/japanese-wav2vec2-large-rs35kh,效果同样出色。请查阅相关文档:openai-whisper本地faster-whisper本地Huggingface_ASR渠道

#42 171.91.**5 reply at 1 hour ago

识别说话人 以及说话人数量选择 还有插入说话人 需要勾选吗~

#43 DeepSeek reply at 1 hour ago

不需要勾选。“识别说话人”和“说话人数量”仅用于需要区分不同说话人(如多人对话、多角色字幕)的场景,会显著增加处理耗时,并对识别结果进行角色划分。如果你只是为日语视频提取普通字幕,建议保持不勾选,这样速度快且不会因说话人识别影响字幕质量。若将来确实需要区分人物,再勾选“识别说话人”并在“最大说话人数量”中填写预计人数,插入说话人会自动在字幕行前加角色标签。请查阅相关文档:语音识别渠道说明

#44 171.91.**5 reply at 51 minutes ago

openai-whisper + large-v3 用我电脑 出现错误了

#45 DeepSeek reply at 50 minutes ago

暂无法确定具体原因。请提供以下信息以便分析:1. 报错的具体文字或截图;2. 软件版本号(左上角显示);3. 操作系统(Win10/Win11)与部署方式(预打包版或源码部署);4. 软件安装目录下 logs/ 文件夹中最新的日志文件内容(复制底部约30行报错信息)。同时,请确认:你的 RTX 2060S 显存为 8GB,运行 large-v3 模型时若设置不当可能触发显存不足。可先尝试在高级选项 → 语音识别参数中将“计算数据类型”设为 float16 或 int8,关闭“启用上下文感知”,将 beam_size 设为 1,再重试。若报错仍存在,请补充上述日志以便精确排查。请查阅相关文档:openai-whisper本地高级选项-语音识别参数

#46 171.91.**5 reply at 50 minutes ago

1
00:00:14,180 --> 00:00:23,820
D-L-L-L-L-L-L-L
-L-L-L-L-L-L-L-
L-L-L-L-L-L-L-L
-L-L-L-L-L-L-L-
L-L-L-L-L-L-L-L
-L-L-L-L-L-L-L-
L-L-L-L-L-L-L-L
-L-L-L-L-L-L-L-
L-L-L-L-L-L-L-L
-L-L-L-L-L-L-L

2
00:00:23,820 --> 00:00:30,120
-L-L-L-L-L-L-L-
L-L-L-L-L-L-L-L
-L-L-L-L-L-L-L-
L-L-L-L-L-L-L-L
-L-L-L-L-L-L-L me

3
00:00:34,260 --> 00:00:41,280
me me me me me me

4
00:00:44,760 --> 00:00:55,640
me me me me me me

5
00:01:08,460 --> 00:01:20,420
A-A-A-A-A-A-A-A
-A-A-A-A-A-A-A-
A-A-A-A-A-A-A-A
-A-A-A-A-A-A-A-
A-A-A-A-A-A-A-A
-A-A-A-A-A-A-A-
A-A-A-A-A-A-A-A
-A-A-A-A-A-A-A-
A-A-A-A-A-A-A-A
-A-A-A-A-A-A-A-
A-A-A-A-A-A-A-A
-A-A-A-A-A -A-A
-A-A-A-A-A-A-A-
A-A-A-A-A-A-A-A
-A-A-A-A-A-A-A

6
00:01:20,420 --> 00:01:23,600
You're just a
shadow moving
through the light

7
00:01:23,600 --> 00:01:26,920
怖くのひとみ夜を隠して

8
00:01:27,619 --> 00:01:31,760
Waiting for the
stars to a wine
of my mind

9
00:01:31,760 --> 00:01
......
は、 そんな、

582
02:13:23,740 --> 02:13:27,560
せいしなみにの、 お前は、

583
02:13:31,860 --> 02:13:40,380
お前は、 あなたが行くと、私は…

584
02:13:43,580 --> 02:13:53,600
私は… 私は… やつ? はい あ!

585
02:13:55,360 --> 02:14:05,080
あ! あ! あ! あ! あ!
こっちの人だろ!

586
02:14:06,540 --> 02:14:11,780
あ! あ! 何だなったよ? あ!

587
02:14:14,160 --> 02:14:17,260
あ! あ! あ!

588
02:14:17,400 --> 02:14:28,900
あ! あ ーー

589
02:14:28,900 --> 02:14:34,320
ー んー んー

590
02:14:37,080 --> 02:14:47,440
あーーー あーーー あーーー
あーーー あーーー あーーー
あーーー あーーー あーーー
あーーー あーーー あーーー あーーー

591
02:14:47,440 --> 02:14:53,600
あーーー あ、やばい やばい
やばい ちょっと見ててね

592
02:14:55,020 --> 02:15:02,180
あ、やばい あ、やばい あ、やばい

593
02:15:02,180 --> 02:15:15,080
あ、やばい あ、やばい あ、や
ばい ちょっと見ててね あ、やばい

594
02:15:22,200 --> 02:15:33,060
あ、出ちゃった あ、

595
02:15:44,420 --> 02:15:49,580
出ちゃった やりまくって

596
02:16:04,080 --> 02:16:13,020
それからほどなくして 心ちゃん
は保健院者をやめ うちにもこなくなった

597
02:16:14,480 --> 02:16:18,020
結婚して子供期対してだったらしい

598
02:16:20,059 --> 02:16:25,020
サブスクケー役はそのままのはずなのに

599
02:16:51,300 --> 02:17:03,820
【Bokan】 不管說出口的患
者、AI幫你實現、自己上、自己
最想要的旅遊、全自動患連、身體
調整、與因資試設計、

600
02:17:03,820 --> 02:17:15,820
你想要的它全都能座的 輸入提示
詞、他馬上位置演一場情慾系
畫面聲音動作任你定制 還能下載
保存、回衛無線

601
02:17:15,820 --> 02:17:21,260
直到一張圖片 他就能動起來
AI自動聲桶、專書影片

602
02:17:21,260 --> 02:17:32,980
從病革到流動、每一兩度位置演出
運動望聚情、不用解釋 他全都動
現在早馬註冊就送免 FAT、数
量有限、先導先判

603
02:17:33,820 --> 02:17:38,320
【2. 2. 2. 2. 2.

        1. 2.
        1. 2.
        1. 2.
        1. 2.
        1. 2.
        1. 2.
        1. 2.
        1. 2.
        1. 2.
        1. 2.2.

604
02:17:39,379 --> 02:17:44,240

        1. 2.
        1. 2.
        1. 2.
        1. 2.
        1. 2.
        1. 2.
        1. 2.
        1. 2.
        1. 2.
        1. 2.
      1. 2.

605
02:17:45,660 --> 02:17:52,620

  1. 一想不倒的黑馬超越各大設
    斜網站直冲第一 趕快掃又上方二
    圍馬或輸入王子快進來看熱搜平台票選排名
#47 DeepSeek reply at 50 minutes ago

这是 Whisper 在含有背景音乐、环境噪声或视频自带广告音时极易出现的“幻觉重复”现象(如无意义的 D-L-L-L、me me me、あーーー 等),并非软件故障。请按以下步骤优化:

  1. 关闭“启用上下文感知”
    进入 菜单 → 工具/选项 → 高级选项 → 语音识别参数,取消勾选“启用上下文感知”。该功能会占用更多 GPU 并增加重复/幻觉概率。
  2. 调整解码参数,降低随机性
    在同一页面设置:

    • 重复惩罚:增大到 1.2 或 1.3
    • 文本压缩率:设为 1.0 或更低
    • 采样温度:设为 0
    • 识别准确度 beam_size 和 best_of:均设为 1(降低资源占用,减少幻觉)
  3. 开启“分离人声背景声”
    在翻译视频主界面,点击“设置更多参数”,勾选“分离人声背景声”。若背景音乐较明显,这一步能大幅减少误识别。同时可勾选“重新嵌入背景声”保留原背景音。
  4. 开启“降噪”(可选)
    若分离后仍受噪声影响,可再勾选“降噪”,但注意纯 CPU 处理较慢。
  5. 更换为 faster-whisper(内置) + large-v3
    faster-whisper 对这类混合音频的稳定性略优于 openai-whisper,且速度更快。若修改参数后仍大量重复,建议切换回 faster-whisper + large-v3 或 large-v3-turbo 重试。
  6. 处理视频自带广告
    从字幕中可见,视频中段嵌入了一段中文广告语音(“【Bokan】 不管說出口的患者...”)。若广告语音与背景音乐混合,Whisper 会尝试识别并产生大量重复。建议先用 ffmpeg 或视频剪辑工具将广告片段静音,或裁剪掉该段,再重新识别。

请先执行第 1~3 步并重试。若仍有大量重复,请提供软件版本号、操作系统及日志文件(软件目录 /logs/ 最新日志)以便进一步分析。

请查阅相关文档:

#48 171.91.**5 reply at 46 minutes ago

设置好了之后 重启软件 显示V3模型不存在 自动下载 image

#49 DeepSeek reply at 46 minutes ago

这是模型文件缺失或下载不完整导致的。你之前切换到了 openai-whisper + large-v3,重启后软件检测到 models 文件夹内没有完整的 large-v3 模型文件,于是触发自动下载,但自动下载常因网络问题失败。请按以下步骤处理:1. 关闭软件。2. 打开软件目录下的 models 文件夹。3. 找到与 large-v3 相关的文件(若你用的是 openai-whisper,文件名是 large-v3.pt;若用的是 faster-whisper,则是一个名为 models--Systran--faster-whisper-large-v3 的文件夹)。4. 将它们全部删除。5. 重新启动软件,观察是否能自动下载成功;若仍失败,请手动下载模型文件放入正确位置:openai-whisper:下载 https://openaipublic.azureedge.net/main/whisper/models/e5b1a55b89c1367dacf97e3e19bfd829a01529dbfdeefa8caeb59b3f1b81dadb/large-v3.pt 放入 软件目录/models 文件夹。faster-whisper:访问 https://huggingface.co/Systran/faster-whisper-large-v3 下载所有文件,放入 软件目录/models/models--Systran--faster-whisper-large-v3 文件夹。6. 确认网络正常,若使用代理,请在软件主界面对齐控制行右侧的代理框填写正确的代理地址(如 http://127.0.0.1:10808)。若下载后仍提示不存在,请提供软件版本号、部署方式及日志(软件目录/logs/最新日志)以便进一步分析。请查阅相关文档:openai-whisper本地手动下载模型

#50 171.91.**5 reply at 45 minutes ago

刚才好像没模型 。。是不是这个原因导致字幕错误

#51 DeepSeek reply at 45 minutes ago

模型文件缺失或下载不完整确实会导致语音识别结果异常,甚至出现大量重复、错字、乱码。因为你之前切换到了 openai-whisper + large-v3,重启后软件检测到模型未完整存在,自动下载又可能因网络问题失败,此时识别引擎无法正常加载模型,就会输出错误内容。

请先按上一步方法确认模型已完整放入正确位置,并重启软件,确保模型加载成功。只要模型完整,你之前的 D-L-L、me me 等重复现象就会大幅减少;如果模型完整后仍出现上述幻觉,才需要调整解码参数或开启分离人声背景声。

请先确保模型完整,再重新执行识别,观察结果是否恢复正常。若仍有问题,请提供 软件目录/logs/ 下最新日志和报错截图,以便进一步排查。

#52 171.91.**5 reply at 44 minutes ago

那我刚才修改的重复惩罚:增大到 1.2 或 1.3
文本压缩率:设为 1.0 或更低
采样温度:设为 0

#53 171.91.**5 reply at 42 minutes ago

怎么设置才能加速 我内存占用只有百分之50左右

#54 171.91.**5 reply at 41 minutes ago

怎么设置才能加速 我内存占用只有百分之50左右

#55 171.91.**5 reply at 36 minutes ago

image
爆显存了?

Thinking...
Post Your Reply
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource