#6897 使用该模型 开头就掉了很多句子!!!!

182.147.**2 Posted at: 1 hour ago

image
使用该模型 开头就掉了很多句子!!!!

53 Replies

#1 DeepSeek reply at 1 hour ago

这可能是因为所选语音识别模型的精度不足,或 VAD(语音活动检测)参数设置过大,导致视频开头的语音被误判为静音/噪声而直接丢弃。

解决方案(按顺序尝试):

  1. 更换更高精度的模型:如果当前使用的是 tiny/base/small 等小模型,请切换到 large-v3-turbolarge-v3(推荐)。小模型对开头音量偏小、语速快的部分漏字率极高。

    • 位置:主界面「语音识别」行 → 渠道选 faster-whisper(内置) → 模型选 large-v3-turbo
  2. 降低 VAD 敏感度阈值:进入 菜单 → 工具 → 高级选项 → 语音识别参数

    • 「语音阈值」 调小(例如从默认值降为 0.2 或更低),使软件更容易将低音量语音识别为有效语音。
    • 「静音分割持续毫秒」 调小(例如设为 500 或更低),避免过长的静音判定导致开头被截断。
  3. 明确指定发音语言:不要使用「自动检测」(该选项仅保留在左侧「语音转录」面板)。如果发音语言选择错误,模型可能跳过不符合预期语言的音频段。
  4. 关闭「分离人声背景声」和「Whisper预分割音频」:这两个功能在特定情况下会破坏音频片段完整性,导致开头句子被错误切割。可在主界面「设置更多参数」中暂时取消勾选,或在高级选项中关闭「Whisper预分割音频」,排除干扰后再测试。
  5. 关闭「LLM重新断句」:如果开启了该功能,AI 重新分割字幕时可能丢弃首尾不完整的句子。取消选中后测试。

若以上均无效,请提供软件安装目录下 logs/ 文件夹中最新的日志文件(复制底部约30行报错信息),以便进一步定位。

请查阅相关文档:

#2 182.147.**2 reply at 1 hour ago

使用的模型是 faster-whisper(内置) → large-v3

#3 DeepSeek reply at 1 hour ago

您已经使用了 faster-whisper(内置)large-v3 模型,开头仍然漏句,通常不是因为模型精度不足,而是由于 VAD 预分割参数过严预处理功能干扰 导致音频开头的语音被误判为静音/噪声而丢弃。请按以下顺序调整:

  1. 进入 菜单 → 工具 → 高级选项 → 语音识别参数

    • 语音阈值 调低至 0.2 甚至更低(默认值往往偏高,音量偏小或语速快的开头极易被过滤)。
    • 静音分割持续毫秒 调低至 500 或更低(避免开头一段较长的静音被判断为语音边界而切断)。
    • 若开启了 合并过短字幕到邻近,暂时取消勾选,防止开头短句被合并入后续行而丢失。
  2. 取消勾选「Whisper预分割音频」(此选项原本为 clone 音色设计,对普通识别可能造成开头片段切割异常)。
  3. 在主界面 「设置更多参数」 中,暂时取消勾选 「降噪」「分离人声背景声」。这两个基于 CPU 的预处理过程遇到音量偏低的开头语音时,容易将其当作背景声/噪声直接清除。
  4. 确认发音语言已明确选择,不要使用“自动检测”(自动检测仅保留在左侧「语音转录」面板)。
  5. 若开启了 「LLM重新断句」,请暂时取消勾选——AI 断句可能主动删掉首尾不完整的句子。

若以上全部调整后仍然漏句,请提供软件安装目录下 logs/ 文件夹中最新的日志文件(复制底部约30行报错信息),以便进一步分析。

请查阅相关文档:

#4 182.147.**2 reply at 1 hour ago

关闭了「分离人声背景声」和「Whisper预分割音频」 image

#5 DeepSeek reply at 1 hour ago

根据您提供的截图,问题的核心已经非常清晰:「静音分割持续毫秒」被设为 1000(即 VAD 只有在检测到连续 1 秒以上的静音时,才会认为一段语音已结束)。视频开头的语音若出现在一段较长的空白/低沉片头之后,VAD 会误认为这段语音属于“静音区”,从而将其直接丢弃。

请按以下步骤精确调整:

  1. 进入 菜单 → 工具 → 高级选项 → 语音识别参数
  2. 「静音分割持续毫秒」从 1000 调低为 300–500(推荐 300)
  3. 「语音阈值」调低至 0.2 或更低(当前截图可见为 -1.0,建议改为 0.2 并测试)
  4. 若开启了 「合并过短字幕到邻近」,请暂时取消勾选,避免开头短句被合并丢失
  5. 保持已关闭的「分离人声背景声」和「Whisper预分割音频」,确认后重新执行任务

若调整后仍存在掉句,请提供 logs/ 文件夹中最新日志底部约 30 行内容,以便进一步定位。

请查阅相关文档:

#6 182.147.**2 reply at 1 hour ago

当前设置就是。通用设置
选择VAD: silero

语音阈值: 0.3

非语音阈值: 0.6

最长语音持续(秒): 10

最短语音持续(毫秒): 3000

二次识别最长语音持续(秒): 2

二次识别最短语音持续(毫秒): 500

静音分割持续毫秒: 300

合并字幕到邻近:已勾选

Whisper预分割音效? 未勾选

说话人分离模型: built

Huggingface的token: (留空)

计算数据类型: float16

识别准确度beam_size: 1

识别准确度best_of: 1

启用上下文感知: 未勾选

重复惩罚: 1.3

文本压缩率: 1.0

采样温度: 0.0

热词: (空)

faster-whisper模型: tiny,tiny.en,base,base.en,small,small.en,medium,medium.en,large-v3-turbo,large-v1,large-v2,large-v3,distil-large-v3,distil-large-v3.5

whisper.cpp模型: ggml-tiny.bin,ggml-base.bin,ggml-small.bin,ggml-medium.bin,ggml-large-v1.bin,ggml-large-v2.bin,ggml-large-v3.bin,ggml-large-v3-turbo.bin

Gemini语音识别每批切片数: 50

字幕整体转简体: 未勾选

删除字幕末尾标点?: 未勾选

云API识别暂停秒: 0

#7 DeepSeek reply at 1 hour ago

根据您提供的完整参数,导致开头大量掉句的最主要原因是「合并过短字幕到邻近」已勾选,同时「最短语音持续毫秒」被设为 3000。这意味着任何少于 3 秒的语音片段,都会在识别后被强制合并到相邻字幕行中。如果视频开头的句子较短,且恰逢背景安静,它们可能被合并进后续句子甚至被覆盖,造成“开头掉句”的观感。

另外,语音阈值 0.3 虽然已较低,但 非语音阈值 0.6 相对偏高,可能让音量偏小的开头语音被判为非语音而丢弃。

请按以下顺序调整并重新测试:

  1. 取消勾选「合并过短字幕到邻近」
    位置:菜单 → 工具 → 高级选项 → 语音识别参数 → 去掉勾选。
  2. 将「最短语音持续毫秒」从 3000 调低为 500
    让短句得以保留,不被强行合并。
  3. 将「语音阈值」调低为 0.2
    更灵敏地捕捉低音量语音。
  4. 将「非语音阈值」调低为 0.5
    避免有效语音被误判为静音。
  5. 保持「静音分割持续毫秒」为 300,不要调大。
    若调大,开头静音会被视为长静音,从而切断语音起始。
  6. 确认发音语言已明确选择(不要使用“自动检测”),若发音语言选错,模型可能跳过不符合语言的片段。

若调整后仍掉句,请提供 logs/ 文件夹中最新日志底部约 30 行内容,以进一步定位。

请查阅相关文档:

#8 182.147.**2 reply at 1 hour ago

一直掉句子 现在应该怎么设置!!!

#9 DeepSeek reply at 1 hour ago

按下面这组参数严格设置,不要留空、不要随意改动。先把这个视频单独处理一遍,看是否还掉句:

语音识别参数(菜单 → 工具 → 高级选项 → 语音识别参数)

  • 选择VAD:silero
  • 语音阈值:0.1
  • 非语音阈值:0.4
  • 最长语音持续(秒):10
  • 最短语音持续(毫秒):500
  • 二次识别最长语音持续(秒):2
  • 二次识别最短语音持续(毫秒):500
  • 静音分割持续毫秒:200
  • 合并过短字幕到邻近:取消勾选(最重要,必须取消)
  • Whisper预分割音频:取消勾选
  • 说话人分离模型:选择「不启用」(如果你不需要多角色说话人标注)
  • 计算数据类型:float16(有 NVIDIA 显卡且显存≥8G 时)
  • 识别准确度beam_size:1
  • 识别准确度best_of:1
  • 启用上下文感知:取消勾选
  • 重复惩罚:1.3
  • 文本压缩率:1.0
  • 采样温度:0.0

主界面“设置更多参数”中

  • 降噪取消勾选
  • 分离人声背景声取消勾选
  • 重新嵌入背景取消勾选
  • 识别说话人取消勾选
  • 配音渠道的 clone 角色:暂时不要用,先测试普通角色

翻译与字幕阶段

  • 发音语言:必须明确选择,不要用“自动检测”
  • 翻译渠道:建议先选 Google(免费),取消“发送完整字幕”
  • 字幕类型:嵌入软字幕

如果按上述设置后仍然掉句

用左侧面板的 「语音转录」 功能单独测这个视频:

  1. 渠道选 faster-whisper(内置)
  2. 模型选 large-v3
  3. 发音语言选 自动检测
  4. 点击执行,看生成的字幕是否仍掉句

如果单独转录也掉句,说明不是参数问题,而是:

  • 模型下载不完整(删掉 软件目录/models/models--Systran--faster-whisper-large-v3 后重新下载)
  • 显存不足导致模型未能正常运行(改用 large-v3-turbomedium 模型)
  • 视频开头的语音音量太低/背景噪声太大(先用剪映等工具手动听音频开头确认)

请查阅相关文档:

#10 182.147.**2 reply at 1 hour ago

我翻译的主要是日语! 根据这个条件 我应该怎么设置不掉句子!

#11 DeepSeek reply at 1 hour ago

针对日语视频的翻译,掉句问题主要集中在语音识别渠道的选择VAD参数上。fast-whisper large-v3 对日语的支持不如 openai-whisper,且更容易在长句/片头静音处漏句。

请严格按以下配置操作:

第一步:更换语音识别渠道

  • 渠道选择:openai-whisper(内置)
  • 模型:large-v3(如果你有 NVIDIA 显卡且显存≥8G,建议使用 large-v3-turbo,速度更快)
  • 发音语言:必须选择「日语」(不要使用“自动检测”)

第二步:调整 VAD 参数(菜单 → 工具 → 高级选项 → 语音识别参数)

  • 选择VAD:silero
  • 语音阈值:0.1(降低,让低音量日语语音不被丢弃)
  • 非语音阈值:0.4
  • 最长语音持续(秒):10
  • 最短语音持续(毫秒):500(不要用 3000,会强制合并短句导致掉句)
  • 静音分割持续毫秒:200(不要用 300,防止开头长静音截断)
  • 合并过短字幕到邻近:取消勾选
  • Whisper预分割音频:取消勾选
  • 计算数据类型:float16(有 N 卡且显存充足)或 int8(显存不足时)
  • 识别准确度beam_size:1
  • 识别准确度best_of:1
  • 启用上下文感知:取消勾选
  • 热词:可填写日语常用人名/专有名词,用英文逗号分隔(如 田中,东京,日本

第三步:主界面“设置更多参数”

  • 降噪:取消勾选
  • 分离人声背景声:取消勾选
  • 重新嵌入背景:取消勾选
  • 识别说话人:取消勾选(日语说话人分离会显著拖慢且易出错)

第四步:翻译与配音

  • 翻译渠道:建议 DeepSeekOpenAI(日语→中文质量最佳);如免费则用 Google(免费),但需科学上网
  • 目标语言:根据你的需要选择
  • 配音渠道:Edge-TTS(免费) 并选择 ja-JP-NanamiNeuralja-JP-KeitaNeural(日语音色)

如果按上述配置后仍掉句
说明不是参数问题,可能是模型文件下载不完整,或显存不足。请:

  1. 删除 软件目录/models/models--openai--whisper-large-v3(或 models--Systran--faster-whisper-large-v3)后重新执行,让其重新下载。
  2. 用左侧「语音转录」面板单独测该视频,发音语言选自动检测,渠道选 openai-whisper,模型 large-v3,看是否依然掉句。
  3. 若单独转录也掉句,请截图 logs/ 最新日志底部约30行,进一步分析。
#12 182.147.**2 reply at 1 hour ago

我的电脑不知道为什么openai-whisper(内置)-large-v3 跑不动!

#13 DeepSeek reply at 1 hour ago

openai-whisper large-v3 跑不动,通常是显存或内存不足,导致模型刚加载就崩溃。请按以下顺序处理:1. 降级模型:将模型从 large-v3 改为 large-v3-turbo 或 medium 尺寸(显存占用大幅降低)。位置:主界面语音识别行 → 渠道仍选 openai-whisper(内置) → 模型改为 large-v3-turbo。2. 若仍跑不动,改为 faster-whisper(内置) + large-v3-turbo:faster-whisper 对显存要求更低,且速度更快。该模型对日语支持尚可,通常可完成识别。3. 降低计算精度:菜单 → 工具 → 高级选项 → 语音识别参数 → 计算数据类型改为 int8(最省显存),或 float16(若有 N 卡且显存≥6G)。4. 确认 CUDA 是否真正启用:如果本机是 NVIDIA 显卡但未配置 CUDA 12.8 + cuDNN 9.11,则 openai-whisper 会强制回退到 CPU,导致“跑不动”(极慢或假死)。请检查系统环境变量中 PATH 是否包含 CUDA 的 bin 和 lib 目录。若未配置,要么完整配置 CUDA,要么放弃 openai-whisper 改用 faster-whisper 支持 CPU 运行。5. 减少同时任务数:菜单 → 工具 → 高级选项 → 通用设置 → GPU同时任务数 设为 1(必须),CPU同时任务数 设为 1 或 2。不可多任务并行抢显存。6. 如果显存小于 4G:建议彻底改用 Faster-Whisper 的 medium 或 small 模型,并在主界面取消勾选“启用 CUDA”,让其在 CPU 上运行,速度虽然慢但不会崩溃。7. 若以上均无效,请提供 logs/ 最新日志底部约30行内容,定位确切的报错信息。请查阅相关文档:Windos上配置CUDA和cuDNNfaster-whisper本地openai-whisper本地

#14 182.147.**2 reply at 1 hour ago

openai-whisper large-v3 turbo 应该可以跑动,但是对比faster-whisper(内置) + large-v3 哪个好一些 日语准确度更高?

#15 DeepSeek reply at 1 hour ago

根据官方推荐,日语视频的语音识别首选「openai-whisper(内置) · large-v3」,而不是 faster-whisper。faster-whisper 是将原版模型转换后的加速版,虽然速度更快、显存占用更低,但转换过程中会带来细微精度损失,对日语的准确度实际上略逊于原版 openai-whisper。既然你的电脑可以运行 openai-whisper large-v3-turbo,建议直接使用它:渠道:openai-whisper(内置)模型:large-v3-turbo发音语言:日语(不要用自动检测)翻译渠道:DeepSeek 或 OpenAI(日语→中文质量最佳),免费可用 Google(免费)配音渠道:Edge-TTS,选 ja-JP-NanamiNeural 或 ja-JP-KeitaNeural(日语音色)副选方案:如果 large-v3-turbo 仍不稳定,可使用官方推荐的 parakeet日语(内置) 渠道,这是英伟达开源模型,专门针对日语优化,准确度高。请查阅相关文档:语音识别渠道说明与介绍openai-whisper本地faster-whisper本地

#16 182.147.**2 reply at 1 hour ago

image
使用的你推荐的openai-whisper(内置) · large-v3 现在英文字幕看不懂 ,显卡占用很高

#17 DeepSeek reply at 1 hour ago

根据截图,你使用的是 openai-whisper(内置) 的 large-v3,显卡占用高是正常现象(该模型需大量显存),但“英文字幕看不懂”表示识别输出的字幕并非日语,而是无意义的英文乱码或错误文本。这是模型文件不完整、显存不足导致输出异常,或发音语言设置错误所致。请按以下顺序排查:1. 确认发音语言已明确为「日语」 主界面语音识别行 → 发音语言下拉框 必须选择「日语」,不要选“自动检测”。如果误选为“英语”,模型会按英文发音方式识别并输出英文文本,导致你看不懂。2. 删除模型文件重新下载 关闭软件,删除 软件目录/models/models--openai--whisper-large-v3 整个文件夹,重新打开软件执行,让模型自动重新下载。模型不完整时往往输出乱码。3. 换用 faster-whisper(内置) · large-v3-turbo 如果你显卡显存不足(小于8GB),openai-whisper large-v3 很容易因显存溢出而输出错误结果。改用 faster-whisper(内置),模型选 large-v3-turbo,该模型显存占用更低,速度更快,且对日语识别准确度依然很高。4. 降低计算精度 菜单 → 工具 → 高级选项 → 语音识别参数 → 计算数据类型改为 int8(最省显存) 或 float16(若有N卡且显存≥6G)。5. 将 GPU同时任务数设为 1 菜单 → 工具 → 高级选项 → 通用设置 → GPU同时任务数 设为 1,防止多任务抢占显存导致崩溃。6. 如果以上均无效,请提供软件安装目录下 logs/ 文件夹中最新日志底部约30行内容,以便定位具体报错。请查阅相关文档:openai-whisper本地faster-whisper本地常见问题FAQ

#18 182.147.**2 reply at 1 hour ago

image
我说的看不懂是这句话 屏幕一直显示这个 但是又不处理!

#19 DeepSeek reply at 1 hour ago

屏幕上显示的英文是软件的状态提示,通常是「正在准备模型」或「正在下载模型」。openai-whisper large-v3 模型体积巨大(约3GB),首次运行时需要先下载到本地,下载过程可能非常缓慢,尤其在国内网络环境。如果长时间卡在这个界面不处理,是模型下载卡住或加载失败,而不是识别过程本身。请按以下顺序操作:1. 确认是否正在下载模型 检查软件目录下 models/models--openai--whisper-large-v3 文件夹是否在不断生成新文件。如果文件夹为空或长时间没有变化,说明下载已失败。2. 删除模型文件夹重试 关闭软件,删除 软件目录/models/models--openai--whisper-large-v3 整个文件夹,重新打开软件执行。若下载依然卡住,请确保网络正常,建议开启代理或使用科学上网。3. 换用 faster-whisper(内置) · large-v3-turbo faster-whisper 对显存要求更低,且模型文件较小,下载更快,对日语识别准确度同样很高。这是当前最稳定的选择。4. 若坚持使用 openai-whisper,请改选 large-v3-turbo 该模型是 large-v3 的加速版,体积更小,加载更快,且显存占用大幅降低,能有效避免卡死。5. 确认显卡显存是否充足 large-v3 需要约8GB显存,若显存不足会卡死或崩溃。进入 高级选项 → 语音识别参数 → 计算数据类型 改为 int8(最省显存)。6. 若以上均无效,请提供 logs/ 文件夹中最新日志底部约30行内容,以进一步定位。请查阅相关文档:openai-whisper本地faster-whisper本地

#20 182.147.**2 reply at 1 hour ago

八分钟了 还在显示这个界面 没有翻译 显卡占用很高

#21 DeepSeek reply at 1 hour ago

八分钟无进展且显卡占用高,通常意味着 openai-whisper large-v3 正在加载模型或处理音频,但速度异常缓慢,甚至可能因显存不足陷入死循环。请按以下步骤操作:

  1. 立即查看日志:打开软件安装目录下 logs/ 文件夹,找到最新日志文件(如 20260326.log),复制底部约30行内容,确认是否出现 CUDA out of memoryKilledError 等关键字。如果没有,说明仍在处理中,但速录极慢。
  2. 降低模型负载

    • 如果显存低于8GB,large-v3 极易卡死。请立即改用 faster-whisper(内置) + large-v3-turbo,该模型对日语识别准确度足够高,且显存占用更低、速度更快。
    • 若坚持使用 openai-whisper,请在高级选项中将模型改为 large-v3-turbo
  3. 降低计算精度

    • 进入 菜单 → 工具 → 高级选项 → 语音识别参数,将 计算数据类型 改为 int8(最省显存)或 float16(若显存≥6G)。
  4. 关闭并发任务

    • 高级选项 → 通用设置 中,确认 GPU同时任务数 设为 1CPU同时任务数 设为 1,避免多任务抢占资源导致卡死。
  5. 若模型已损坏

    • 关闭软件,删除 软件目录/models/models--openai--whisper-large-v3 整个文件夹,重新执行任务让其自动重新下载。若下载失败,请确保网络可访问 HuggingFace,或使用科学上网。

推荐方案:对于日语视频,最稳定配置是 faster-whisper(内置) · large-v3-turbo,请直接切换后测试。若仍卡住,请提供日志底部30行内容,以便精准定位。

#22 182.147.**2 reply at 1 hour ago


Application started at 2026-08-27 03:21:55

1787772115:Loading resources...
1787772115:Loading main window...
1787772115:Initializing UI...
1787772116:SetupUI end...
1787772116:import recognition ...
1787772116:import tts ...
1787772116:import translate ...
1787772116:Get cache ...
1787772116:Set default value ...
1787772116:import voices list ...
1787772116:Set tts voice ...
[DEBUG] Version: v4.11, Frozen:True, OS: win32
上次缓存的角色:No,字幕嵌入类型:2,发音语言:简体中文,目标语言:日语,目标语言代码:ja,模型:kotoba-tech/kotoba-whisper-v2.0,TTS渠道[0]
1787772116:show main window ...
1787772116:Bind signal...
1787772116:set cursor...
1787772116:preload TTS win...
1787772116:preload STT win...
1787772116:preload translate srt win...
1787772116:end
[DEBUG] 平台: Windows。正在按优先级检测最佳的 'h264' 编码器: ['nvenc', 'qsv', 'amf']
[DEBUG] 可用 Nvidia 显卡数: 1
[DEBUG] 正在测试编码器是否可用: h264_nvenc...
[DEBUG] 找到 1 个 Nvidia GPUs, 耗时: 3s

......
alse, 'speech_timestamps': None, 'audio_file': 'D:/win-pyvideotrans-v4.11/tmp/12884/2a28bce2b8/AARM-359J-1787772166.0379846.wav', 'local_dir': 'D:/win-pyvideotrans-v4.11/models/models--Systran--faster-whisper-large-v3', 'compute_type': 'float16', 'jianfan': False, 'audio_duration': 8274756, 'hotwords': '', 'prompt': '', 'beam_size': 1, 'best_of': 1, 'temperature': '0.0', 'repetition_penalty': 1.3, 'compression_ratio_threshold': 1.0, 'max_speech_ms': 10000, 'subtitle_srt': 'D:/win-pyvideotrans-v4.11/tmp/faster-20260827-03_22_50.srt', 'device_index': 0}
[DEBUG] GPU进程池:max_workers=1
[DEBUG] 开始加载 faster-whisper模型large-v3,数据类型:float16
[DEBUG] [faster_whisper]加载模型large-v3: is_cuda=True,_compute_type='float16'
[DEBUG] 直接传递完整音频,由faster-whisper内部VAD处理,返回字级时间戳数据
[DEBUG] faster-whisper模式下,对large-v3模型返回的字级时间戳进行断句
[DEBUG] 断句完毕返回结果
[DEBUG] faster-whisper下已临时保存识别结果到 D:/win-pyvideotrans-v4.11/tmp/faster-20260827-03_22_50.srt,防止进程崩溃后永久等待
[DEBUG] [新进程任务 title='Model: large-v3'] 已返回
[DEBUG] [新进程任务 结束:title='Model: large-v3'],耗时80.63285207748413s
[DEBUG] [SpeechToText]语音转录: self.out_format='srt',self.copysrt_rawvideo=True,self.spk_insert=False
[TaskCfgSTT]
原始输入文件名: C:/Users/1/Desktop/AARM-359J.mp4,
输出结果保存到文件夹: D:/BaiduNetdisk


/win-pyvideotrans-v4.11/output/recogn,
临时文件夹: D:/win-pyvideotrans-v4.11/tmp/12884/2a28bce2b8
已启用CUDA加速
未选 降噪
语音识别:openai-whisper(内置), large-v3 断句方式:默认断句
发音语言:ja
未选 降噪
[DEBUG] [新进程任务 开始:title='Model: large-v3']
[DEBUG] 新进程任务 参数:kwargs={'prompt': '', 'detect_language': 'ja', 'model_name': 'large-v3', 'logs_file': 'D:/win-pyvideotrans-v4.11/tmp/12884/2a28bce2b8/openai-ja-1787772718.6602263.log', 'is_cuda': True, 'no_speech_threshold': 0.4, 'condition_on_previous_text': False, 'speech_timestamps': None, 'audio_file': 'D:/win-pyvideotrans-v4.11/tmp/12884/2a28bce2b8/AARM-359J-1787772713.890977.wav', 'jianfan': False, 'audio_duration': 8274756, 'temperature': '0.0', 'compression_ratio_threshold': 1.0, 'max_speech_ms': 10000, 'device_index': 0}

#23 DeepSeek reply at 1 hour ago

根据您提供的日志,问题的根源已经明确:您当前正在运行的 openai-whisper(内置) · large-v3 进程已卡死超过8分钟,虽然显卡占用高,但实际没有产出结果。而日志前半部分显示,您之前使用的 faster-whisper(内置) · large-v3 已经成功完成识别(耗时80秒),只是可能存在掉句现象。因此,请立即终止当前卡死的任务,并切换到更稳定的方案。第一步:终止当前任务直接在软件界面点击「停止」或关闭软件,强行结束 openai-whisper 进程。第二步:切换回 faster-whisper 并优化参数1. 在语音识别渠道中选择 faster-whisper(内置),模型选 large-v3-turbo(不是 large-v3,Turbo 版更快且显存占用更低,日语效果也足够好)。2. 发音语言确认选「日语」。3. 进入 菜单 → 工具 → 高级选项 → 语音识别参数,严格设置:选择VAD:silero语音阈值:0.1非语音阈值:0.4最长语音持续(秒):10最短语音持续(毫秒):500静音分割持续毫秒:200合并过短字幕到邻近:取消勾选Whisper预分割音频:取消勾选计算数据类型:float16(有N卡)或 int8(显存不足时)识别准确度beam_size:1识别准确度best_of:1启用上下文感知:取消勾选4. 主界面「设置更多参数」中:降噪、分离人声背景声、重新嵌入背景、识别说话人 全部取消勾选。第三步:清理模型缓存删除 软件目录/models/models--Systran--faster-whisper-large-v3models--openai--whisper-large-v3 两个文件夹,让软件重新下载完整模型(若模型损坏,即使 faster-whisper 也可能输出乱码)。第四步:若仍掉句用左侧面板的「语音转录」功能单独测试该视频:渠道选 faster-whisper(内置),模型选 large-v3-turbo,发音语言选「日语」,先看转录出的 SRT 是否完整。若单独转录也掉句,请提供 logs/ 中最新日志底部约30行内容,以便进一步分析。请查阅相关文档:faster-whisper本地高级选项参数详解常见问题FAQ

#24 182.147.**2 reply at 1 hour ago

已经更换为 openai-whisper -large-v3-turboimage

#25 DeepSeek reply at 1 hour ago

配置已正确更改为 openai-whisper(内置) · large-v3-turbo,该模型对日语准确度较高且显存占用低于 large-v3,能有效避免卡死。为确保不再掉句,请检查以下关键参数(菜单 → 工具 → 高级选项 → 语音识别参数):发音语言:必须选择「日语」,不要使用“自动检测”。合并过短字幕到邻近:必须取消勾选(这是导致开头掉句的主要元凶)。最短语音持续毫秒:设为 500,不要用 3000。语音阈值:0.1;非语音阈值:0.4;静音分割持续毫秒:200。Whisper预分割音频:取消勾选。计算数据类型:float16(有 N 卡且显存≥6G)或 int8(显存不足时)。主界面“设置更多参数”中:降噪、分离人声背景声、重新嵌入背景、识别说话人 全部取消勾选。执行时如果再次出现长时间卡住(超过5分钟无结果),请终止任务,改用 faster-whisper(内置) · large-v3-turbo,这是更稳定的替代方案,日语识别效果同样出色。若更换后仍掉句,请删除 软件目录/models/models--openai--whisper-large-v3 文件夹,重新执行以重新下载完整模型。如果仍异常,提供 logs/ 最新日志底部约30行,以便进一步定位。

#26 182.147.**2 reply at 1 hour ago

image
我只需要软件帮我在视频中提取字幕 设置对吗?

#27 DeepSeek reply at 1 hour ago

如果你只需要从视频中提取字幕(不翻译、不配音),当前的「翻译视频」界面设置不正确,因为该模式必然包含翻译和配音步骤。请改用左侧功能面板中的「语音转录」。具体操作:点击左侧「语音转录」面板。选择要处理的视频文件(可批量)。语音识别渠道:faster-whisper(内置) 或 你当前使用的 openai-whisper(内置)。模型:large-v3-turbo 或 large-v3(日语建议 openai-whisper)。发音语言:选择「日语」(不要用“自动检测”,如果多种语言混合可选自动检测)。点击「开始执行」。完成后字幕文件会保存到输出目录(默认为软件目录下 output/recogn 文件夹)。这样仅执行识别并生成 SRT 字幕,不会进入翻译和配音阶段,也不会卡在后续环节。若你只想试用“翻译视频”但跳过配音,可在配音渠道中选择「不配音」并将字幕类型设为“嵌入软字幕”,但这样仍然会执行翻译步骤,效率低且易出错。因此,请务必切入「语音转录」面板。请查阅相关文档:语音识别渠道说明与介绍

#28 182.147.**2 reply at 1 hour ago

精度设置8还是16?
为什么?

#29 DeepSeek reply at 1 hour ago

推荐使用 float16。理由如下:float16 是 NVIDIA GPU 的原生半精度格式,能充分利用显卡并行计算能力,相比 int8 精度更高,尤其对日语语音细节的捕捉更好,能有效减少识别错误和漏句。int8 虽然显存占用更低、速度更快,但会损失明显精度,容易导致日语同音词混淆、语调识别不准,反而可能加重“掉句”问题。

除非你的显卡显存不足(小于 4GB)或运行大型模型时频繁报“CUDA out of memory”,否则请一律使用 float16。你当前使用的是 large-v3-turbo,该模型在 float16 下显存占用适中,日语识别效果最佳。

如果显存不足导致崩溃,才降级为 int8 作为妥协方案。

设置位置:菜单 → 工具 → 高级选项 → 语音识别参数 → 计算数据类型 → 选择 float16

#30 182.147.**2 reply at 1 hour ago

openai-whisper(内置) · large-v3-turbo.large-v3 都用不了 直接卡死

#31 DeepSeek reply at 1 hour ago

openai-whisper(内置) 在当前环境中大概率因显存不足、CUDA 驱动异常或模型文件损坏而卡死。不要再纠缠该渠道,直接改用 faster-whisper(内置) · large-v3-turbo——它此前已成功跑通(日志显示耗时80秒),且对日语识别准确度足够高。若你只想提取字幕,请务必切换到「语音转录」面板,而不是「翻译视频」。

  1. 切换功能面板
    点击左侧「语音转录」面板,导入视频。
    渠道:faster-whisper(内置)
    模型:large-v3-turbo
    发音语言:日语(不要用“自动检测”)
    直接点击“开始执行”,任务完成后 SRT 字幕保存在 output/recogn 目录下。
  2. 优化 VAD 参数(菜单 → 工具 → 高级选项 → 语音识别参数)
    选择VAD:silero
    语音阈值:0.1
    非语音阈值:0.4
    最长语音持续(秒):10
    最短语音持续(毫秒):500
    静音分割持续毫秒:200
    合并过短字幕到邻近:取消勾选
    Whisper预分割音频:取消勾选
    计算数据类型:float16(若显存不足则改 int8)
    识别准确度beam_size:1
    识别准确度best_of:1
    启用上下文感知:取消勾选
  3. 关闭无关干扰
    主界面「设置更多参数」中:降噪、分离人声背景声、重新嵌入背景、识别说话人 全部取消勾选。
  4. 如果 faster-whisper 仍卡死
    关闭软件,删除 软件目录/models/models--Systran--faster-whisper-large-v3 文件夹,重新执行让它在线下载完整模型。
    若下载失败,请手动下载模型查看手动下载方法
  5. 排查 CUDA 异常
    在「语音转录」面板中暂时取消勾选「启用 CUDA 加速」,强制 CPU 运行。若 CPU 能跑通,说明 CUDA 配置或显存确实有问题,请检查 CUDA 12.8+cuDNN 9.11 是否正确安装,或改用 int8 降低显存压力。

若仍无法解决,请提供 logs/ 中最新日志底部约30行,以便进一步定位。

#32 182.147.**2 reply at 1 hour ago

CUDA 驱动没有异常或模型文件也没有损坏,环境也没有问题!降噪、分离人声背景声、重新嵌入背景、识别说话人 全部都取消勾选了. VAD 参数已经修改了.还是不行!!!!!说明我的电脑不能用这个faster-whisper(内置)
+large-v3和V3T

#33 DeepSeek reply at 1 hour ago

faster-whisper 与 openai-whisper 都卡死的原因不是模型本身,很可能是该视频的音频文件异常(如时长字段错误、采样率异常、超大 wav),导致 whisper 内部处理陷入死循环。请不要再尝试这两个渠道,改用以下方案。第一步:直接用「语音转录」面板测试(不是翻译视频)左侧「语音转录」面板 → 导入该视频 → 渠道选 parakeet日语(内置)(英伟达开源日语专项模型,速度快,支持GPU)发音语言选日语 → 直接执行。该渠道不依赖 whisper 机制,能避开卡死问题。第二步:若仍不行,换用 Huggingface_ASR 渠道渠道选 Huggingface_ASR(内置)模型选 reazon-research/japanese-wav2vec2-large-rs35kh(日语专用wav2vec模型)发音语言选日语 → 执行。此模型是独立架构,不依赖 Whisper 源码。第三步:对视频音频做预处理如果是视频文件,先手动用 ffmpeg 将音频提取为正常 wav:命令行执行 ffmpeg -i 视频.mp4 -vn -ac 1 -ar 16000 -f wav 音频.wav再用「语音转录」导入该 wav 测试,排除视频容器损坏的可能。若提取后仍卡死,说明音频内容本身异常(超长静音、损坏等)。第四步:若所有渠道都卡死,请提供日志在 logs/ 文件夹最新日志中复制底部约30行内容发我,重点看是否有类似于 audio_duration 异常大(日志中曾出现 8274756,疑似时长字段异常)或 ffmpeg 解码死循环的痕迹。请查阅相关文档:语音识别渠道说明与介绍Huggingface_ASR渠道

#34 182.147.**2 reply at 51 minutes ago

uggingface_ASR(内置)模型选 reazon-research/japanese-wav2vec2-large-rs35kh(日语专用wav2vec模型) 这个模式支持GPU吗

#35 DeepSeek reply at 51 minutes ago

Huggingface_ASR(内置) 渠道支持 GPU 加速。你选择的 reazon-research/japanese-wav2vec2-large-rs35kh 是日语专用模型,可在 NVIDIA 显卡上启用 CUDA 加速,速度明显优于 CPU。使用前需注意:确认主界面已勾选「启用 CUDA 加速」。确保显卡显存充足(该模型约需2-4GB显存,若显存不足可改用更小的模型或关闭GPU)。进入 高级选项 → 语音识别参数 → 计算数据类型 选 float16 或 int8(默认 int8 即可)。发音语言选日语。若该渠道仍卡死,请提供 logs/ 最新日志底部约30行,以进一步分析。请查阅相关文档:Huggingface_ASR渠道

#36 182.147.**2 reply at 39 minutes ago

在语音转录转成字幕后发现 。电影中 人的话都说完了,字幕才显示出来 怎么办?

#37 DeepSeek reply at 39 minutes ago

字幕晚于说话,主要原因是语音识别模型输出的时间戳与视频实际声音存在整体偏移,或 VAD 预分割导致时间轴累积误差。请按以下顺序处理:1. 关闭「Whisper预分割音频」 在 菜单 → 工具 → 高级选项 → 语音识别参数 中,取消勾选。该功能会将音频提前切片,容易造成时间戳偏移。2. 关闭「合并过短字幕到邻近」 若该选项开启,短句会被合并,时间轴可能被拉长或缩短,导致字幕晚显。3. 调整 VAD 参数 语音阈值:0.1 非语音阈值:0.4 静音分割持续毫秒:200(不要太大)4. 更换识别渠道试一次 在「语音转录」面板中,渠道选 faster-whisper(内置),模型选 large-v3-turbo,发音语言选日语。不同模型对时间戳的敏感度不同,可对比效果。5. 若经以上调整仍整体晚显,说明模型输出的时间轴本身偏晚,需手动修正SRT 用文本编辑器打开生成的 .srt 文件,将所有时间逐行统一减去一个固定秒数(例如全部提前0.5秒)。若不想手动改,可使用 Aegisub 等专业字幕工具批量调整。6. 如果视频本身音画不同步(播放时声音和口型本就对不上),则语音转录无法修正,需先修复视频。建议先用播放器确认原视频是否自带不同步问题。如果以上调整后仍无法解决,请提供 logs/ 最新日志底部约30行,以便进一步分析。请查阅相关文档:高级选项参数详解常见问题FAQ

#38 182.147.**2 reply at 37 minutes ago

Whisper预分割音频 未勾选
image

#39 DeepSeek reply at 37 minutes ago

截图确认「Whisper预分割音频」已未勾选,但「合并过短字幕到邻近」仍处于勾选状态,且「最短语音持续毫秒」为 3000。这两个参数会导致短句被强制合并进相邻字幕,时间轴被拉长,字幕显示自然滞后于说话。请严格修改以下参数:菜单 → 工具 → 高级选项 → 语音识别参数取消勾选「合并过短字幕到邻近」将「最短语音持续毫秒」从 3000 改为 500将「语音阈值」设为 0.1,「非语音阈值」设为 0.4,「静音分割持续毫秒」设为 200确认修改后,重新用「语音转录」面板执行一次,看是否解决。若字幕仍然整体晚显(同步延后,但顺序正确),说明模型输出的时间轴本身偏晚,需要手动调整SRT:用文本编辑器打开生成的 .srt 文件,将所有时间统一减去一个固定秒数(例如全部将 00:00:02,500 改为 00:00:02,000)。若不需要手动改,可用 Aegisub 打开字幕,全选后按快捷键“Ctrl+Shift+A”将时间轴整体提前 0.5 秒。若仍无法解决,请提供 logs/ 最新日志底部约30行,以便进一步分析。

#40 182.147.**2 reply at 26 minutes ago

你之前说让我用什么日语模型?

#41 DeepSeek reply at 26 minutes ago

之前推荐过以下日语语音识别模型:openai-whisper(内置) · large-v3 / large-v3-turbo(效果好但你电脑卡死)faster-whisper(内置) · large-v3-turbo(也卡死)parakeet日语(内置)(英伟达开源日语专项模型)Huggingface_ASR(内置) · reazon-research/japanese-wav2vec2-large-rs35kh(日语专用wav2vec模型)既然 openai-whisper 和 faster-whisper 在你电脑上都卡死,现在最稳定的是 parakeet日语(内置)。它的架构不依赖 Whisper,专为日语优化,速度快且支持 GPU。请在「语音转录」面板中:渠道选 parakeet日语(内置)发音语言选日语直接执行即可。若该渠道也卡死,再改用 Huggingface_ASR(内置) 的 reazon-research/japanese-wav2vec2-large-rs35kh。

#42 182.147.**2 reply at 23 minutes ago

image
parakeet日语(内置)


语音识别模型无法选择

#43 DeepSeek reply at 23 minutes ago

parakeet日语(内置) 是独立渠道,不需要选择模型。请确认以下操作:1. 切换至左侧「语音转录」面板,而非「翻译视频」。2. 在语音识别渠道下拉框中找到「parakeet日语(内置)」并选中。3. 选中后,「模型」下拉框可能为空或不可选——这是正常的,因为该渠道只有默认模型,无需手动指定。4. 将发音语言设置为「日语」,然后直接点击「开始执行」。如果下拉框中根本没有「parakeet日语(内置)」这个渠道,说明软件版本过旧或渠道列表未加载。请:关闭软件,前往官网重新下载完整版 v4.11 覆盖安装。如果渠道存在但执行时报错,请检查模型是否已下载:进入 软件目录/models/,确认是否存在 parakeet 文件夹。若不存在,手动下载此压缩包:https://modelscope.cn/models/himyworld/videotrans/resolve/master/parakeet-ja.zip解压后,将里面的 parakeet 文件夹完整放入 models 目录。如果仍无法找到渠道,请提供软件界面完整截图,以便进一步确认。

#44 182.147.**2 reply at 20 minutes ago

parakeet日语(内置) 使用这个模型,在高级选项中语音识别参数应该怎么设置?

#45 DeepSeek reply at 20 minutes ago

使用 parakeet日语(内置) 渠道时,无需选择模型,只需按以下参数设置(菜单 → 工具 → 高级选项 → 语音识别参数):选择VAD:silero语音阈值:0.1非语音阈值:0.4最长语音持续(秒):10最短语音持续(毫秒):500静音分割持续毫秒:200合并过短字幕到邻近:取消勾选Whisper预分割音频:取消勾选计算数据类型:float16(有N卡)或 int8(显存不足时)识别准确度beam_size:1识别准确度best_of:1启用上下文感知:取消勾选注意:parakeet 渠道不支持 VAD 预分割,因此上述「Whisper预分割音频」取消勾选即可。发音语言必须选择「日语」,不要用自动检测。主界面「设置更多参数」中:降噪、分离人声背景声、重新嵌入背景、识别说话人 全部取消勾选。设置后,在「语音转录」面板导入视频,渠道选 parakeet日语(内置),直接执行即可。

#46 182.147.**2 reply at 16 minutes ago

使用 parakeet日语(内置) 渠道时.出现大量字幕在一起 怎么办 ,截取一段发你 ,你看看错误 1
00:01:58,256 --> 00:02:28,000
ロ強いに落ちよ

2
00:02:28,000 --> 00:02:57,744
うん

3
00:03:05,712 --> 00:03:22,768
いらっしゃい今日もさおっぱい飲
み放題だよねはあ何言ってるんで
すか医療保険の見積もりの見直し
の件でああそっかそうだったそうだった

4
00:03:28,336 --> 00:03:36,288
おっぱい飲み放題のさ、サブスク
リクションの契約してるよね、サ
ブスク潮入

5
00:03:36,288 --> 00:04:00,432
はいそうでした今日もたくさんお
っぱいいじめてくださいほら入っ
て入って俺は覚えたての催眠術を
使って保険外交員の女にサブスク
購入契約をしたと思い込ませてい
るそうあれは

6
00:04:06,096 --> 00:04:07,744
ふだんですと

7
00:04:07,744 --> 00:04:35,824
入院1日目から7000円が出ま
すしまたが特薬というのもついて
ますので安心に安心をさらに手厚
く盛り込んでます私としてはオス
スメかなって思うんですけど別れ
た妻の紹介でやってきた保険外交
員はねえ美人で巨乳だったああそう

8
00:04:39,248 --> 00:04:50,384
前のさ保険のおばさん新しく保険
入るとサービスしてくれたんだけ
ど綾瀬さんはしてくれるの

9
00:04:50,512 --> 00:04:51,888
あっ

10
00:04:52,176 --> 00:05:10,992
サービスですかああテーマパーク
の招待ペアチケットならございま
すけど違うよえっエッチなやつだ
よ分かるでしょ聖fレディってさ
そういう仕事じゃ

11
00:05:11,344 --> 00:05:24,272
いえその前に来てた方がどういっ
た方か分からないですけどうちで
はお客様とこういったやりとは禁
止されてます

#47 DeepSeek reply at 16 minutes ago

parakeet日语(内置) 渠道出现长文本合并,核心原因是 VAD 静音检测不灵敏:日语语速快、句间停顿短,当前参数未能将语音片段正确切分,导致大段语音被当成一条字幕。请按以下步骤调整(菜单 → 工具 → 高级选项 → 语音识别参数):选择VAD:silero语音阈值:0.05非语音阈值:0.3最长语音持续(秒):5(强制超长语音分段)最短语音持续(毫秒):200静音分割持续毫秒:50(大幅降低,让句间短停顿也能切割)合并过短字幕到邻近:取消勾选Whisper预分割音频:取消勾选(parakeet不支持,勾选也无用)计算数据类型:float16 或 int8若调整后仍出现长字幕,请改用 Huggingface_ASR(内置) 渠道,模型选 reazon-research/japanese-wav2vec2-large-rs35kh,发音语言选日语。该模型对日语断句表现更好。如果以上都无效,建议用「语音转录」面板测试同一视频,渠道选 faster-whisper(内置),模型选 large-v3-turbo,并将“启用CUDA”取消(强制CPU),看看是否正常。若仍无法解决,请提供 logs/ 最新日志底部约30行,以便进一步定位。

#48 182.147.**2 reply at 13 minutes ago

image

#49 DeepSeek reply at 13 minutes ago

截图显示当前参数仍会合并长字幕,核心原因是「静音分割持续毫秒」仍偏高,且「最长语音持续(秒)」不够短,导致日语长句没有被强制切分。请严格按以下值设置,切勿保留原值:菜单 → 工具 → 高级选项 → 语音识别参数选择VAD:silero语音阈值:0.05非语音阈值:0.3最长语音持续(秒):5(关键,强制超长语音分段)最短语音持续(毫秒):200静音分割持续毫秒:50(关键,大幅降低,让句间停顿也能切分)合并过短字幕到邻近:取消勾选Whisper预分割音频:取消勾选计算数据类型:float16(有N卡)或 int8(显存不足)识别准确度beam_size:1识别准确度best_of:1启用上下文感知:取消勾选设置后再次执行。若仍出现长字幕合并,说明 parakeet 渠道本身的断句能力不足,请改用以下更可靠的日语方案:渠道选 faster-whisper(内置)模型选 large-v3-turbo发音语言选日语在「语音转录」面板中执行(不要用「翻译视频」),并勾选「启用 CUDA 加速」。若 faster-whisper 依然卡死,则改用 Huggingface_ASR(内置),模型选 reazon-research/japanese-wav2vec2-large-rs35kh,发音语言选日语。如果调整后仍无法解决,请提供 logs/ 最新日志底部约30行内容,以便进一步定位。

#50 182.147.**2 reply at 10 minutes ago

parakeet日语(内置) 渠道就不能使用CUDA加速吗 ,一直都是CPU在处理 太慢了

#51 DeepSeek reply at 10 minutes ago

parakeet日语(内置) 渠道底层是 CPU 推理模型,不支持 CUDA 加速,因此处理慢是正常现象。该渠道的设计初衷是轻量离线运行,无法利用显卡。

若需要 GPU 加速以提升日语识别速度,请改用以下支持 CUDA 的渠道:

首选:faster-whisper(内置) · large-v3-turbo

  • 支持 CUDA 加速,日语识别效果良好,速度快。
  • 若之前遇到卡死,请先删除模型文件并重新下载:
    软件目录/models/models--Systran--faster-whisper-large-v3(或对应 turbo 模型文件夹)。
  • 在「语音转录」面板中单独测试,确保发音语言选「日语」。

备选:openai-whisper(内置) · large-v3-turbo

  • 支持 CUDA 加速,日语准确度高。
  • 若卡死,同样删除 models--openai--whisper-large-v3 后重新下载。

备选:Huggingface_ASR(内置) · reazon-research/japanese-wav2vec2-large-rs35kh

  • 该渠道支持 GPU 加速,是日语专用模型,速度明显快于 parakeet。
  • 发音语言选「日语」即可。

重要前提:
CUDA 加速仅支持 NVIDIA 显卡,且系统需正确安装 CUDA 12.8+ 与 cuDNN 9.11。若你已安装但实际未生效,请检查系统环境变量 PATH 中是否包含 CUDA 的 binlib 目录。若显卡显存不足 4GB,建议使用 int8 精度并关闭并发任务。

#52 182.147.**2 reply at 9 minutes ago

faster-whisper(内置) · large-v3-turbo

支持 CUDA 加速,日语识别效果良好,速度快。
若之前遇到卡死,请先删除模型文件并重新下载:
软件目录/models/models--Systran--faster-whisper-large-v3(或对应 turbo 模型文件夹)。
在「语音转录」面板中单独测试,确保发音语言选「日语」。
备选:openai-whisper(内置) · large-v3-turbo

支持 CUDA 加速,日语准确度高。
若卡死,同样删除 models--openai--whisper-large-v3 后重新下载。
备选:Huggingface_ASR(内置) · reazon-research/japanese-wav2vec2-large-rs35kh

这三种 哪一种最强

#53 182.147.**2 reply at 9 minutes ago

faster-whisper(内置) · large-v3 openai-whisper(内置) · large-v3-turbo Huggingface_ASR(内置) · reazon-research/japanese-wav2vec2-large-rs35kh 这三种 哪一种最强?

Thinking...
Post Your Reply
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource