#5981 我的显卡是RTX4060Ti,8G显存,为啥我在transcribe batch阶段非常非常慢,一天才有5%的进度,并且显卡显示利用率95%,专用GPU内存2.4/8GB

43.153* Posted at: 5 hours ago

我的显卡是RTX4060Ti,8G显存,为啥我在transcribe batch阶段非常非常慢,一天才有5%的进度,并且显卡显示利用率95%,专用GPU内存2.4/8GB

9 Replies

这个问题通常是因为语音识别渠道或模型设置不当,导致 GPU 虽然满了但并没有高效工作。RTX 4060 Ti 8GB 配合正确配置处理普通视频不会这么慢。

请按以下顺序排查并调整:

  1. 换用 faster-whisper 渠道(不要用 openai-whisper,它慢数倍)
    主界面语音识别下拉框选择 faster-whisper(本地内置)
  2. 降低模型尺寸
    large-v3 对 8GB 显存负担较大,建议先用 mediumsmall 测试速度。
    如果必须用 high quality,可以尝试 large-v3-turbo(更快更省显存)。
  3. 进入高级选项 → 语音识别参数,做以下优化:

    • 计算数据类型:选择 float16(如果模型支持)或 int8(最省显存、最快)。先不要用 float32
    • beam_sizebest_of:都设为 1(默认 5 会慢 5 倍)。
    • 关闭“启用上下文感知”(会增加大量计算)。
    • Whisper预分割音频?:如果开启,尝试关闭(改为不勾选),看速度是否提升。
  4. 检查 CUDA 环境
    在命令行执行 nvcc -V 确认版本 ≥ 12.8,并且 nvidia-smi 显示的驱动版本能支持 CUDA 12.8。
    如果版本不对,重新安装 CUDA 12.8cuDNN 9.11+
  5. 关闭不必要的额外处理
    在“设置更多参数”中暂时取消“分离人声背景声”、“降噪”、“说话人识别”。这些都会拖慢速度且消耗 CPU。

完成以上调整后,先用一个短视频(1~2 分钟)测试,应该能在几分钟内完成。如果仍然很慢,请到 logs/ 目录下最新的日志文件,复制最后 30 行报错信息,并提供软件左上角显示的版本号。

如果想兼顾质量与速度 应该如何设置

兼顾质量与速度,对于 RTX 4060Ti 8GB 显存,建议采用以下配置:

语音识别渠道与模型

  • 渠道faster-whisper(本地内置)(速度远快于 openai-whisper)
  • 模型large-v3-turbo(质量接近 large-v3,但速度提升 2~3 倍,显存需求约 5~6GB,适合 8GB 卡)

    • 如果追求极致速度且可接受少量质量损失,可用 mediumsmall

高级选项关键参数优化

进入 菜单 → 工具/选项 → 高级选项 → 语音识别参数,调整以下项:

参数建议值说明
计算数据类型float16int8float16 保证质量且显存减半;int8 更快更省但略有精度损失
beam_size1设为 1 加速数倍,质量损失很小
best_of1同上
启用上下文感知关闭节省大量计算,适合普通片段
Whisper预分割音频?勾选(推荐)可提高长句识别连贯性,对速度影响不大
最短语音持续(毫秒)1000避免过短片段,减少无效识别
最长语音持续(秒)10限制单段时长,防止长片段卡顿

其他加速措施

  • 确保勾选主界面 CUDA加速(必须)。
  • 检查 CUDA 版本是否为 12.8+,cuDNN 9.11+(否则 GPU 效率极低)。
  • 暂时关闭 分离人声背景声降噪说话人识别,这些纯 CPU 操作会严重拖慢整体流程。

预期效果

经上述优化后,一个 10 分钟 1080p 视频的语音识别阶段通常可在 5~15 分钟 内完成(取决于音频复杂度),同时保持很高的字幕准确率。

若仍有明显卡顿,请提供最新日志(logs/ 下当天 .log 文件最后 30 行)及软件版本号,以便进一步定位。

faster-whisper 我是下载medium 还是medium.en

若你的视频发音语言是纯英语,选择 medium.en(更快、精度略高);
若视频包含非英语(如中文、日语、混合语言等),则必须选择 medium 以支持多语言识别。
不确定时,默认选 medium 即可。

一小时40分钟的视频 这个阶段需要多久

在 RTX 4060Ti 8GB 上使用 faster-whisper medium(或 medium.en)模型,并启用 CUDA 加速,一个 1 小时 40 分钟的视频,语音识别阶段通常需要 20~40 分钟 左右完成。

实际速度主要受以下因素影响:

  • 音频中说话人数量、背景噪声复杂度
  • 是否开启 VAD 预分割、上下文感知等额外处理
  • 显卡驱动、CUDA 版本是否匹配

建议先用 5~10 分钟片段测试实际耗时,推算总时间。如果超过 1 小时仍无明显进展,请检查 CUDA 是否真正生效(主界面务必勾选 CUDA加速),并确认高级选项中 beam_sizebest_of 设为 1 以加速。

为啥显卡利用率 显卡显示利用率95%,专用GPU内存显示2.4/8GB

显卡利用率 95% 且专用内存仅 2.4/8GB,说明 GPU 计算单元是满负荷的,但模型较小(medium 模型约 2.5GB),显存并未成为瓶颈。速度异常慢(一天 5%)的根本原因不是显卡性能不足,而是每单位时间内处理的音频片段太少,可能由以下参数或设置导致:

  1. 语音识别渠道选错 – 如果用的是 openai-whisper(本地内置) 而非 faster-whisper(本地内置),速度会慢 3~5 倍。
  2. beam_size / best_of 过大 – 默认为 5,会显著增加计算量。
  3. 启用了上下文感知 – 这会大幅增加推理次数(即使显存占用不高)。
  4. VAD 预分割过细 – 若启用 “Whisper预分割音频” 且最短持续时长设得太小(如 200ms),会产生海量极短片段,导致 GPU 频繁切换小任务,效率极低。
  5. 采样率转换瓶颈 – 如果原音频不是 16kHz,FFmpeg 会实时重采样,可能拖慢 CPU 解码环节,GPU 虽满载但持续等待数据。
  6. 使用了“分离人声背景声”或“降噪” – 这些纯 CPU 操作会堵塞流水线,GPU 只能空转等待。

解决方法(按优先级调整)

  1. 确认渠道:语音识别下拉框必须选择 faster-whisper(本地内置)
  2. 调整高级选项(菜单 → 工具/选项 → 高级选项 → 语音识别参数):

    • beam_size:设为 1
    • best_of:设为 1
    • 计算数据类型:改为 float16(或 int8,更快)
    • 启用上下文感知取消勾选
    • Whisper预分割音频?取消勾选(如果不做语音克隆)
    • 最短语音持续(毫秒):设为 1000(避免过短片段)
    • 最长语音持续(秒):设为 10
  3. 关闭额外处理:在主界面“设置更多参数”中,暂时取消勾选“分离人声背景声”、“降噪”、“说话人识别”。
  4. 检查 CUDA 版本:命令行执行 nvcc -V 确认版本 ≥ 12.8,nvidia-smi 确认驱动支持。版本过低会导致 GPU 利用率高但实际性能低下。
  5. 测试小片段:先用一个 5 分钟短视频测试,调整后应能在 2~5 分钟完成转录。

完成上述调整后,1 小时 40 分钟的视频应在 20~40 分钟 内完成转录阶段。如果仍无改善,请提供 logs/ 目录下最新 .log 文件的最后 30 行内容,以及软件左上角显示的版本号,以便进一步排查。

Post Your Reply
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Dondate via PayPal

Related resource