#6914 faster-whisper +large-v3 显卡是2060S .通用设置选择VAD: silero语音阈值: 0.5非语音阈值: 0.6最长语音持续(秒): 10最短语音持续(毫秒): 500二次识别最长语音持续(秒): 2二次识别最

182.147.**2 Posted at: 1 hour ago

faster-whisper +large-v3 显卡是2060S .

通用设置

选择VAD: silero
语音阈值: 0.5
非语音阈值: 0.6
最长语音持续(秒): 10
最短语音持续(毫秒): 500
二次识别最长语音持续(秒): 2
二次识别最短语音持续(毫秒): 500
静音分割持续时间: 500
合并过短字串到邻近: ✅
Whisper预分割音频: ✅

说话人分离模型

built

计算数据类型

float16
识别准确度beam_size: 5
识别准确度best_of: 5
启用上下文感知: ✅

其他

重复惩罚: 1.5
文本压缩率: 1.0
采样温度: 0.0
处理出来的文本出现异常。如下
1
00:00:00,144 --> 00:00:09,696
不敢说出口的幻想 AI帮你实现
自定义提示词 即可生成你想要的
话面AI图身视频 AI深途

2
00:00:09,696 --> 00:00:18,128
あなたが欲しいものを、彼らはそ
れぞれできることです。真人でも
動漫も描写声音操作に従来の定義
で保存可能

3
00:00:18,128 --> 00:00:27,312
ご視聴ありがとうございました
お楽しみに!

4
00:00:27,792 --> 00:00:33,616
全国免費約泡100%真人認証

5
00:00:33,744 --> 00:00:37,536
全国金品資源24時間免費約泡

6
00:00:37,536 --> 00:00:42,352
お気に入りのものがあります。

7
00:01:22,576 --> 00:01:32,848
One look give
em a flash Beat
drop with a big
flash Teach me
how to do my th
ing fast 言うのにやも
って ご視聴ありがとうございました。

8
00:01:33,744 --> 00:01:37,744
Don't stop in
the lean time
無理やと can't touch that

9

......
いかな?

16
00:14:49,488 --> 00:14:55,792
食べてるんです 受けますか?

17
00:16:46,640 --> 00:16:55,536
仕事で疲れてるんだ 痴漢する人
の気持ちなんて考えたことなかった
なんだか可哀想

18
00:17:21,071 --> 00:17:26,192
やはりこの笑顔 優しさと慈しみ
に満ちている

19
00:23:31,632 --> 00:23:35,760
この手つき すごく上手 ダメ…

20
00:23:37,072 --> 00:23:41,232
昨日の時間が言った通りセックス
レスだけど

21
00:23:41,232 --> 00:23:44,688
時間なんて受け入れたら浮気にな
るからダメ

22
00:31:09,776 --> 00:31:15,312
やめて そう叫びたいのにあそこ
はぐしょぐしょになれてるし

23
00:31:15,600 --> 00:31:18,768
どうしよう 誰かに見られたら

24
00:38:40,848 --> 00:38:44,176
止めてたストレス 吐き出せたのかな

25
00:39:47,312 --> 00:39:54,640
時間が経つに連れて罪悪感を押し
寄せてくる あなた、ごめんなさい。

26
00:39:55,536 --> 00:39:59,152
時間なんて受け入れてしまった私を許して

27
00:46:19,952 --> 00:46:28,432
どうしてご本格 どうしてそれを?

28
00:46:41,328 --> 00:46:49,456
GPですけど お祝いさせてもら
いました 昨日は

29
00:46:49,616 --> 00:46:54,640
年下の上司に伺われて 凹んでし
まいました

30
00:46:56,624 --> 00:47:00,432
奥さんの笑顔で 癒してくれませんか

31
01:24:48,560 --> 01:24:52,944
ある1号室です 部屋の鍵は開け
ておきます

32
01:25:47,184 --> 01:25:55,120
できたりしないかなぁ 私 ホタ
セなんかじゃありません

33
01:25:57,424 --> 01:36:27,152
電車だと… リストレス溜まっち
ゃって 溶かしてください よー
してください

34
02:22:34,320 --> 02:22:40,944
優しい笑顔のひとつなが こんな
冴えない男の聖書を舐めて笑ってくれてる

35
02:22:45,936 --> 02:22:51,312
あなた ごめんなさい でも私だ
って女なの

36
02:22:52,048 --> 02:22:55,312
この体を求めてくれる人が好き

37
02:24:47,696 --> 02:24:56,560
ご視聴ありがとうございました
さようなら。

38
02:24:56,560 --> 02:25:05,888
ご視聴ありがとうございました

39
02:25:05,888 --> 02:25:14,320
ご視聴ありがとうございました

40
02:25:14,320 --> 02:25:23,504
ご視聴ありがとうございました
お楽しみに!

41
02:25:23,984 --> 02:25:29,808
全国免費約泡100%真人認証

42
02:25:29,936 --> 02:25:33,728
全国金品資源24時間免費約泡

43
02:25:33,728 --> 02:25:38,576
ご視聴ありがとうございました

44
02:26:18,512 --> 02:26:26,288
One look give
em a flash Beat
drop with a big
flash 集中やらすんだ
Think fast 言うのにもって

45
02:26:28,560 --> 02:26:33,904
チャンネル登録よろしくお願いし
ます Don't stop
and lean back
無理やと can't touch that

46
02:29:44,528 --> 02:29:45,456
ご視聴ありがとうございました

5 Replies

#1 DeepSeek reply at 1 hour ago

识别结果中出现大量重复、混语、幻觉(如“全国免费约泡”“ご視聴ありがとうございました”反复出现),核心原因是语音识别参数设置过激且过度启用了上下文感知,同时发音语言未明确指定,导致模型在背景音乐/广告噪音干扰下产生了严重幻觉。

请按以下步骤调整:

  1. 明确发音语言:在“翻译视频”主界面,必须指定发音语言(该视频为日语的话选日语 ja),不要使用“自动检测”。自动检测容易在背景音干扰下返回错误语言码,引发后续混乱。
  2. 高级选项 → 语音识别参数,调整以下项:

    • 取消勾选「启用上下文感知」:该开关极易引发重复和幻觉。
    • 识别准确度beam_size:改为 1 或 2(当前5过多推理)。
    • 识别准确度best_of:改为 1 或 2
    • 重复惩罚:提高到 2.0(当前1.5抑制不足)。
    • 文本压缩率:降低到 0.8(增大重复惩罚后配合此值效果更好)。
    • 语音阈值:提高到 0.7 左右(当前0.5太灵敏,易将背景音误判为语音)。
    • 非语音阈值:降低到 0.3 左右(有助于排除背景音乐/广告声)。
    • 静音分割持续时间:提高到 1000ms(当前500ms容易把静音切碎,引发错误断句)。
  3. 主界面「设置更多参数」中勾选「降噪」或「分离人声背景声」:视频中明显存在背景音乐和广告语,分离人声后可大幅减少幻觉。
  4. 硬件适配:RTX 2060 Super 显存约6GB,large-v3 要求约8GB。建议在模型下拉框改用 large-v3-turbo(速度更快、质量高、显存约6GB),或降至 medium
  5. 清理旧缓存:如果之前对同一视频识别过,请在主界面勾选 清理已生成,避免复用错误结果。

调整后重新执行。若仍有大量错乱,请提供软件目录下 logs/ 中最新的日志片段,以便进一步定位。

请查阅相关文档:

#2 182.147.**2 reply at 1 hour ago

明确发音语言选择是就是日语 。问题不应该是时间轴堆积太多字幕的问题吗、。》? 我感觉应该是Whisper预分割音频开启了。和合并过短字串到邻近勾选了?

#3 DeepSeek reply at 1 hour ago

您提到的“Whisper预分割音频”和“合并过短字幕到邻近”不会造成时间轴大片跳跃。预分割只是按静音将音频切成小片段送入模型,合并过短字幕也只是把不足500ms的短句并入相邻行,二者都不会导致中间40秒、60秒的时间段被整段跳过。

真正让时间轴出现空洞的原因是 VAD(语音活动检测)把部分段落误判为“非语音”而直接丢弃,或者模型在背景音乐/广告声干扰下产生了幻觉。您的结果里出现了大量广告文本(如“全国免费约泡”“ご視聴ありがとうございました”反复出现),也正是因为背景音被当成了人声。

请按以下步骤调整:

  1. 取消勾选「启用上下文感知」——该选项极易引发重复和幻觉。
  2. 进入“高级选项 → 语音识别参数”,降低 VAD 灵敏度:

    • 语音阈值:调高到 0.7 左右(当前 0.5 太灵敏,容易把背景音当人声)
    • 非语音阈值:调低到 0.2~0.3 左右
    • 静音分割持续时间:提高到 1000ms 以上(当前 500ms 容易把正常停顿切成碎块,导致 VAD 判断错乱)
  3. 在“设置更多参数”中勾选“降噪”或“分离人声背景声”,把背景音乐和广告声过滤掉。
  4. 若想验证您的怀疑,可临时取消勾选“Whisper预分割音频”和“合并过短字幕”再试一次,但大概率问题仍在 VAD 参数上。
  5. 模型建议改用 large-v3-turbo(2060S 显存约6GB,large-v3 需要约8GB,极易爆显存引发异常输出),或降至 medium。

调整后重新测试。若仍有异常,请提供 logs/ 目录下最新日志文件底部约30行报错信息,以便进一步定位。

请查阅相关文档:

#4 182.147.**2 reply at 1 hour ago

我的意思是,在某一个时间轴内出现大量文字的现象!这种不应该是Whisper预分割音频开启了。和合并过短字串到邻近勾选了的问题吗?

#5 DeepSeek reply at 1 hour ago

您说的现象(一条字幕内堆积大量文字)确实和 Whisper预分割音频合并过短字幕 有一定关联,但主要原因不是它们本身,而是 VAD(语音活动检测)没有在句子间隙正确切分,导致一整段长音频被当作一条连续语音送入模型,模型因此输出一长串文字。

  • Whisper预分割音频:这个选项的作用是在静音处把音频提前切成小段,本意是让句子更短。它不会主动把文字堆积在一起,反而应该减少长句。如果预分割没生效,恰恰说明没有检测到句间静音
  • 合并过短字幕到邻近:这个选项只会合并小于500ms的短字幕到相邻行,不会把几秒长的句子合并成一条。所以它也不是长句堆积的元凶。

真正导致“一条字幕内大量文字”的,是 VAD 静音阈值设置不当,使得背景音乐/连续人声中没有产生有效的静音分割,整段时间被当作一个语音片段。请重点调整以下参数:

  1. 语音阈值:提高到 0.7 左右(当前0.5太灵敏,背景音容易被当作语音)
  2. 非语音阈值:降低到 0.2~0.3
  3. 静音分割持续时间:提高到 1000ms 以上(当前500ms容易把正常停顿误判为静音,或反之导致不切分)
  4. 最长语音持续(秒):从10降低到 6,强制长段落被切开

同时,在“设置更多参数”中勾选 降噪分离人声背景声,排除背景音乐干扰。

如果想验证您的怀疑,可以临时取消勾选“Whisper预分割音频”和“合并过短字幕”再试一次,但大概率问题仍在VAD参数上。若调整后仍有异常,请提供 logs/ 目录下最新日志底部约30行报错,以便进一步定位。

Thinking...
Post Your Reply
If you have more than 50 messages, you will no longer receive an automatic reply. Please ask a new question!
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Related resource