#6550 人名语音识别不准有什么办法吗

183.56.**9 Posted at: 6 hours ago

人名语音识别不准有什么办法吗

9 Replies

人名等专有名词识别不准,最直接有效的解决办法是使用“热词”功能,或启用“LLM重新断句”让大模型修正错别字。

解决方案(按优先级排序):

  1. 使用热词功能
    进入 菜单 -> 工具 -> 高级选项 -> 语音识别参数,在“热词”框中填入你关注的人名,多个词用英文逗号分隔。
    例如:张三,李四,王小明
    这能告诉识别模型这些词更可能出现,显著提升人名识别率。
  2. 启用 LLM 重新断句
    在主界面“语音识别”区域,将断句方式选为“LLM重新断句”,并配置 DeepSeek 或 OpenAI 渠道。它会利用大模型修正识别后的错别字、重新切分句子,人名错误通常能被纠正。
    注意:启用说话人分离时会禁用该功能;克隆音色时不建议使用。
  3. 提高识别精度参数
    高级选项 -> 语音识别参数 中:

    • 识别准确度beam_size识别准确度best_of 从默认值调高(如设为 5)。
    • 勾选 启用上下文感知(会占用更多 GPU,但能减少重复和幻觉)。
    • 可适当调整 重复惩罚文本压缩率
  4. 更换更合适的识别模型

    • 中文视频建议使用 Qwen-ASR(内置)阿里FunASR(内置)Firered中文(内置),这些渠道对中文人名表现更好。
    • 其他语言可尝试 large-v3large-v3-turbo 这类更大模型,识别准确度更高。
  5. 提升音频输入质量
    在主界面点击“设置更多参数”,勾选 分离人声背景声降噪。清晰干净的人声能明显减少误识别。

请查阅相关文档:

分离人声背景声会有什么缺点吗

分离人声背景声的主要缺点是处理速度极慢,因为该步骤是纯 CPU 运算,会显著延长整个视频翻译的时间。此外还有以下注意点:

  1. 耗时明显增加:分离人声背景声是纯 CPU 计算,速度较慢。如果视频较长,这一步会消耗大量时间。
  2. 占用磁盘空间:分离过程中会产生大量临时中间音频文件,长时间处理后可能占用较多磁盘空间。
  3. 背景音可能丢失:如果分离后没有勾选“重新嵌入背景”,分离出来的背景音将被丢弃,最终视频将没有背景音乐,只剩下配音。
  4. 分离质量影响后续效果:分离出的人声(vocal.wav)将作为语音识别和配音克隆的输入,若分离效果不理想(如残留噪声、人声不完整),可能会影响识别准确率和克隆音色质量。

如果希望加快分离速度并获得更高质量的分离结果,建议使用专业第三方工具(如 UVR5-GUI)在 GPU 加速下预先分离,再将 vocal.wavinstrument.wav 放入对应输出目录供软件直接使用。

请查阅相关文档:

我看到你说勾选上下文感知可以减少重复和幻觉但是软件里面描述的为什么是但也容易出现重复或幻觉

您指出的正确。我之前表述有误。软件内对“启用上下文感知”的说明是:开启后占用更多GPU,识别效果更好,但也容易出现重复或幻觉。因此该选项是一把双刃剑,并非纯粹的减少问题。

如果您在使用中遇到重复或幻觉,可以尝试以下调整:

  1. 高级选项 -> 语音识别参数 中,适当增大“重复惩罚”(值越大越有利于减少重复)。
  2. 适当减小“文本压缩率”(该值越小越有利于减少重复)。
  3. 如果问题仍无法解决,可考虑关闭“启用上下文感知”

LLM重新断句和上下文感知有必要都开吗,俩者区别是什么,可以只选择其中一个吗

两者作用于不同阶段,可以只选择其中一个,也可以同时开启,但并非都必须开。

区别

  • 上下文感知:语音识别阶段生效,属于 faster-whisper/openai-whisper 模型内部参数。开启后模型会利用更多上下文信息进行识别,效果更好,但占用更多 GPU,且容易出现重复或幻觉。
  • LLM重新断句:语音识别完成后生效,属于后处理。它将识别出的字幕文本发送给 DeepSeek/OpenAI 等大模型,由大模型修正错别字、重新切分句子,使结果更通顺。

是否建议都开

  • 可以只开其中一个,两者独立,不影响。

    • 只开“上下文感知”:提升识别阶段质量,但不修正确认错字。
    • 只开“LLM重新断句”:识别后由大模型修正,能纠正部分识别错误,但效果取决于所用大模型。
  • 不建议同时开启的场景:若配音角色选择了 clone(克隆原音色),强烈不建议使用 LLM 重新断句,默认断句即可。启用说话人分离时,软件会自动禁用 LLM 重新断句。
  • 资源消耗:上下文感知会额外占用 GPU;LLM 重新断句则需消耗大模型 API 调用额度,并可能增加耗时。

若追求更高识别质量且硬件/预算允许,可同时开启;若担心重复/幻觉或使用克隆音色,只开其中一个或都不开。

我的语音是用的阿里百炼用上下文感知会生效吗

不会生效。“上下文感知”仅对 faster-whisperopenai-whisper 两个本地模型有效,属于这两个模型内部的解码参数。你使用的是阿里百炼(Qwen3-ASR 在线 API),该参数不会传递到云端识别接口,勾选与否对识别结果没有任何影响。建议:使用阿里百炼时无需关注此选项;如需优化阿里百炼的识别效果,请在阿里百炼平台侧选择合适的模型(如 qwen3-asr-flash 或 qwen3-asr-flash-filetrans),并在主界面正确选择发音语言、确保音频清晰。

Post Your Reply
Open source and free maintenance is not easy. If this project is helpful to you, please consider making a small donation to help the project continue to maintain and update.

Dondate via ko-fi.com

Dondate via PayPal

Related resource