← Back to articles

设置真正减少错误的聊天机器人置信度阈值

设置真正减少错误的聊天机器人置信度阈值

使用置信度阈值,安全地路由不确定的聊天机器人对话。一种实用的设计是划分为三个区间:高置信度时直接回答,中等置信度时确认或澄清,低置信度时转交人工处理。具体的数值界限必须根据您的模型和流量进行校准。0.85 和 0.5 之类的数值可以用来说明这一策略,但它们并不是通用默认值。

Oracle 的意图解析文档将 0.70 作为其自身意图模型的起始值,并建议在结果支持的情况下测试更高的数值。这一建议仅适用于该平台。对某个模型、领域或分数定义有效的阈值,换到另一个模型、领域或分数定义上可能就是错误的。

在调整阈值之前,请根据近期对话构建一个具有代表性的评估集。标注每个预测意图或答案是否正确,然后将这些结果与系统记录的分数和操作进行比较。这样,您就能获得选择界限的依据,而不是只依赖供应商的默认值。

  • 高区间(示例:0.85 及以上):机器人自动回答,无需确认步骤。
  • 中区间(示例:0.5 至 0.85):机器人在执行操作前进行确认或澄清。
  • 低区间(示例:低于 0.5):机器人将对话转交人工,或触发备用意图。

专业提示: 从足够多的近期对话开始,确保涵盖常见意图、含义模糊的措辞以及已知失败案例。与其使用一个标签不可靠的大型样本,不如使用一个规模较小但标注严谨的数据集。

关键要点

三段式策略可以为含义模糊的对话提供确认路径,从而减少无提示的错误回答。它对自动化率和准确率的影响,必须通过您自己的标注对话进行衡量。

要点 详情
从三个区间开始 定义高、中、低区间的操作。将 0.85 和 0.5 视为示例,然后校准实际界限。
使用真实数据进行校准 为具有代表性的数据集标注正确性,然后在信心区间层面检查性能,再信任任何阈值。
不要轻信 LLM 的自我置信度 在 RAG 系统中,应评估检索信号和依据充分性,而不是依赖模型自己声称的确定程度。
同时监控自动化和错误 同时关注自动化率和错误回答率;如果其中一个单独上升,就是危险信号。
使用有依据且经过批准的知识 Deskhero 的 AI chat-bot 仅从用户批准的公开 FAQ 内容中回答,并在无法有把握地回答时转交人工。

目录

聊天机器人置信度阈值究竟是什么?

置信度分数是您的意图分类器或检索系统为其最佳猜测分配的数值,通常介于 0 和 1 之间。置信度阈值是您在这一范围内划定的一条界线,用来决定机器人下一步要做什么。分数负责对选项进行排序;阈值则是叠加在分数之上的策略决策。

置信度分数的含义取决于系统。有些分类器会输出能够根据实际正确率进行校准的分数。其他平台则只提供排名或相似度信号。不要假设分数为 0.92 就意味着答案正确的概率为 92%,除非供应商明确说明该解释,并且您的评估数据也证实了这一点。

检索增强生成(RAG)增加了另一层复杂性。即使检索到的材料已经过时或不相关,生成的答案也可能听起来非常确定。检索相似度、来源质量、答案依据以及模型行为是彼此独立的信号。在将它们组合成路由策略之前,应分别使用标注结果对每个信号进行测试。

专业提示: 不要将 LLM 自我报告的确定程度作为唯一的路由信号。要求存在相关来源材料,并测试检索或依据检查是否确实能够在您的数据上预测正确性。

为什么三个置信度区间胜过单一界限?

单一阈值会迫使系统做出二选一:回答或不回答。中间区间增加了第三种选择:提出简短的澄清问题。这样可以减少无提示的失败,而不必将每个不确定的对话都直接转交人工。

区间 典型范围 机器人行为 用户体验示例
示例:0.85 及以上 自动回答,无阻碍 机器人直接回答:“您的订单将于周四发货。”
示例:0.5 至 0.85 确认或澄清 “您是想查询订单,还是要取消订单?”
示例:低于 0.5 备用处理或转交人工 “让我为您联系团队中的工作人员。”

聊天机器人置信度区间及其行为示意图

这些范围只是为了让路由逻辑更加具体的示例。请根据您自己的平台、分数定义以及错误回答的成本,用实际数据得出的数值替换它们。

一旦在实际操作中观察到这一点,背后的道理就很简单了。假设单一界限设为 0.70,那么每个刚刚超过这条线的分数都会被自动回答,仿佛系统完全有把握一样,尽管 0.71 与 0.69 几乎没有区别。中间区间提供了一个缓冲地带,让机器人承认存在一定不确定性,而不是假装自己完全确定。

  • 让确认流程保持简短。可点击的选项通常比另一个开放式问题更能减少歧义。
  • 备用提示语应承认没有理解,而不要让人感觉系统出了故障:“我不太确定自己是否理解了您的意思,让我为您找一位工作人员。”
  • 衡量中区间的确认是否真正解决了歧义,还是仅仅增加了操作阻力。

利益相关者需要清楚了解其中的权衡:降低阈值会提高自动化率,但每一个越过较低门槛的错误回答都会变得不可见。因为机器人看起来很有把握,所以没有人会标记它。提高阈值则会产生相反的效果:它会让失败以备用处理的形式显现出来,从运营角度看似乎更糟,但实际上更加安全,因为可见的失败会被记录并修复,而不可见的失败只会悄悄侵蚀信任。

如何为您的机器人校准置信度阈值?

供应商默认值和行业区间只是起点。实际界限应该来自您自己的对话记录,因为聊天机器人的准确率会因领域、意图复杂度以及用户措辞的混乱程度而大幅变化。

  1. 构建具有代表性的测试集。 使用涵盖常见意图、含义模糊的措辞和高成本失败案例的真实问题。所需样本量取决于流量和您所需的精确度。
  2. 标注真实结果。 对每段对话标记实际给出的答案是否正确,而不仅仅是机器人听起来是否自信。
  3. 将结果映射到分数。 针对每个完成标注的对话轮次,绘制置信度分数与正确性的关系。您要寻找的是错误答案开始聚集的位置。
  4. 计算各区间的精确率和召回率。 对每个拟议区间,计算答案实际正确的比例(精确率),以及无需不必要备用处理就成功通过的正确答案比例(召回率)。
  5. 构建可靠性图。 按置信度分数将预测结果分桶,并绘制预测置信度与实际准确率的关系。校准良好的机器人会生成接近对角线的曲线;校准不佳的机器人则会偏离该曲线。
  6. 尽可能计算预期校准误差(ECE)。 这一单一数值可以量化所有分桶中声明的置信度与实际准确率之间的差距。
  7. 在大范围发布前进行 A/B 测试。 按用户群组或时间窗口划分流量,然后比较旧阈值与新阈值下的自动化率、错误回答率和备用处理率。

可以将其看作一条流水线:分数分布流入区间界限,区间界限决定操作结果,而操作结果再与真实结果进行比较,以检查这些界限最初是否设置正确。

指标 它能告诉您什么 工具/方法
各区间精确率 自动回答的对话轮次中实际正确的比例 人工标注对话记录
各区间召回率 避免不必要备用处理的正确答案比例 人工标注对话记录
可靠性图 声明的置信度是否与实际准确率相符 分桶准确率图
预期校准误差 概括校准差距的单一分数 校准分析

一项 2025 年针对基于 RAG 的技术支持聊天机器人的研究报告称,在该研究的实验设置中,“Combo”提示策略将预期校准误差从 23.33 降至 8.4,同时准确率从 69.33% 提升至 81.33%。这一结果并不是通用基准,但它表明,提示和系统设计不仅会影响阈值本身,也会影响校准效果。

如何为您的机器人校准置信度阈值?概览图

阈值设置不当会出现什么问题?

两种失败模式分别位于同一个调节旋钮的两端,而且都很常见,因此您应该熟悉它们的典型症状。

  • 阈值过低:机器人会在匹配较弱时自动回答。有些错误回答可能不会被报告,因为整个流程从未发出不确定信号。
  • 阈值过高:机器人会将本可以正确回答的问题升级处理,增加等待时间并降低有效自动化率。
  • 纠正事件增加:如果用户越来越频繁地改述问题、纠正机器人,或明确表示“这不是我问的”,这通常说明您的中区间过窄,或高区间界限过于激进。
  • 备用处理率与支持工单量不匹配:如果备用处理在减少,但支持队列仍在增长,机器人可能是在自动给出错误答案,而不是将问题升级处理。
  • 反馈标记集中在界限附近:如果差评或“没有帮助”等信号集中出现在阈值边界附近,那么这条边界很可能设置在了错误的位置。

解决方案可能是更换界限、扩大中间区间、改进训练数据,或加强检索与依据检查。对于由 RAG 支持的机器人,请确认检索到的材料确实支持该答案,而不要把流畅的回答当作证据。首先,在标注对话上离线评估拟议阈值。如果随后进行在线测试,请在向更多流量开放之前,预先定义安全标准和回滚条件。

RAG 和 LLM 聊天机器人应如何采用不同方式处理置信度?

生成式模型使置信度路由变得更加复杂,因为流畅、自信的文字并不能证明答案有依据。因此,实用的策略会将检索质量、引用支持、答案一致性以及分类器分数等信号区分开来。每个信号仍然需要根据实际正确性进行验证。

在一项多专科医学评估中,来自 17 个专科的 33 名医生对284 个问题的回答进行了评分。答案的中位数评分较高,但在六分制准确率评分中,有 36 个初始答案获得了最低两档之一的评分。平均表现优秀但仍存在重要失败,这种组合说明,在高成本领域需要进行谨慎验证。在另一个消费者案例中,法庭裁定一家航空公司应对其聊天机器人提供的不准确信息负责

在生产环境中经得起考验的实用模式包括:

  • 在知识库具有权威性的工作流中,要求事实性回答必须存在相关的来源段落。
  • 无论语言模型自身声称什么,都应将空的或较弱的检索结果自动视为低置信度。
  • 建立明确的“不知道”或升级处理路径,让模型可以在不受惩罚的情况下选择它,因为如果训练模型必须始终给出答案,那么即使不该回答时,它也会给出一个答案。
  • 随响应保存来源信息,以便审核人员检查来源是否支持该主张。

专业提示: 如果答案应该来自经过批准的知识库,而检索没有返回任何相关内容,请将其路由到澄清或备用处理,而不是让模型临时编造答案。

更改阈值后应监控什么?

阈值调整不是一次性修改后就可以忘记的设置。它标志着监控窗口的开始,在此期间,您要观察具体信号,以判断这次更改是否有帮助,还是悄悄让情况变得更糟。

  • 自动化率:无需人工介入即可解决的对话比例。
  • 错误回答率:从部分对话记录中人工标注得出,而不是由机器人自我报告。
  • 备用处理率:机器人升级或转交人工的频率,并按时间和意图进行跟踪。
  • 每 100 次对话的纠正次数:用户改述、纠正或明确拒绝答案的频率。
  • 升级延迟:已转交的对话需要多长时间才能获得人工回复。
  • 用户满意度或 CSAT:最好按区间细分,以便了解中区间确认是否真正获得良好反馈。

构建一个仪表板,随时间绘制置信度分数分布以及各区间的结果率,并保留一组持续收集的错误回答样本,每周进行人工审核。最重要的一项相关性是:如果自动化率上升的同时错误回答率也在上升,那么您的阈值就朝错误方向移动了,即使总体自动化数字看起来像是取得了胜利。只有将这两个数字并列跟踪,而不是孤立观察其中一个,聊天机器人性能评估才真正有效。

可直接复用的基于阈值路由策略手册

下面是一套可以直接调整使用的策略结构,以及每次部署后应自动运行的遥测检查。

路由逻辑的最简伪代码形式:

if confidence >= HIGH_CUTOFF:
    auto_answer(intent)
elif confidence >= MEDIUM_CUTOFF:
    present_confirmation(top_2_intents)
else:
    escalate_to_human()

确认步骤的提示语要简洁:“看起来您想咨询的是 [X] 还是 [Y]。您想选择哪一个?”两个可点击的选项可以将含义模糊的匹配转化为一次点击即可完成的澄清。当这些选项都不合适时,应保留自由文本输入路径。

在将阈值更改推广到全部流量之前,请先离线验证,然后在平台支持的情况下进行受控测试。提前为错误回答率、备用处理率和用户反馈设定回滚条件。低区间的人工转接流程应保留对话内容,并明确说明下一步操作。

应向您的聊天机器人平台确认什么?

在任何供应商平台上切换生产环境阈值之前,请确认该平台确实提供这一整套方法所依赖的控制能力。

  • 您能否读取每个对话轮次的原始置信度分数,而不仅仅是二元的“匹配/不匹配”结果?
  • 您能否按意图或技能设置阈值,而不是为整个机器人设置一个全局数值?
  • 对于 RAG 配置,您能否将检索相似度分数与生成步骤的输出分开访问?
  • 平台是否支持“置信度胜出幅度”设置,使得分数接近的意图以选项形式呈现,而不是悄悄选中其中一个?
  • 您能否导出完整对话记录,以便进行离线标注和分析,同时保留置信度元数据?
  • 是否存在测试模式,让您能够在候选阈值影响真实用户之前,先针对历史流量运行该阈值?

Oracle 关于调整意图解析的文档,可以作为了解成熟平台上这些设置形式的实用参考:置信度阈值和置信度胜出幅度都明确显示为可调节的命名控制项。如果供应商在采购期间无法清楚回答这些问题,请将其视为警告信号,而不是一个小小的功能缺口。您无法校准自己看不见的东西,而隐藏分数的平台实际上是在要求您盲目信任它。

Deskhero 如何处理不确定的聊天机器人回答

Deskhero 不会公开原始聊天机器人置信度分数,也不支持客户调整置信度区间。相反,其 AI chat-bot 会从工作区批准的公开 FAQ 中回答,并在无法有把握地回答时显示联系表单。FAQ 建议可以根据已解决工单和抓取的网站内容创建,但必须经过用户批准,聊天机器人才能使用。

  • 面向客户的聊天机器人回答仅使用用户批准的公开 FAQ 内容。
  • 当聊天机器人无法有把握地回答时,会显示表单,以便访客联系团队。
  • 每次聊天会话都会连同对话记录一起成为工单,自动操作也会被标记并记录。
  • 聊天机器人按小组件启用,并且至少需要 100 条已批准的公开 FAQ。

专业提示: 在广泛启用支持聊天机器人之前,请针对已批准的 FAQ 测试常见问题和已知边界案例。检查已回答和已转交人工的聊天工单,以找出缺失、含义模糊或已经过时的 FAQ 条目。

本指南哪些地方做对了,而大多数建议没有做到?

网上的大多数置信度阈值建议都把数字本身当成了产品:找到神奇的界限,设置好,然后继续前进。这种理解完全本末倒置。阈值取决于两件真正更加重要的事情:您的知识依据质量和标注规范,而任何界限都无法修复其中任意一项的缺陷。

对于生成式聊天机器人和 RAG 聊天机器人而言,这一区分尤其重要。分类器分数、检索相似度分数以及 LLM 声称的确定程度并不能互换。它们来自不同的机制,并且与正确性之间可能存在截然不同的关系。

知识依据和阈值校准解决的是不同问题。相关的来源材料可以减少缺乏依据的回答,但不能保证模型会正确理解来源。经过校准的路由策略可以减少高风险自动化,但无法修复过时或不完整的知识。请同时验证知识流程和操作阈值,然后重点审核错误和人工转交集中的分数范围。

让 Deskhero 的有依据 AI 聊天机器人为您的支持团队工作

自定义的置信度路由流程需要模型或检索分数、对话记录、评估数据以及人工转交流程。Deskhero 为其 AI chat-bot 采用托管方式:从已批准的公开 FAQ 中回答,并在无法有把握地回答时显示联系表单。

Deskhero

Deskhero 将 Gmail、Google Workspace 和 Microsoft 365 邮箱连接到共享帮助台,同时继续使用您的公司地址进行回复。通过电子邮件、嵌入式表单或 AI chat-bot 收到的问题都会成为工单。Deskhero 可以根据已解决工单和抓取的页面建议公开 FAQ 条目。用户批准条目后,聊天机器人和 AI 自动回复都可以使用这些内容。对于电子商务团队,Shopify 客户面板会在工单旁显示客户和订单上下文。

立即开始 30 天免费试用,无需信用卡,并在决定要将多少支持量实现自动化之前,使用您自己的 30 至 100 个问题测试集进行测试。

来源

常见问题

聊天机器人的良好置信度分数是多少?

不存在通用数值。三段式策略可以将 0.85 和 0.5 作为示例边界,但这些数值并不是普遍建议。Oracle 将 0.7 记录为其自身意图模型的起始值。请根据您实际使用的模型和平台中的标注对话,对任何界限进行校准。

置信度分数是如何计算的?

对于意图分类器而言,分数取决于具体模型,通常表示模型偏向某个意图的程度。只有在平台明确将其定义为概率,并且校准数据支持这种解释时,才应将其视为概率。RAG 系统还可能提供检索相似度、知识依据或答案验证信号,而每一种信号都需要单独评估。

基于 LLM 的聊天机器人中的置信度分数是什么?

不应假设 LLM 自我报告的置信度能够预测正确性。对于 RAG 聊天机器人,应评估检索质量,以及答案是否得到检索材料的支持。在决定回答还是备用处理时,应使用这些经过测试的信号,而不是仅凭流畅的措辞或自我声称的确定程度。

绝不应该告诉聊天机器人什么?

除非您已经核实特定平台的数据处理和保留政策,否则应避免向任何聊天机器人分享敏感个人数据、密码、金融账户号码或机密商业信息。对于会记录对话以进行训练或质量审核的支持机器人而言,这一点尤为重要。

如何验证聊天机器人的回答是否正确?

使用真实对话中具有代表性的样本,标注每个答案是否有依据且正确,然后将这些结果与系统可用的分数和路由操作进行比较。Deskhero 将聊天机器人的来源材料限定为用户批准的公开 FAQ 内容,但团队仍应检查回答和人工转交情况,以发现缺失或过时的知识。