评估优先的AI代理:自信地扩展客户支持(受Zepto的Databricks方法启发)
客户支持正处在一个十字路口。随着SaaS产品的发展,支持团队面临着一个不可能的等式:不断增长的工单量、客户对即时回复日益增长的期望,以及限制线性招聘的预算约束。AI代理的前景从未如此诱人,然而许多早期部署却以惨败告终——幻觉答案、不一致的质量以及沮丧的客户。成功的故事与警示案例之间的区别是什么?答案,正如Zepto等创新公司所展示的那样,在于评估优先的方法。
在Databricks最近的一篇博客文章中,Zepto详细介绍了他们如何使用基于Databricks和MLflow构建的AI代理来扩展客户支持,并在部署前坚持不懈地聚焦于评估。这不仅仅是一种技术策略,更是一项商业要务。对于正在评估AI解决方案的支持领导者来说,教训很清楚:你无法自动化那些你无法衡量的东西。Successly将这一理念融入其AI支持自动化平台的每一层,从而践行了这一哲学。
为什么传统AI代理在客户支持中失败
生成式AI在支持领域的吸引力很简单:它可以起草回复、总结问题,甚至端到端地解决工单。但演示与实际生产之间的差距是巨大的。如果没有严格的评估,AI代理往往会给出自信但错误的答案,忽略上下文,或在需要升级时未能升级。结果呢?转嫁率在仪表板上看起来不错,却掩盖了不断增长的客户投诉积压和受损的品牌声誉。
传统的AI支持自动化方法通常遵循“部署并祈祷”的模式:构建一个模型,将其集成到帮助台,并监控响应时间等基本指标,同时忽略这些回复的质量。这种短视导致了可预见的失败。Gartner在2023年的一项研究发现,45%的AI聊天机器人项目未能超出试点阶段,因为它们缺乏明确的成功指标。核心问题不在于技术,而在于缺乏将AI性能与业务成果联系起来的评估框架。
Zepto的经验强调了这一点。通过将评估视为AI开发生命周期中的一等公民,他们避免了推出一个“感觉”正确但在现实条件下失败的代理。相反,他们构建了一个系统,其中每个回复都根据预定义的质量标准进行评分,并且只有在达到准确性、安全性和客户满意度阈值时,模型才会被提升到生产环境。
评估优先范式:Zepto做对了什么
评估优先的方法颠覆了传统脚本。它不是在评估AI输出时事后才考虑,而是将评估作为开发的基础。Zepto使用Databricks和MLflow创建了一个自动化的评估流水线,从多个维度对模型回复进行评分:事实正确性、语气、完整性和安全性。只有通过这些门槛的代理才能被释放来处理真实的客户互动。
这种方法论与现代软件开发的方式高度一致:机器学习的持续集成和持续交付(CI/CD),通常称为MLOps。但不同之处在于强调了质量评估 要放在任何生产流量之前。对于支持团队来说,这意味着你可以自信地推出一个AI代理,因为它已经针对数千个模拟客户场景进行了测试,并达到了性能基准。
当然,并非每个组织都有资源在Databricks上构建自定义评估堆栈。这就是Successly这样的平台发挥作用的地方——它们将评估优先的原则嵌入到核心产品中,因此支持领导者无需ML工程师团队就能实现类似的严谨性。然而,关键的收获是普遍的:你无法改进你无法衡量的东西。
“先评估后自动化不是奢侈品;它是在不扩大风险的情况下扩展AI支持的唯一途径。”
构建支持AI的评估框架
那么,评估优先的框架在实践中是什么样的?无论你使用Databricks和MLflow、Successly还是其他平台,原则都是相同的。以下是基本组成部分:
1. 定义明确的成功指标: 从你关心的业务成果开始。常见指标包括转嫁率、客户满意度(CSAT)、首次接触解决率(FCR)、平均处理时间和每工单成本。对于AI代理,添加技术指标,如答案准确性、幻觉率和延迟。这些指标应该是定量的,并与特定阈值挂钩。
2. 构建黄金评估数据集: 创建一个代表性的支持交互集合,包括历史工单和合成边界案例,以反映真实的客户查询。用预期的正确答案或可接受范围进行标注。这个数据集成为评估任何AI代理的基准。
3. 自动化评分: 使用评估工具,让AI代理针对黄金数据集运行,并自动计算分数。例如,基于LLM的评判者可以对回复的准确性和帮助性进行评分。这减少了人工审核时间,并支持快速迭代。
4. 设置通过门槛: 为每个指标建立通过/失败标准。例如,代理必须达到至少95%的答案准确性和90%的积极语气才能上线。任何未能通过这些门槛的模型都会被送回改进。
5. 在生产中监控: 评估不会随着上线而停止。持续抽样实时交互,根据相同的指标进行评分,并在性能低于阈值时触发警报。这个闭环确保了AI在客户查询演变时保持可靠。
| Metric | Before AI | After Evaluation-First AI |
|---|---|---|
| Average Response Time | 8 hours | 2 minutes |
| First Contact Resolution Rate | 55% | 82% |
| Customer Satisfaction (CSAT) | 72% | 88% |
| Cost per Ticket | $12.50 | $4.20 |
上表展示了评估优先的AI代理在正确部署时的典型改进。然而,这些结果并非自动实现,它们需要基于严格评估的仔细调优。
量化ROI:评估优先的商业案例
对于商业领袖来说,最终的问题是:投资回报率是多少?评估优先的方法在三个方面带来可量化的ROI:成本节省、解决速度和客户保留。
考虑成本节省。通过将相当一部分工单转嫁给AI,支持团队可以在不增加人员的情况下处理更多工作量。根据麦肯锡的一份报告,成功在客户服务中实施AI的公司看到支持成本降低了20-50%。但关键词是成功,没有评估,AI往往会错误地转嫁,导致工单返工和升级带来的更高成本。
上方的柱状图展示了在实施评估优先的AI后,工单量通常会显著下降。Zepto报告了类似的结果:通过确保其客服人员准确可靠,他们能够更有效地分流简单查询,从而将人工客服解放出来处理复杂、高价值的互动。
解决速度是另一个关键指标。如今客户期望近乎即时的响应。能够在几秒钟(而非几小时)内解决常见问题的AI客服,能极大提升客户体验。但脱离准确性的速度毫无价值;快速给出错误答案只会让客户更加沮丧。评估优先确保速度与正确性相结合。
折线图展示了评估优先AI对客户满意度(CSAT)的复合影响。起初,随着模型学习和调优,改善幅度较为温和。但随着时间的推移,随着评估数据反馈到模型改进中,CSAT稳步攀升。这种正反馈循环是成熟评估优先系统的标志。
最后,客户留存是隐藏的投资回报率(ROI)。一次糟糕的客服体验就可能导致客户流失。通过降低错误率并提高一致性,评估优先AI可以保护收入。事实上,Zendesk的一项研究发现,74%的客户在经历糟糕的客服体验后会转向竞争对手。评估优先将这种风险降至最低。
Successly 如何实施评估优先自动化
虽然Zepto使用Databricks和MLflow构建了自定义评估管道,但大多数客服团队并不具备这种条件。他们需要一个开箱即用、提供评估优先能力的平台。这正是Successly的强项。Successly的AI客服自动化平台围绕与Zepto倡导的相同原则构建:定义指标、持续评估、仅部署通过评估的模型。
以下是Successly如何将评估优先付诸实践:
内置评估评分: Successly会自动从多个维度(准确性、语气、完整性、策略合规性)对每条AI响应进行评分。您无需构建自己的评判模型,平台会为您完成。
黄金数据集管理: Successly帮助您从历史工单中创建并维护一个基准数据集。您还可以使用合成场景来扩充它,以覆盖边缘情况。
部署前门控: AI客服上线前,Successly会针对您的黄金数据集运行它,并提供详细报告。您设定阈值;如果模型未通过,您可以使用内置工具进行微调。
持续监控: 投入生产后,Successly会对实时互动进行抽样、评分,并在性能漂移时向您发出警报。该平台还提供A/B测试功能,便于比较不同版本的AI客服。
通过采用像Successly这样的评估优先平台,客服团队可以复制像Zepto这样精通数据的公司的成功,而无需从零开始构建基础设施。
“评估优先的心态并非追求完美,而是因为衡量了重要指标,从而有信心扩大自动化规模。”
利用AI客服规模化客服支持的最佳实践
除了技术之外,通过评估优先AI来规模化客服支持还需要团队文化和流程的转变。以下是借鉴Zepto经验和行业基准的可行最佳实践:
1. 从小范围开始: 不要试图一次性自动化所有事情。从高频、低复杂度的类别入手,例如密码重置或账单查询,这些类别的正确答案定义明确。经过严格评估后,再逐步扩展。
2. 让人工客服参与其中: 评估优先并不意味着移除人类。相反,人工反馈成为评估的真相标准。鼓励客服对AI建议进行评分,并利用这些数据进行重新训练和重新评估。
3. 将评估视为产品指标: 就像您跟踪正常运行时间或延迟一样,在仪表盘上跟踪AI评估分数。让整个团队都能看到,并为AI性能制定服务等级协议(SLA)。
4. 频繁迭代: 今天通过评估的模型可能随着新查询类型的出现而明天失败。安排定期的重新评估周期(每周或每月),并根据需要重新训练。
5. 与客户透明沟通: 如果客户知道他们正在与AI互动,并且该AI被要求保持高标准,信任感会增加。坦诚告知局限性,并提供便捷的升级渠道以转接至人工客服。
这些实践,加上正确的评估基础设施,能够实现可持续的规模化。Zepto与Databricks和MLflow的合作历程证明了优先评估所能带来的可能性。对于大多数客服主管而言,实现类似结果的最快途径是通过一个已经体现这些原则的专用平台。
上方的环形图展示了实施评估优先AI后解决类别的典型分布。请注意,大多数工单实现了全自动化,但仍有相当一部分涉及人工监督。这种平衡至关重要:AI应可靠地处理其能处理的部分,并将剩余的工单无缝升级。
结论:评估优先成为新标准
客服领域盲目AI自动化的时代已经结束。客户要求准确、快速、一致的服务,客服主管则要求可衡量的ROI。评估优先的AI客服——由Zepto与Databricks和MLflow率先实践,如今通过Successly等平台可用——为实现这两者提供了经过验证的路径。
通过从“部署并祈祷”转变为“评估,然后自动化”,客服团队可以实现工单量大幅减少、CSAT提升、成本显著节约,同时维护作为客户关系基础的信任。数据不言自明:更高的分流率、更快的解决速度和更低的成本绝非偶然;它们是严格评估的直接结果。
在考虑您的AI客服策略时,请问自己:您在自动化之前进行评估了吗?如果没有,您就是在放弃ROI并冒着客户信任风险。采用评估优先的心态,选择合适的工具,并自信地扩大规模。