作者:Stephan Rabanser、Sayash Kapoor、Arvind Narayanan
假设你听说有一个新的 AI 智能体,可以通过代为购物、编写代码、发送电子邮件,或代你处理客户来提升生产力。你会相信它吗?这个智能体能否足够可靠地完成工作?毕竟,智能体出错的许多 惊悚 案例已经屡见不鲜。
令人惊讶的是,尽管 AI 智能体缺乏可靠性早已是众所周知的问题,但目前 AI 行业既没有衡量可靠性的好工具,甚至连“可靠性”的良好定义都没有。
Arvind 和 Sayash 长期以来一直在思考这个问题。去年秋天,博士后研究员 Stephan Rabanser 加入了我们;他的博士研究关注的是更简单、更传统的 AI 系统中的可靠性问题。我们又招募了几位独立研究者,并发布了我们希望是一项全面的可靠性测量工作。我们的论文草稿题为 Towards a Science of AI Agent Reliability。
我们借鉴了核安全和航空安全等多个领域的见解,并将可靠性分解为 12 个不同维度。我们在两个互补基准上评估了 14 个模型,发现近两年来能力的快速提升只带来了有限的可靠性改善。我们的交互式仪表板见这里。
尽管我们目前的发现还只是初步的,但我们希望它们能够帮助解释行业中许多人的困惑:为什么 AI 智能体在能力基准上表现惊人,但其经济影响却进展缓慢。1 为了帮助社区系统地跟踪可靠性,我们计划推出一个 AI 智能体“可靠性指数”。我们希望这能促使研究人员和业界投入精力,改进可靠性。
