跳转到内容
主站 新闻 控制台

新论文:迈向 AI 智能体可靠性科学

分析实践

作者:Stephan Rabanser、Sayash Kapoor、Arvind Narayanan

假设你听说有一个新的 AI 智能体,可以通过代为购物、编写代码、发送电子邮件,或代你处理客户来提升生产力。你会相信它吗?这个智能体能否足够可靠地完成工作?毕竟,智能体出错的许多 惊悚 案例已经屡见不鲜。

令人惊讶的是,尽管 AI 智能体缺乏可靠性早已是众所周知的问题,但目前 AI 行业既没有衡量可靠性的好工具,甚至连“可靠性”的良好定义都没有。

Arvind 和 Sayash 长期以来一直在思考这个问题。去年秋天,博士后研究员 Stephan Rabanser 加入了我们;他的博士研究关注的是更简单、更传统的 AI 系统中的可靠性问题。我们又招募了几位独立研究者,并发布了我们希望是一项全面的可靠性测量工作。我们的论文草稿题为 Towards a Science of AI Agent Reliability

我们借鉴了核安全和航空安全等多个领域的见解,并将可靠性分解为 12 个不同维度。我们在两个互补基准上评估了 14 个模型,发现近两年来能力的快速提升只带来了有限的可靠性改善。我们的交互式仪表板见这里

尽管我们目前的发现还只是初步的,但我们希望它们能够帮助解释行业中许多人的困惑:为什么 AI 智能体在能力基准上表现惊人,但其经济影响却进展缓慢。1 为了帮助社区系统地跟踪可靠性,我们计划推出一个 AI 智能体“可靠性指数”。我们希望这能促使研究人员和业界投入精力,改进可靠性。

目录

  1. 准确率还不够:可靠性的四个维度

  2. 能力提升很快,但可靠性改善有限

  3. 我们为什么可能是错的

  4. 部署者应该做些什么不同的事?