跳转到内容
主站 新闻 控制台

新论文:迈向 AI 智能体可靠性科学

分析实践

作者:Stephan Rabanser、Sayash Kapoor、Arvind Narayanan

假设你听说有一种新的 AI 智能体可以提升生产力——替你购物、编写代码、发送电子邮件,或代表你处理客户。你应该信任它吗?这个智能体能否足够可靠地完成任务?毕竟,已经有许多关于智能体出问题的恐怖故事,例如这起事件。

令人意外的是,尽管人们早已充分认识到 AI 智能体缺乏可靠性,但目前 AI 行业既没有用于衡量可靠性的良好工具,甚至没有一个关于“可靠性”的良好定义。

Arvind 和 Sayash 长期以来一直在思考这个问题。去年秋天,博士后研究员 Stephan Rabanser 加入了我们。他的博士研究关注的是更简单、更传统的 AI 系统中的可靠性问题。我们又邀请了几位独立研究人员,并发布了我们希望能够全面衡量可靠性的研究成果。我们的论文草稿名为《迈向 AI 智能体可靠性科学》(Towards a Science of AI Agent Reliability)。

我们借鉴了核能安全、航空安全等许多其他领域的研究成果,并将可靠性分解为 12 个不同维度。我们使用两个互补基准测试对 14 个模型进行了评估,发现近两年来能力的快速进步只带来了有限的可靠性提升。请参阅我们的互动式仪表板。

AI 智能体可靠性

虽然现阶段我们的发现仍是初步的,但我们希望它们能够解释业内许多人为何感到困惑:尽管 AI 智能体在能力基准测试中表现出色,其经济影响却一直在逐步显现。[^1] 为帮助整个社区系统地追踪可靠性,我们计划推出 AI 智能体“可靠性指数”。我们希望这能推动研究界和产业界投入更多精力来提升可靠性。

目录

  1. 准确率并非全部:可靠性的四个维度
  2. 能力提升迅速,但可靠性改善有限
  3. 我们为何可能是错的
  4. 部署者应采取哪些不同做法?