コンテンツにスキップ
メインサイト ニュース コンソール

新論文:AIエージェ

· Normal Tech (AI Snake Oil) 翻訳済
分析实践

著者:Stephan Rabanser、Sayash Kapoor、Arvind Narayanan

買い物、コード作成、メール送信、あるいは顧客対応などを代行して生産性を高めてくれる、新しい AI エージェントが登場したとしましょう。あなたはそれを信頼できますか?そのエージェントは、十分に信頼できる形で仕事をこなせるでしょうか?何しろ、エージェントが引き起こしたトラブルの多くの 恐ろしい 事例は、すでに数多く報告されています。

驚くべきことに、AI エージェントの信頼性不足が以前から周知の課題であるにもかかわらず、現在の AI 業界には信頼性を測定する優れたツールがなく、それどころか「信頼性」の明確な定義すら存在しません。

Arvind と Sayash は、以前からこの問題について考えてきました。昨年秋、博士研究員の Stephan Rabanser が加わりました。彼の博士課程での研究テーマは、よりシンプルで伝統的な AI システムにおける信頼性の問題でした。私たちはさらに数名の独立系研究者を募り、包括的な信頼性測定の取り組みとなることを目指した成果を公開しました。私たちの論文の草稿は、Towards a Science of AI Agent Reliability というタイトルです。

私たちは、原子力安全や航空安全など複数の分野の知見を取り入れ、信頼性を 12 の異なる次元に分解しました。そして、相互に補完し合う 2 つのベンチマークを用いて 14 のモデルを評価した結果、ここ 2 年間の急速な能力向上に対して、信頼性の改善は極めて限定的であることが分かりました。インタラクティブなダッシュボードはこちらからご覧いただけます。