著者:Stephan Rabanser、Sayash Kapoor、Arvind Narayanan
AIエージェントが生産性を高めてくれる――買い物を代行したり、コードを書いたり、メールを送ったり、顧客対応を任せたりできる――と聞いたら、あなたはそのエージェントを信頼するでしょうか?そのエージェントは、タスクを十分に確実に遂行できるのでしょうか?実際、エージェントが問題を起こした恐ろしい事例はすでに数多くあります。たとえば、この事件もその一つです。
意外なことに、AIエージェントの信頼性が低いことは以前から広く認識されているにもかかわらず、現在のAI業界には、信頼性を測定するための優れたツールがないばかりか、「信頼性」についての適切な定義すら存在していません。
ArvindとSayashは、以前からこの問題について考えてきました。昨年秋、ポスドク研究員のStephan Rabanserが私たちに加わりました。彼の博士課程での研究テーマは、より単純で従来型のAIシステムにおける信頼性の問題でした。さらに数名の独立研究者にも参加してもらい、信頼性を包括的に測定することを目指した研究成果を発表しました。論文の草稿のタイトルは「AIエージェントの信頼性科学に向けて」(Towards a Science of AI Agent Reliability)です。
私たちは、原子力安全や航空安全をはじめとするさまざまな分野の研究成果を参考にし、信頼性を12の異なる側面に分解しました。そして、相補的な2つのベンチマークを用いて14のモデルを評価した結果、過去2年間に能力が急速に向上したにもかかわらず、信頼性の改善は限定的にとどまっていることがわかりました。詳しくは、インタラクティブなダッシュボードをご覧ください。
現時点で私たちの発見はまだ初期的なものですが、AIエージェントが能力ベンチマークでは優れた成績を示しているにもかかわらず、その経済的な影響が徐々にしか現れていない理由について、業界の多くの人々が困惑している状況を説明できるのではないかと考えています。[^1] コミュニティ全体が信頼性を体系的に追跡できるよう、私たちはAIエージェントの「信頼性指数」を公開する予定です。これによって、研究コミュニティと産業界が信頼性の向上にさらに注力することを期待しています。
