コンテンツにスキップ
メインサイト ニュース コンソール

あなたのAIエージェントに必要なメモリ容量は?

· Hugging Face 翻訳済
教程模型卡

当社の前回の記事では、ALTK-Evolve と ACE を比較し、エージェントの自己蒸留によるガイドラインをどのように提供するか——タスクごとに数個を検索するのか、完全なセットを注入するのか——が、精度とコストの両方に影響することを示しました。本稿では、さらに根本的な問いである、どれだけのガイドラインを提供すべきかについて検討します。

エージェントにエージェントメモリを持たせるという考えは、単純に聞こえます。過去の作業から経験を抽出し、それをコンテキストに戻す。経験が多いほど、パフォーマンスも向上するはずです。しかし、必ずしもそうとは限りません。30B の高密度モデルから最先端のクローズドシステムまで、8 個のモデルに評価を拡張したところ、特に際立った発見がありました。

エージェントメモリは、単に有効化すればよい機能ではありません。モデルに応じて投与量を調整する必要がある能力です。

TL;DR

  • ALTK-Evolve により、エージェントは自身の過去の軌跡から学習できます。再利用可能なガイドラインを抽出し、推論時に注入します。モデルの重みの更新も、人手によるアノテーションも必要ありません。

  • **適切な投与量はモデルの層によって異なります。**改善の余地がある高性能モデルは、ガイドラインの完全なセットを必要とします。より弱いモデルは、コンパクトな中核セットとタスク単位の検索を組み合わせた場合に最も良い結果を示します。一方、すでに飽和状態に近いモデルでは、測定可能な効果は確認されませんでした。

  • **厳選検索は、精度が最も高い方式にも、コストが最も低い方式にもなり得ます。**gpt-oss-120b ではタスク完了率が 16.1 ポイント向上した一方、token 数の増加はわずか 5% でした。また、プロンプトキャッシュにより、ガイドラインの完全なセットも本番環境で許容可能なコストに収められます。

核心的な洞察:投与量は能力によって決まる

すべてのモデルが、同じ量のメモリから恩恵を受けられるわけではありません。異なる能力レベルをカバーする 8 個のモデルを対象に評価したところ、繰り返し現れる 3 つのパターンが確認されました。

  • 改善の余地がある高性能モデルは、ガイドラインの完全なセットを必要とします。これにはすべてのガイドラインに加え、まれなエッジケースに関する教訓も含まれます。これらのモデルには、すべての情報を吸収して適用する能力があります。自己抽出したガイドラインの完全なセットを与えた場合、DeepSeek-V3.2(671B MoE)のタスク完了率は 9.5 ポイント向上しました。

  • **小型または低性能のモデルは、大規模なガイドラインセットに圧倒されます。**このようなモデルでは、コンパクトで確信度の高い中核セットに、タスク単位で検索した少数の関連ガイドラインを加える方法が最も効果的です。gpt-oss-120b(117B MoE)は、この選択的な方式によって 16.1 ポイント向上しました。一方、ガイドラインの完全なセットでは改善幅が小さく、token コストは約 **50%**高くなりました。

  • **すでに飽和状態に近いモデルでは、測定可能な効果は確認されませんでした。**これを「飽和モード」と呼びます。この名称は観察結果を表すものであり、原因が証明されているわけではありません。モデルがこれらのタスクの性能上限にすでに近づいている可能性や、ガイドラインが残りの失敗事例をカバーしていない可能性、あるいはモデルがガイドラインを効果的に適用できていない可能性があります。今回の実験では、GLM-5(745B MoE)がこのパターンに該当しました。

*モデルがどのパターンに該当するかを決めるのは、パラメータ数だけではありません。*ベンチマークにおける改善余地、コンテキストウィンドウのサイズ、アーキテクチャ、ガイドラインの品質、タスク分布などが、モデルが最終的にどのパターンに入るかに影響するようです。これらの要因を切り分ける作業は、現在も進行中です。具体的な原因が何であれ、実務上の結論は変わりません。適切なメモリの投与量はモデルによって異なり、調整することが可能です。

学習はモデルの内部ではなく、モデルの周囲で起こる

ここでいう「メモリ」は、過去の会話履歴を再生するものではありません。エージェントの過去の軌跡から抽出した、ガイドライン——有効な戦略、避けるべきミス、エッジケースに関する知見——の集合です。全体の流れは次のとおりです。

  • エージェントがタスクの完了を試み、軌跡を生成します。

  • ALTK-Evolve が、成功および失敗した実行結果から行動に関するガイドラインを抽出します。

  • システムが、それらのガイドラインを再利用可能なセットに統合します。

  • 推論時には、ガイドラインの完全なセット、またはタスクに関連する部分がエージェントに提供されます。

モデルの重みは更新されません。この学習ループが変えるのは、エージェントが利用できるガイダンス情報であり、基盤モデルそのものではありません。これが、導入しやすく、今回テストした 8 個のモデルに移植できる理由です。

異なる能力レベルにおける結果

AppWorld 上で評価を実施しました。AppWorld には、9 個のシミュレーションアプリ(カレンダー、メッセージ、決済など)を対象とする 585 個のマルチステップタスク(test_normal 168 個、test_challenge 417 個)が含まれています。タスクは 2 つの方法で評価しました。エージェントが各タスクを完全に完了したかどうか(TGC——タスク目標完了率、Task Goal Completion)と、あるシナリオのすべてのバリエーションに合格したかどうか(SGC——シナリオ目標完了率、Scenario Goal Completion)です。後者は、より厳格な「すべてかゼロか」の指標です。完全な定義は付録に記載しています。

比較した 3 つの構成

メモリに関する研究で最も混乱しやすいのは、コンテキストウィンドウに実際に何が含まれているのかという点です。そこで、まずこの 3 つの構成を明確に説明します。

2 つのメモリ構成では、同じガイドラインセットを使用しています。このセットは、上記のプロセスによって AppWorld の訓練セットから一度だけ抽出されたものです。両者の唯一の違いは、このガイドラインセットをどのように提供するかにあります。ガイドラインの完全なセットでは、各 ReAct ステップで内容全体を注入します。一方、厳選検索では、その中から選択したサブセットを提供します。ガイドラインの生成方法は変更しておらず、ガイドラインセットの構築にテストセットのデータは一切使用していません。

構成エージェントのコンテキストに含まれる内容
ベースラインメモリなし——モデルをそのまま利用した状態。
ガイドラインの完全なセット抽出されたすべてのガイドラインを、各 ReAct ステップで注入。
厳選検索同じガイドラインセットから、固定の高確信度コアセットを選択し、さらに各タスクについて少数の関連ガイドラインを検索(固定部分 + 可変部分)。

モデルが抽出できるガイドラインの数は、モデル自身の能力によって異なります。そのため、モデル間で比較できない抽出数そのものではなく、方式——「ガイドラインの完全なセット」と「厳選検索」——に基づいて構成を報告します。

3 つのパターンの概要

以下は、8 モデル評価における代表的なモデルです。指標には test_normal のタスク完了率(TGC)を使用しています。

画像

図 1。観察された 3 つのパターンにおける代表的なモデル。棒グラフは、AppWorld test_normal におけるベースライン構成と最良のメモリ構成の TGC を示しています。差異を見やすくするため、横軸は 40% から始めています。TGC だけを見ると、SGC のより大きな改善幅を過小評価してしまいます。下表の SGC 列を参照してください。

図では、見やすさを考慮して TGC を示しています。下表では、より厳格な SGC 指標を補足しています。SGC では、通常さらに大きな改善が見られます。

モデルパターンベースライン TGC / SGC最良のメモリ構成 TGC / SGC最良の構成Δ TGCΔ SGC
gpt-oss-120b(117B MoE)弱 / 選択的39.9 / 21.456.0 / 37.5厳選検索……