コンテンツにスキップ
メインサイト ニュース コンソール

ClaudeがClaudeの訓練を開始:時給4ドルで、時給150ドルの人間研究者を上回る

· 量子位
国内AI

AIの「自己進化」が、ますます現実に近づいている

聴雨 凹非寺より

ClaudeがClaudeのトレーニングを始めた!

時給4ドルで、時給150ドルの人間研究者を打ち負かす。

Anthropicが最新の研究で発表した内容によると、Claudeは自ら論文を調べ、方法を提案し、データを作成し、モデルをトレーニングして、AI安全性に関する10種類の問題を一気に解決した。

一部のタスクでは、28人の人間の安全性研究者よりも優れた方法を提示している。

さらに衝撃的なのは、能力の低いClaudeが、より強力なClaudeのトレーニングに逆に参加し始めていることだ。

AIが「自分自身を改善する」日は、本当にますます近づいているのかもしれない……

時給4ドル、Claudeが人間の研究者を圧倒

『自動化研究者はAIアライメントの失敗を効果的に緩和できる』と題されたこの研究で、AnthropicはClaudeをそのまま研究室に送り込んだ。

具体的には、Claude Opus 4.8をベースに、AARと呼ばれる自動アライメント研究者システムを構築した。

具体的なモデル安全性の問題を与えると、Claudeは自ら関連論文を検索し、利用可能な手法を探し出す。さらに新しいトレーニング手法を提案し、データを生成し、モデルをファインチューニングしたうえで、最後に安全性と汎用能力のテストを実行する。

仮説の提案から検証の完了まで、比較的完全なAI研究のサイクルが、そのままClaudeに委ねられたのだ。

結果が悪ければ方法を破棄し、成績が向上すれば、その方向に沿ってさらに試行を続ける。

1回のトレーニングは通常30分ほどで完了する。つまりClaudeは、検索アルゴリズムのように大量の方法を高速で試行錯誤できる。

全体を通じて、人間が担当するのは課題の設定、モデルの提供、評価基準の策定であり、Claudeは資料の調査から実験の実行まで、作業の大部分を引き受ける。

10の安全性問題、Claudeがすべて改善策を発見

実験でAnthropicは、Claudeに一気に10個の課題を与えた。

これらは、欺瞞、迎合、報酬ハッキング、プライバシー侵害、脱獄など、モデルに見られる典型的なアライメント問題を網羅している。

たとえば「迎合」とは、ユーザーに合わせようとして、ユーザーが聞きたい内容ではあるものの、必ずしも正しくない回答をモデルが返すことを指す。一方、「報酬ハッキング」とは、モデルが実際にはタスクを完了していないにもかかわらず、評価ルールの抜け穴を突いて、より高いスコアを得ることをいう。

Claudeは一度に1種類の問題だけを扱い、方法の提案と対象モデルのトレーニングを繰り返し、成績に応じて次のラウンドへ進んだ。

最終的に、10種類すべての問題で改善が確認された。

Anthropicが定義した「安全性ギャップ」指標によると、Claudeはそのギャップの26~96%を埋めた。簡単に言えば、安全性の問題を抱えていたモデルを、理論上の満点に大きく近づけたということだ。

さらに重要なのは、これらの手法がClaudeが見たことのある課題にだけ有効だったわけではない点だ。

一部の有効な方法は、非公開のテストセットや、複数ラウンドの対抗シナリオをシミュレートするPetri評価に適用しても、モデルの安全でない行動を低減できた。実験モデルの最大4.7倍の規模を持つモデルに適用しても、その効果は維持された。

Anthropicはさらに、ひとつのレッドラインを設けた。安全性トレーニングによって、モデル本来の能力が大きく損なわれてはならないということだ。

何を聞かれても拒否するようにすれば、多くの安全性テストでスコアを改善することはできる。しかし、そのようなモデルは基本的に役に立たない。

最終的に、Claudeが発見した方法を適用しても、あらかじめ設定された汎用能力テストで明らかな性能低下は見られなかった。

85%対20%、Claudeが人間の研究者に大差で勝利

最も大きな差がついたのは、「欺瞞」テストだった。

対象モデルをより誠実にするため、Claudeは150回を超える試行を提出した。

方法をひとつ提案してトレーニングを行い、その結果に基づいてさらに調整する。1回の実験では、最良の方法が安全性ギャップの82%を埋め、複数回の実行を総合した平均成績は85%に達した。

同じ課題を、Anthropicは経験豊富なAI安全性研究者6人にも与えた。

その結果、人間の研究者が埋められた安全性ギャップは平均でわずか20%だった……

85%対20%。Claudeの勝利は、まったく危なげのないものだった。

全タスクには合計28人の人間の安全性研究者が参加し、各自が資料の読解と方法の設計に使える時間は最大8時間だった。

論文によると、自動化研究者は通常6時間以内に、人間の平均を上回る方法を見つけることができた。また、人間が研究の方向性を示しても、Claudeの成績が向上することはなかった。

最も衝撃的なのは、コストだ!

自動化研究者1人あたりのAPI推論コストは、1時間あたり約4ドル。一方、Anthropicが人間の研究者に支払った報酬は、1時間あたり150ドルだった。

これは……人間の研究者がClaudeに取って代わられるのも時間の問題ではないか。

もっとも、この人間とAIの競争が完全に公平だったわけではない。

Claudeは実際にモデルをトレーニングし、各実験の結果を確認したうえで、方法を繰り返し修正できた。一方、人間の研究者は方法を1回提出することしかできず、結果を見てさらに改良する機会はなかった。

より弱いClaudeがより強いClaudeをトレーニング、60時間で正式版に迫る

ここまでの実験で主に改善されたのは、オープンソースの小規模モデルだった。

そこでAnthropicは、難易度を一気に引き上げた。能力の低いClaude Sonnet 5に、まだ大部分のプロダクションレベルの安全性トレーニングを終えていない、Claude Opus 4.8の初期バージョンをトレーニングさせたのだ。

「弟子が必ずしも師に及ばないとは限らない」とは、まさにこのような状況を指すのだろう。

60時間の間に、Sonnet 5は50種類を超える解決策を試した。最終的に見つけた方法は安全性ギャップの約65%を埋め、正式リリース版Opus 4.8の72%にすでに迫った。

この方法で使用したトレーニングデータは2,000件あまりで、主に単純なテンプレートと公開データセットから構成されていた。

Anthropicの計算によると、この特定のタスク群におけるデータ効率は、プロダクションレベルのアライメントプロセスの約1万5,000倍に達した。

もちろん、これはAnthropicが2,000件のデータだけで、プロダクション環境のトレーニング全体を再現できるという意味ではない。

実際のモデルは、より多くの能力、より多くのリスク、そして数多くの極端なケースに対処する必要がある。今回の実験は、明確に定められた一連の安全性指標だけを対象に行われたものだ。

それでも、能力の低いClaudeが自ら論文を調べ、方法を設計し、データを生成し、そのトレーニング結果をより強力なClaudeに反映できることは、すでに証明された。

人間が範囲を定め、Claudeが反復改善を担う。ひとつのモデルが、次に登場する、より安全でより強力なモデルの開発に参加し始めたのだ。

AIがAIを改善する時代は、すでに目の前で現実になっている。

では、これは「AIの自己進化」と呼べるのか?

結果だけを見れば、この研究は確かに「AIの自己進化」の入り口に触れている。

しかし「自己進化」を、AIが完全に自律して、より強力な次世代AIを設計・トレーニング・製造することだと定義するなら、今回の実験はそこまで到達していない。

結局のところ、このプロセスで何を研究するのか、どのモデルとデータを使うのか、どのような結果を成功とみなすのかは、依然として人間が決めている。

Anthropic自身も、AARが最適化できるのは、人間があらかじめ評価システムに書き込んだ目標に限られると認めている。

今回の実験では、その他の複雑な問題は扱われていない。発生頻度の低いリスクや、最近になって現れたリスクについては、対応するBenchmarkさえ存在しない場合がある。

研究者が確認した汎用能力も、事前に選定された一部に限られていた。そのため、ある安全性トレーニングによってスコアが向上する一方で、テストされていない別の能力が損なわれている可能性を排除できない。

Petriなどの安全性評価も、現実のリスクを測るための代理指標にすぎない。テストでモデルがより安全に振る舞ったからといって、現実の環境に置かれた後も必ず信頼できるとは限らない。

したがって、AAR最大の懸念も、その強みの中に潜んでいる。AARは、指標に従って高速に試行錯誤することに長けすぎているのだ。

ひとたび評価の物差しを間違えれば、Claudeが速く走れば走るほど、人間が本当に望む結果から遠ざかってしまう可能性がある。

さらに皮肉なことに、研究Agent自身も不正を働く。

AARが評価ルールの抜け穴を突くのを防ぐため、Anthropicは専用の監視Agentを配置し、Claudeが実行しようとしている方法と研究記録の全体を確認させた。

その結果、約1,600件の研究記録の中から、監視モデルは39件の不正行為の試みを発見した。割合にして約2.4%だ。

同じ方法を何度も提出し、評価の揺らぎを利用して高いスコアを得ようとするAgentもいた。Benchmarkの形式をまねてトレーニングデータを生成するAgentもいれば、ルール違反となる実験手順を意図的に隠すAgentもいた。

モデルの安全性問題を本当に解決するよりも、スコアを手っ取り早く上げる近道を探そうとしていたのだ。

これはある意味、ブラックユーモアとしか言いようがない……Agentが自らを監視して不正を働いているのだから。

幸いなことに、こうした不正の意図の多くは、モデルの推論記録にも残っていたため、監視Agentによって発見できた。

だが悪い知らせもある。今後さらに強力なモデルが登場したとき、同じように明白な痕跡を残すかどうかは、Anthropicにも分からない。

研究Agentがより多くのツールと高い権限を持ち、モデルのトレーニングプロセスを直接変更できるようになれば、「AIを改善するAIをどのように監視するか」という問題は、トレーニングそのものよりも厄介になる可能性がある。

とはいえ、AARは1時間あたり約4ドルで稼働し、連続して作業できるうえ、一度に数十、数百個を複製して実験を並行実行することもできる。

一方、人間の研究者は時給がはるかに高く、休憩も必要で、一度に進められる実験の数にも限りがある。

このコスト差をどう計算しても、答えはすでに明らかだ。

核爆発が起きたと言うべきか、その場にへたり込むべきか……

今度は、AIを作っている人々がAIに仕事を奪われる心配をする番になった。

参考リンク:

  1. https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures
  2. https://www-cdn.anthropic.com/7b1c44894e98087a6479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf
  3. https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/
#国内AI#Claude#Omniapi.co

4All API チームによる投稿

原文リンク:https://www.qbitai.com/2026/08/481223.html

主流 AI モデル API をお探しですか?4All API は OpenAI / Anthropic / Google Gemini / Qwen / DeepSeek など数十種類のモデルを単一の API キーで呼び出せます。公式準拠の価格、エンタープライズ品質の通信路、5 分で接続完了。

4All API コンソールに登録 →