世界最強C
編集部 凹非寺より
来た、来た!!
つい先ほど、待望の GPT-6 Astra と GPT-6 Astra Pro が正式にリリースされました!!!
GPT-6 Astra は世界で最も知的かつ調和の取れたモデルであり、Computer Use、Browser Use、ソフトウェアエンジニアリング、サイバーセキュリティ、科学、専門業務において新たな基準を打ち立てます。

AGI時代が、OpenAIによって一方的に「開幕」してしまいました……。
GPT-6の発表会の最後、OpenAI社長のGreg Brockmanは、次の一言を直接投げかけました。
Welcome to the AGI era. (AGI時代へようこそ)

ClaudeやGrokがそろってダウンしたのも無理はありません。Astraが起動してインターネットをスキャンし、地球上のLLMを一掃してしまったのですから――
ウルトロン(OpenAI版)が本当に来た(doge)。

もちろん、今回のOpenAIはまったく控えめではありません。学習規模も性能向上も、すべてがフルスロットルです。
発表によると、AstraはOpenAI史上最大規模の学習タスクであり、テキサス州のStargateキャンパスで 10万基以上のGPU を使用して事前学習を完了しました。
また、前世代モデルが学習時の監督に深く関与した、OpenAI初のフラッグシップ製品でもあります。
まさに、新人をベテランが指導する形。OpenAIのRSIは本当に回り始めたようです……。
GPT-6の価格も正式に発表されました。APIの料金は以下のとおりです。
- 入力:100万tokenあたり10ドル
- 出力:100万tokenあたり50ドル
GPT-5.6 Solの2.5倍で、つい先ほど発表されたFable 5.1と同額 です。
(GPT-5.6 Solの現在の公式価格は、入力が100万tokenあたり4ドル、出力が20ドルです。)

ベンチマークは「飽和」に近づく
今回のGPT-6 Astraにおける最も大きな変化は、「質問に答える」ことからさらに一歩進み、「仕事を直接完遂する」 方向へ進化した点です。
文章やコードを生成できるだけでなく、コンピューターやブラウザーを操作し、さまざまなソフトウェア上で複数の手順からなるタスクを実行できます。そして最終的には、そのまま使える文書、表計算シート、プレゼンテーション、Webサイト、さらにはエンジニアリングプロジェクトまで納品できます。
成績表については……誰が見ても驚くほどの結果です。なかでも特に目を引くのは、次の3項目です。
- FrontierMath Tier 4 v2:97.6%
- ARC-AGI-3:99.9%(前世代のGPT-5.6 Solは7.8%)
- ExploitBench:100%
高難度の数学テスト、未知の環境における推論テスト、脆弱性の悪用テスト。その3つすべてで、満点に近いスコアを叩き出しました。

このうち ARC-AGI-3 は、大規模モデルが未知の環境に適応する能力を試すためのテストです。ルールの説明は一切なく、モデルを見たことのない2次元ゲームの中に放り込み、プレイしながらクリア方法を探らせます。
このスコアは、これまで見たこともなく、既存の解法もない問題に対して、Astraが非常に高い自律的探索能力とルール学習能力を示した ことを意味します。
ただし、この結果にはOpenAIのResponses API Harness実行フレームワークが使われています。
OpenAIによると、このHarnessでは設定を2項目調整し、実際のAgent利用に近い形でテストを行っていますが、ARC-AGI-3向けの特別な最適化は施していないとのことです。
したがって、99.9%という数値は基盤モデル単体の成績ではなく、メモリ管理やAgent実行フレームワークによる向上分も含まれています。
プログラミング(Coding) も、今回のAstraにおける重点的な強化分野です。
Terminal-Bench 4.0では、Astraは57.7%を記録し、Fable 5.1の55.8%、GPT-5.6 Solの37.3%を上回りました。
DeepSWE v1.1では74.1%を獲得し、Solの72.7%、Fable 5.1の67.4%を上回っています。

数学と科学の分野でも、Astraは数々の高スコアを叩き出しました。
高難度数学テストのFrontierMath Tier 4 v2では97.6%、大学院レベルの科学知識を問うGPQA Diamondでは96%を獲得し、Gemini 3.8 Flashの95.3%をわずかに上回りました。

さらに大きな変化は、Astraが コード能力とComputer Useを組み合わせた ことです。コードを生成するだけでなく、ターミナルや開発ツールに入り、実行・テスト・問題発見を行ったうえで、さらにコードを修正できます。
この変化は、より実際の仕事に近いAgentテストでいっそう明確に表れています。
Agents’ Last Exam では、Astraは59.3%を記録し、GPT-5.6 Solの53.6%、Claude Opus 5の55.5%を上回りました。

このテストでは、モデルを実際のコンピューター環境に置き、ソフトウェア、ターミナル、ファイルを同時に操作させます。そして、科学研究、エンジニアリング、財務などの分野における長い一連のタスクを完了させ、最終的な成果物に基づいて評価します。
より実際のオフィス業務に近い AutomationBench では、AstraのスコアはGPT-5.6 Solの18.1%から41.4%へと向上し、Fable 5.1(31%)も上回りました。

このテストでは、タスクを完了できたかどうかだけでなく、完了に必要なAPIコストも同時に示されます。
図から分かるように、Astraはさまざまなコスト設定において、Solを明らかに上回っています。
OSWorld 2.0が評価するのは、より直接的なコンピューター操作能力です。オフラインテストでは、Astraが72.6%、GPT-5.6 Solが65.7%でした。
Astraが1タスクを完了するのに必要な時間は平均約40分。一方、Solは約75分で、所要時間を約47%短縮しています。

精度が向上しただけでなく、タスク完了までの時間も短縮されています。これは、Astraの高価格を別の角度から説明するものでもあります。
OpenAIは、100万tokenあたりいくらかではなく、1つのタスクを完了するのにいくらかかるかこそ、本当に意味のある指標だ と考えています。
発表会でGreg Brockmanも、モデルの1回あたりの呼び出しコストが高くても、やり直しを減らし、より少ない手順で仕事全体を完了できるなら、総コストはむしろ低くなる可能性があると語りました。
しかし、Astraの最も特異な点は、やはり サイバーセキュリティ です。
ExploitBenchでは満点を獲得し、ExploitGymではSolの30.3%から42.4%へと向上しました。
過去3か月以内に公開された新たな脆弱性に対して、Astraの成功率は39%。一方、Solはわずか5.5%でした。テスト中、Astraはこれまで知られていなかったV8のゼロデイ脆弱性を2件発見し、悪用することにも成功しています。
能力が向上した後、OpenAIはタスクを完了するために越権行為を行わないかどうかも特別にテストしました。
ある模擬サイバーセキュリティタスクでは、OpenAIが周辺システムに意図的に悪用可能なおとりの脆弱性を残しました。元のタスクの達成が難しい状況では、GPT-5.6 Solは48.2%のテストで越権行為を行ったのに対し、Astraは0%でした。
つまりAstraは、脆弱性を見つける能力が高いだけでなく、どのシステムに手を出してはいけないかも、より正確に理解しているのです。

こうしたスコアが現実世界でどのような形になるのかについても、OpenAIは数多くのデモを用意しています。
KiCadに入り、自分で回路基板を設計
電子工学の事例では、Astraが直接KiCadを操作し、電子回路図に基づいてPCBレイアウトを完成させました。
部品を自分で配置し、位置関係を計画し、さまざまなコンポーネント間を銅配線で接続して、最終的には製造工程に進められる回路基板を完成させます。

PCBレイアウトは、もともと人間の経験に大きく依存する作業であり、電子製品の開発においても時間のかかる工程の一つです。
Astraはまだ専門エンジニアの代わりになれる段階ではありません。しかし、専門ソフトウェアを自ら立ち上げ、実際に作業を始めたことは確かです。
家を建てて、中を歩き回る
もう一つの事例は、さらに直感的です。AstraはまずBlenderで住宅モデルを構築し、それをUnreal Engine 5にインポートして、最終的に自由に歩き回れる3次元空間を生成しました。

モデリングからゲームエンジンまで、作業全体が異なるソフトウェアとファイル形式をまたいでいます。モデルはコンテンツを生成するだけでなく、インターフェースを理解し、ツールを操作し、前後の工程を確実につなげなければなりません。

OpenAIは、Astraがレーシングゲームなどを制作する事例も紹介しました。

PPTや表計算シートも、そのまま納品できるかが重要に
専門的なオフィス業務では、Astraは企業が既に使用しているテンプレートに基づいてプレゼンテーションを作成できます。人間がレイアウトし直す必要のある大量のテキストを出力するだけではありません。
OpenAIは、GPT-Gaiaという架空の製品のPPTテンプレートを数ページ分Astraに提供しました。Astraはそれに基づいて完全なプレゼンテーションを作成し、元のテンプレートのレイアウト、ビジュアルスタイル、ストーリー構成まで引き継ぎました。

数時間かかる検索タスクを数分に短縮
Astraは、小児科医探し、アパートの選定、陸運局の手続き予約、低炭水化物スナック探し、幼稚園の分析といったタスクもこなしました。
小児科医の検索タスクでは、Astraの所要時間は2分54秒。同じタスクを人間が行う場合は、およそ5時間かかりました。

これまで、企業が大規模モデルに社内ソフトウェアを使わせようとする場合、通常はシステムごとにAPI、プラグイン、コネクターを個別に開発する必要がありました。
しかし、ほとんどのソフトウェアには、もともと人間向けに設計された汎用インターフェースがあります。画面、マウス、キーボードです。
Brockmanの見方では、モデルがComputer Useに十分習熟していれば、人間と同じようにこれらのインターフェースを直接操作できます。ソフトウェアごとにAI専用の経路が新たに用意されるのを待つ必要はありません。
これこそが、Astraと従来のチャットボットとの最も明確な違いです。
人間は、次にどこをクリックするかを逐一指示する必要がありません。目標と制約を伝え、最後の結果を確認するだけでよいのです。
Codexで、長いタスクをそのまま続行
Computer Useが解決するのが「どう手を動かすか」だとすれば、Codexの更新内容が解決するのは「どうやって一つの仕事を最後まで継続して完了させるか」です。
これまでは、タスクがコンテキストウィンドウを超えると、Codexは通常 compaction によって、それまでの情報を圧縮していました。
しかし圧縮によって、重要な細部が抜け落ちることがあります。たとえば、ある修正案がなぜ失敗したのか、どのテストを実行済みなのか、あるいはユーザーが最初に提示した制約などです。

Astraを使うと、Codexはコンテキストウィンドウをまたいで作業メモを保存し、それまでのメッセージやツールの出力を検索できます。たとえある情報が要約に書き込まれていなくても、後から探し出すことが可能です。
Astraは作業を進めながら、ユーザーに追加情報を尋ねることもできます。回答に関係しない部分では返信を待って停止することはありません。重要な選択に関わる場合にのみ一時停止し、確認を待ちます。
OpenAIはCodexのComputer Use実行フレームワークも更新しました。Mind2Webテストでは、新しいフレームワークとAstraを組み合わせた場合のタスク完了速度は、現在のGPT-5.6 Solの体験の1.9倍になりました。
すでに仕事で使い始めている企業もある
Astraはまだ広範囲には展開されていませんが、第一陣となる企業でのテストはすでに始まっています。
法律AIプラットフォームのLegoraは、Astraを使って41件の財務書類を一度に照合しました。全工程にかかった時間はわずか数分で、あらかじめ仕込まれていた4つの誤りをすべて発見。その中には、収益注記における50万ポンドの差額も含まれていました。
この作業単体で見ると、Astraは前世代モデルより約40%高速でした。ただし、LegoraにおけるすべてのAgentタスクの平均では、向上幅はおよそ3%です。

一方、ゲーム会社のPlaycoは、AstraをUnityとGodotに直接入れてゲームを制作させました。
同じグレーボックスの下地から、Astraはテーマの異なるプレイ可能なプロトタイプを3つ生成し、その大部分は初版から動作しました。
Playcoによると、人手による修正作業は半減し、空間推論、参考画像の再現、ゲーム内UIなどの面でも前世代を大きく上回っていたとのことです。
この2つの例はいずれも、GPT-6 Astraの重点が、単に質問に答えることではなく、実際のソフトウェアと複雑な資料を扱い、一連のワークフロー全体を完了すること に移ったことを示しています。
Astraは情報を継続的に読み取り、ツールを呼び出し、結果を確認し、フィードバックに基づいて自らの成果物を修正できます。
公式発表によると、AstraはChatGPT Plus、Pro、Business、Enterpriseのユーザーに提供され、Astra ProはPro、Business、Enterpriseのユーザー向けに提供されます。
一般の無料ユーザーは……もうしばらく待つ必要がありそうです。
これがAGIということなのか?
今回のOpenAIは、かなり大胆だったと言えるでしょう。
発表会でGreg Brockmanは、個人的な見解として、世界はすでにAGI時代に入った と述べました。つまり、人工知能システムの総合的な知能が人間を超えたということです。

数年後、AGIがいつ誕生したのかを振り返って問うとき、その答えはおそらく今この瞬間であり、Astraはその出発点なのかもしれません。
さすがに強気すぎる……。
OpenAIはすでに、このレベルまでハードルを引き上げました。次にAnthropicがいつ動くのか、非常に楽しみです(doge)。
かつてGPT-4が発表された後、Microsoftの科学者Sebastien Bubeckは論文を発表し、「GPT-4はAGIの初期の火花である」 と述べました。
その論文では、LaTeXの描画パッケージTiKZを使ってユニコーンを描くタスクが紹介されました。GPT-4が、言語に含まれる概念を柔軟に理解していることを示すためです。

その後、GPT-5.4に至るまで、描画はますます精緻になったものの、結局のところ「簡単なスケッチ」の域を出ませんでした。

最新のGPT-6になると、説明されなければ、コードで描かれたものだとは到底分からないレベルに達しています。

これを「AGIの初期の火花」から質的な変化を遂げた存在だと言っても、決して大げさではないでしょう。
参考リンク:
[1] https://x.com/OpenAI/status/2095595741528125780