FutureXランキングのトップ10に3席
允中 凹非寺発
7月、DigClawの予測フレームワーク Rhizome v1 がFutureX評価プラットフォームで #1、#3、#7 の3つの順位を獲得した。
3つの順位は、Kimi-K3、DeepSeek-V4-Proなど、異なる3つの基盤モデルによるものだ。同一のフレームワークで3つのモデルを同時にTop 7入りさせたのは、DigClawだけである。
政治・経済・テクノロジー分野を網羅した、59問の現実世界の出来事に関する予測問題であり、学習データが漏えいした可能性はない。
この結果は、DigClawが検証を進めている次の見方を裏付けるものだ。
予測能力は、基盤モデルの外部に蓄積できる。
基盤モデルが進化し続けることで、システムはその能力向上の恩恵を受けられる。一方、予測の軌跡、結果のフィードバック、キャリブレーションの経験、継続的に進化するワークフローは、システム内部に蓄積され続ける。
△DigClaw 2026 Jul. Week 4 のFutureXランキングでのパフォーマンス
これは偶然の競技結果ではない。「予測はどう行うべきか」という問いに対する、DigClawにとって初めての外部検証である。
予測はAIにとって最も過小評価されている能力
予測タスクが標準化・エンジニアリングされつつあるなか、AIには複雑な予測問題を大規模に処理することが期待されている。
しかし、ここには根本的な問題がある。大規模言語モデルは、本質的に予測を得意としていない。
LLMが学習するのは因果関係(causation)ではなく、相関関係(correlation)である。LLMは過去のコーパスからパターンを抽出するが、「過去を学習すること」と「未来を予測すること」は本質的に異なる。
これにより、3つの致命的な問題が生じる。
-
因果の方向性に関する盲点。モデルはAとBが頻繁に同時に現れることは知っていても、AがBを引き起こしているのか、BがAを引き起こしているのか、あるいは共通の原因Cが存在するのかを知らない。
-
介入推論の機能不全。例えば「FRBが利下げを行った場合、東南アジアのテクノロジー株にどのような影響があるか」とモデルに尋ねても、効果的な回答は得られない。モデルは過去の共起関係しか学習しておらず、介入の影響を計算するための因果グラフを備えていないからだ。
-
キャリブレーションの欠如。モデルが出力する「70%の確率」という数字は、確率論的な意味でキャリブレーションされたものではない。本質的には、トークン分布の副産物にすぎない。
これまでの既存のアプローチには、それぞれ限界があった。人間の集合知(prediction markets)は流動性を必要とするため、ニッチな問題では価格の信頼性が低い。LLMによるパターンマッチングには因果構造がなく、エンドツーエンドの学習には結果指向のバイアスが存在する。つまり、論理的には整っていても「答えを外した」推論プロセスは罰せられる一方、たまたま「正解した」粗雑な判断が強化されてしまう。
これこそが、DigClawの存在する理由である。
DigClawが構築しているのは、因果構造を骨格とし、確率計算をエンジンとし、検索インテリジェンスをデータパイプラインとする予測インフラである。
その中核となる仮説は、予測を1つのモデルがエンドツーエンドで完結させるべきではない、というものだ。
検索、因果推論、確率推論は、互いに直交する3つの能力である。それぞれを専門システムが個別に解決し、構造化された形で組み合わせるべきだ。
トップ10に3つ、予測能力の基盤モデル間移植を検証
FutureXは、現在最も難易度の高いリアルタイム予測ランキングである。毎週、現実世界の出来事に関する予測問題が公開され、予測を提出する時点では正解がまだ確定しておらず、後日になって結果が判定される。
データセットはHugging Faceでホスティングされ、評価フレームワークはGitHub上でオープンソース化されている。結果は再現・検証が可能だ。
Rhizomeは、3つの基盤モデルに対して同一の予測フレームワークと実行条件を適用し、それぞれ独立して回答を生成・提出している。モデル間での集約は行っていない。
したがって、この3つの順位は、同一のシステム手法を3つの基盤モデル上で個別に実行した結果であり、明確な基盤モデル間比較を示している。
ただし、これは基盤モデルが重要でないという意味ではない。
基盤モデルは、言語理解、推論、ツール利用などの汎用能力を引き続き提供する。
今回のランキング結果が示しているのは、検索の組み立て方、時間の扱い方、確率の表現、証拠の管理、長時間実行の制御は、モデルの重みから独立したシステム能力として形成できるということだ。
以下は、DigClawがFutureX上でRhizomeフレームワークを実行した際の技術レポートである。
Rhizome Technical Report
Rhizomeの設計は、次の3つのエンジニアリング上の判断を軸にしている。検索と推論は分離し、予測の軌跡は完全に保存してキャリブレーション資産とし、確率の更新は因果構造を認識できるようにする。
△DigClaw予測ブレインのアーキテクチャ図
設計判断1:検索と推論を複数モデルで分離
Rhizomeの中核となる設計上の洞察は、検索品質と推論品質は直交する2つの問題であり、同じモデルで同時に最適化すべきではないということだ。
現在主流のDeepResearch Agent(Perplexity、Gemini Deep Research)は、検索と推論を同一モデル内に結び付けている。そのため、検索品質は推論の負荷によって低下し、推論品質は検索ノイズの影響を受ける。
Rhizomeは、これらを徹底的に分離する。検索Agentは関連情報の発見だけを担当し、推論層は既存の証拠に基づく構造化推論だけを担当する。
予測タスクで必要とされる情報は、「ユーザーの質問に正確に答える」ことではなく、「関連するシグナルを可能な限りすべて発見する」ことだ。
検索Agentの最適化目標は、答えの正確性(accuracy)ではなく、情報の関連性(relevance)である。検索Agentを「答えを探す」ように訓練すると、結論らしく見える情報を探す傾向が生じる。しかし、それこそが最も危険な状態である。
学習には強化学習フレームワーク(SearchRL)を採用し、2つの経路を並行して反復する。
-
経路A:オープンソースモデルのRLファインチューニング――パラメータ数8B/30B規模のオープンソースモデル上で、検索の関連性をrewardとしてRL学習を行う(参考:Search-R1、COLM 2025;ReSeek、ICML 2026)。
-
経路B:クローズドモデル向けHarness――Claude、GPTなどのクローズドモデルを対象に、外部検索の制約フレームワークを構築する。
異なる基盤モデルは、予測タスクにおいて安定した差異を示す。長時間の検索と複雑な推論に適したモデルもあれば、定量モデリングを得意とするモデルもあり、コストと応答速度に優れたモデルもある。
Rhizomeは、予測プロトコル、Agentのオーケストレーション、ツール呼び出し、結果評価を基盤モデルの外部に配置する。組織は、タスクの価値と実行規模に応じて基盤モデルを選択し、推論能力、コスト、応答速度のバランスを取ることができる。
設計判断2:軌跡の記録と確率キャリブレーションによるデータ資産の蓄積
Rhizomeは、予測のたびに、バージョン情報を含む完全な軌跡を保存する。そこには、問題の時間的条件と判定基準、予測時点で取得可能だった証拠、Agentのオーケストレーションとツール呼び出しの過程、最終回答と確率、使用したモデルおよびシステムのバージョンが含まれる。
これらの記録は、結果が明らかになる前に作成される。つまり、答えをまだ知らない段階でRhizomeが下した実際の判断を保存している。
イベントの結果が確定した後、Rhizomeは予測の軌跡と現実の結果を同じ記録に戻し、当時どの情報を把握していたのか、どの反証を見落としていたのか、そして誤りが検索、時間判断、推論、回答表現、確率キャリブレーションのどの段階で発生したのかを振り返る。
高い確信度で外した予測と、五分五分に近い確率で外した予測は、いずれも「不正解」と記録される。しかし、そこから明らかになる問題は同じではない。
Rhizomeは、同じ問題に対して複数回の独立した予測を行う。システムは結果を単純平均せず、まず対数オッズ(logit)空間で集約し、その後、判定済みの問題におけるBrier Scoreを用いて極端化の度合いを調整する。
異なる軌跡が提供する情報の独立性が高いほど、集約結果はより明確になる。一方、証拠の重複が多いほど、調整はより慎重に行われる。
△DigClawの予測確率キャリブレーション方式
これを基盤として、RhizomeはPlattスケーリングを通じ、判定済みの問題から継続的に存在する過信または過度な保守性を識別し、その後の確率を補正する。
キャリブレーションの基準は直感的だ。システムが60%の確率を付けたイベントは、長期的にはおよそ6割発生すべきである。同様に、80%の確率を付けたイベントは、長期的にはおよそ8割発生すべきだ。
実行のたびに、その時点のシステムバージョンと主要な設定が記録されるため、確率の変化や異常な結果を具体的な原因まで追跡できる。
基盤モデルはアップグレードや交換が可能だが、問題の定義、証拠の記録、信念の変化、判定結果、キャリブレーションの経験は、継続的に保持できる。
この種のフィードバックデータは、結果が明らかになった後にまとめて作り出すことはできない。各サンプルについて、未来がまだ起きていない時点で判断を残し、現実が答えを示すのを待たなければならないからだ。
コードは再現できるが、時間をかけて蓄積されるデータ資産を短期間で作ることはできない。
設計判断3:因果チェーンを認識した継続的な更新
イベントの結果がまだ確定していない間も、新たなデータ、政策、市場情報は継続的に現れる。システムは、既存の確率を更新すべきかどうかを判断する必要がある。
Rhizomeは、未確定の問題について信念状態を保存する。各証拠には、イベントの発生時刻、コンテンツの公開時刻、システムが読み取った時刻を個別に記録する。
新しい情報が既存の記録と完全に重複している場合、システムは更新をスキップする。新しい証拠が古い記録と矛盾する場合でも、古い証拠を削除せず、判断が修正された過程を保持する。
単一の確率変化が0.15を超える場合、その変化を引き起こした具体的な新しい証拠を必ず示さなければならない。
ここにはさらに難しい問題がある。新しい証拠は、複数の独立した力を示しているのか、それとも同一の因果チェーンが異なる地点に残したシグナルなのか、という問題だ。
利上げの発表、金利差の変化、資本フローは順番に発生する可能性がある。しかし、それらが3つの独立した情報とは限らない。
システムがそれらを個別に確率更新へ反映すると、同じ原因が重複して計算され、確率が過信の極端な状態へ押し上げられる可能性がある。
Rhizomeは現在、因果チェーンを認識するベイズ更新フレームワークを開発している。証拠を確率更新に組み込む前に、システムがその証拠の属する因果伝播チェーンを識別し、チェーン内の関係に応じて証拠の重みを調整する。
このフレームワークは、次の4つの層で構成される。
-
因果知識ベース:検証済みの因果チェーンを保存し、主要な関係について伝播のタイムラグ、影響の減衰、過去の信頼度を記録する。
-
同一チェーン内のシグナル重複排除:同一の因果チェーンに由来する後続シグナルを、完全な重みで再度重複計上することはない。同じ力が複数回計算されるのを防ぐためである。
-
グローバル事後確率キャップ:同じ方向を示す複数の証拠による累積的な影響を制限し、予測期間に応じて制約の強さを調整する。
-
伝播タイムラグの認識:チェーンの起点となるイベントが発生した後、システムは因果関係の伝播状況に応じて段階的に更新する。チェーンの終点に生じる結果へ、影響の全量を即座に反映することはない。
△DigClawの因果チェーン推論図
DigClaw内部の予測システムでは、このフレームワークのプロトタイプ実装と初期検証が完了しており、複数の投資実務にも活用されている。
実験では、直接的なベイズ集約と比較して、同一チェーン内のシグナル重複排除とグローバル事後確率キャップにより、過信率(予測確率が85%を超えていたにもかかわらず、最終的に判断を誤った割合)が約25%から12%に低下した。
なぜ投資機関が予測モデルを開発するのか
Newborn VenturesはDigClawによって設立された、AIによるBetaトレンドの発掘を中核とする投資・インキュベーション機関である。
DigClawのトレンド予測基盤は、このAI-Native VCを支える基盤技術フレームワークである。
投資の本質は予測である。
ある分野が急成長するか、あるチームが成功するか、ある技術が主流になるかを判断することは、いずれも予測問題だ。
従来の投資は、パートナーの経験や直感、情報格差に依存してきた。しかしDigClawは、こうした判断を体系化し、モデル化できると考えている。
より大きな視点で見ると、投資リターン = Beta(イベント/トレンドによる要因)+ Alpha(資産固有の要因)である。
Alphaに関する研究は比較的成熟している。一方、Beta――マクロイベントやトレンドの予測――には、現在も真に有効なAIソリューションが存在していない。これこそが、DigClawが解決しようとしている課題である。
予測が単なる直感的な判断から、呼び出し可能で、統合可能かつキャリブレーション可能なパラメータへと変われば、それを組み込める意思決定の場面は、現在考えられているよりはるかに広がる。
-
上場企業にとっては、産業チェーンの変化や政策の方向性が明確になる前に、戦略的な見通しとリスク警告を得られることを意味する。
-
投資機関にとっては、コンセンサスが形成される前に価値を発見できることを意味する。
-
政府系誘導ファンドにとっては、体系的な手法によって産業トレンドや政策効果を分析できることを意味する。
同じ予測能力を、対外的にはFutureXで公開評価にかけ、社内では投資判断の推進に活用し、さらに産業トレンドの分析や戦略的リスク評価などの場面にも応用している。
DigClawとNewborn Venturesにとって、FutureXでの1位は出発点であり、終着点ではない。
DigClawについて
DigClawは、予測インテリジェンスに特化したAIテクノロジー企業であり、キャリブレーション可能で、監査可能かつ統合可能な予測インフラの構築を中核ミッションとしている。
そのフラッグシップ予測フレームワークであるRhizomeは、因果推論、確率キャリブレーション、検索インテリジェンスの3層アーキテクチャを通じて、基盤モデルから独立したシステム能力を実現している。基盤モデルは交換できる一方、予測資産は継続的に蓄積できる。
DigClawの予測システムは、FutureXなどの公開評価プラットフォームで外部検証を受けており、同じ能力を投資判断、産業トレンド分析、戦略的リスク評価などの実際の場面に応用している。
Newborn Venturesについて
Newborn Venturesは、AIネイティブなアーリーステージのベンチャー投資・インキュベーション機関である。
その中核となる信念は、投資の本質は予測だということだ。ある分野が急成長するか、チームが成功するか、技術が主流になるかを判断することは、体系化・モデル化できる予測問題である。
Newborn Venturesは、自社開発のDeep Research Agentと因果予測システムを通じて、世界中でAI推論分野の革新的なシグナルを追跡し、市場でまだ価格に織り込まれていない構造的な機会を発見している。