FutureX榜单前十占据三席
允中 发自 凹非寺
七月,DigClaw 的预测框架 Rhizome v1 在 FutureX 评测平台上取得了 #1、#3、#7 三个席位。
三个席位来自三个不同的基础模型,包括 Kimi-K3、DeepSeek-V4-Pro 等。同一套框架同时让它们进入 Top 7,DigClaw 是唯一做到这一点的参赛方。
59 道覆盖政治、经济、科技领域的真实事件预测题,不存在训练数据泄露的可能。
这组成绩支持了 DigClaw 正在验证的判断:
预测能力可以沉淀在基座模型之外。
随着基座模型不断进步,系统可以获得能力红利;预测轨迹、结算反馈、校准经验和持续演化的工作流,则会持续沉淀在系统内部。
△DigClaw 2026 Jul. Week 4 在 FutureX 榜单上的表现
这不是一次偶然的竞赛结果,这是 DigClaw 针对“预测到底应该怎么做”这一问题给出的第一次外部验证。
预测是 AI 最被低估的能力
随着预测任务逐渐走向标准化和工程化,AI 也被寄予了规模化处理复杂预测问题的期待。
但这里存在一个根本性问题:大语言模型天然不擅长预测。
LLM 学习的是 correlation,而非 causation。它们从过去的语料中提取模式,但“学习过去”和“预测未来”是两件本质不同的事。
这带来了三个致命问题:
-
因果方向盲区。模型知道 A 和 B 经常一起出现,但不知道是 A 导致 B,还是 B 导致 A,抑或是存在共同原因 C。
-
干预推理失效。你无法有效地询问模型“如果美联储降息,会对东南亚科技股产生什么影响”,因为它只学习了历史共现关系,没有因果图谱支撑干预计算。
-
校准缺失。模型输出的“70% 概率”没有经过任何概率论意义上的校准,本质上只是 token 分布的副产品。
到目前为止,现有方案各有局限:人类群体智慧(prediction markets)需要流动性,在冷门问题上价格并不可信;LLM 的模式匹配没有因果结构;端到端训练则存在结果导向偏差——一个逻辑严密但“答错”的推理过程会受到惩罚,碰巧“猜对”的粗糙判断反而会被强化。
这正是 DigClaw 存在的原因。
DigClaw 构建的是以因果结构为骨架、以概率计算为引擎、以搜索智能为数据管道的预测基础设施。
其核心假设是:预测不应该由一个模型端到端完成。
搜索、因果推理和概率推断是三种正交能力,应该由三个专门的系统分别解决,再以结构化方式组合起来。
三个前十,验证预测能力的跨基座迁移
FutureX 是当前最具挑战性的实时预测榜单:每周发布真实世界事件预测题目,提交预测时标准答案尚未产生,事后再进行结算。
数据集托管在 Hugging Face,评估框架在 GitHub 上开源,结果可复现、可验证。
Rhizome 在三个基座模型上采用同一套预测框架和运行条件,分别独立生成并提交答案,不进行跨模型聚合。
因此,这三个名次代表同一套系统方法在三个基座模型上的分别运行,是一次清晰的跨基座对照。
但这并不意味着基座模型不重要。
基座模型仍然提供语言理解、推理和工具使用等通用能力。
这一榜单结果说明的是:如何组织检索、处理时间、表达概率、维护证据和控制长程运行,可以形成独立于模型权重的系统能力。
以下是 DigClaw 在 FutureX 上运行 Rhizome 框架的技术报告:
Rhizome Technical Report
Rhizome 的设计围绕三个工程判断展开:搜索和推理必须解耦,预测轨迹必须完整保留并形成校准资产,概率更新必须感知因果结构。
△DigClaw 预测大脑架构图
设计决策一:搜索与推理多模型解耦
Rhizome 的核心设计洞察是:搜索质量和推理质量是两个正交的问题,不应由同一个模型同时优化。
当前主流的 DeepResearch Agent(Perplexity、Gemini Deep Research)将搜索和推理绑定在同一个模型内:搜索质量会受到推理负担拖累,推理质量也会受到搜索噪声污染。
Rhizome 的做法是彻底解耦:搜索 Agent 只负责寻找相关信息,推理层只负责基于已有证据进行结构化推理。
预测任务对信息的需求不是“准确回答用户问题”,而是“尽可能发现所有相关信号”。
搜索 Agent 的优化目标是信息相关性(relevance),而不是答案正确性(accuracy)。如果搜索 Agent 被训练为“寻找答案”,就会倾向于找到看起来像结论的内容,而这恰恰是最危险的。
训练采用强化学习框架(SearchRL),两条路径并行迭代:
-
路径 A:开源模型 RL 微调——在 8B/30B 参数规模的开源模型上,以搜索相关性作为 reward 进行 RL 训练(参考:Search-R1,COLM 2025;ReSeek,ICML 2026)。
-
路径 B:闭源模型 Harness——针对 Claude、GPT 等闭源模型,构建外部搜索约束框架。
不同基座模型在预测任务中呈现出稳定差异:有的适合长时间检索与复杂推理,有的更擅长定量建模,有的则在成本和响应速度方面更具优势。
Rhizome 将预测协议、Agent 编排、工具调用和结果评测置于基座模型之外。机构可以根据任务价值和运行规模选择基座模型,在推理能力、成本与响应速度之间进行取舍。
设计决策二:轨迹记录与概率校准,沉淀数据资产
Rhizome 为每一次预测保留一条带有版本信息的完整轨迹,包括题目的时间条件与结算标准、预测时能够获得的证据、Agent 编排与工具调用过程、最终答案与概率,以及对应的模型和系统版本。
这些记录形成于结果揭晓之前,保存了 Rhizome 在尚不知道答案时作出的真实判断。
事件结算后,Rhizome 会将预测轨迹与现实结果放回同一条记录中,回看当时掌握了哪些信息、遗漏了哪些反向证据,以及错误究竟发生在检索、时间判断、推理、答案表达,还是概率校准环节。
一次高置信度的错误与一次接近五五开的错误,虽然都会被记为“答错”,但暴露出的问题并不相同。
Rhizome 会对同一道题进行多次独立预测。系统不会简单平均结果,而是先在对数几率(logit)空间进行聚合,再结合已结算题目的 Brier Score 调整极端化程度。
不同轨迹提供的信息越独立,聚合结果就可以越明确;证据重叠越多,调整就会越克制。
△DigClaw 预测概率校准方式
在此基础上,Rhizome 通过 Platt 缩放,利用已结算题目识别持续存在的过度自信或过度保守,并对后续概率进行校正。
校准的标准很直观:系统给出 60% 概率的事件,长期来看应该约有六成发生;给出 80% 概率的事件,长期来看应该约有八成发生。
每次运行都会对应当时的系统版本与关键配置,使概率变化和异常结果能够追溯到具体原因。
基座模型可以升级或更换,但问题定义、证据记录、信念变化、结算结果和校准经验仍然能够保持连续。
这类反馈数据无法在结果揭晓后批量补造——每个样本都必须在未来尚未发生时留下判断,再等待现实给出答案。
代码可以复刻,时间沉淀的数据资产无法速成。
设计决策三:因果链感知的持续更新
事件尚未结算时,新的数据、政策和市场信息会持续出现,系统需要判断原有概率是否应该更新。
Rhizome 为未结算问题保存信念状态。每条证据分别记录事件发生时间、内容发布时间和系统读取时间。
当新信息与已有记录完全重复时,系统会跳过更新;当新证据与旧记录发生冲突时,旧证据不会被删除,系统会保留判断被修正的过程。
单次概率变化超过 0.15 时,必须指向触发变化的具体新证据。
这里还有一个更难的问题:新证据究竟代表多股独立力量,还是同一条因果链在不同位置留下的信号?
加息公告、利差变化和资本流动可能先后出现,但它们未必是三份独立信息。
如果系统将它们分别计入概率更新,同一个原因就可能被重复计算,从而把概率推向过度自信的极端。
Rhizome 正在开发一套因果链感知的贝叶斯更新框架。在证据进入概率更新之前,系统会先识别其所属的因果传导链,再根据链内关系调整证据权重。
这一框架包含四个层次:
-
因果知识库:存储经过验证的因果链,并记录关键关系的传导时滞、影响衰减和历史可信度。
-
同链信号去重:来自同一条因果链的后续信号不会再以完整权重重复计入,避免同一股力量被多次计算。
-
全局后验帽:限制多条同向证据带来的累积影响,并根据预测期限调整约束强度。
-
传导时滞感知:链头事件发生后,系统根据因果关系的传导进度逐步更新,不会立即将全部影响计入链尾结果。
△DigClaw 因果链推理图
在 DigClaw 内部预测系统上,这套框架已完成原型实现和初步验证,并指导了多笔投资实践。
实验显示,与直接贝叶斯聚合相比,同链信号去重与全局后验帽将过度自信率(预测概率高于 85% 但最终判断错误的比例)从约 25% 降至 12%。
为什么一家投资机构要做预测模型
Newborn Ventures 由 DigClaw 发起,是一家以 AI 挖掘 Beta 趋势为驱动的投资和孵化机构。
DigClaw 的趋势预测基座,是支撑这家 AI-Native VC 的底层技术框架。
投资的本质是预测。
判断一个赛道是否会爆发、一个团队是否能跑出来、一项技术是否会成为主流,这些都是预测问题。
传统投资依赖合伙人的经验直觉和信息差,但 DigClaw 认为,这些判断可以被系统化、模型化。
从更大的视角看:投资回报 = Beta(事件/趋势驱动)+ Alpha(资产特异性)。
Alpha 的研究已经相对成熟,但 Beta——对宏观事件和趋势的预测——目前还没有真正有效的 AI 解决方案,这正是 DigClaw 要解决的问题。
当预测从一种直觉判断变成可调用、可集成、可校准的参数后,它能够嵌入的决策场景将远比当前所见的更多。
-
对上市公司而言,这意味着可以在产业链变动和政策风向形成前完成战略预判与风险预警;
-
对投资机构而言,这意味着可以在共识形成之前发现价值;
-
对政府引导基金而言,这意味着可以用系统化方法研判产业趋势与政策效果。
同一套预测能力,对外在 FutureX 接受公开评测,对内驱动投资决策,并应用于产业趋势研判和战略风险评估等场景。
对于 DigClaw 和 Newborn Ventures 而言,FutureX 第一名是起点,而不是终点。
关于 DigClaw
DigClaw 是一家专注于预测智能的 AI 科技公司,核心使命是构建可校准、可审计、可集成的预测基础设施。
其旗舰预测框架 Rhizome 通过因果推理、概率校准和搜索智能三层架构,实现了独立于基础模型的系统能力——基座模型可以更换,预测资产则能够持续积累。
DigClaw 的预测系统已在 FutureX 等公开评测平台上获得外部验证,并将同一套能力应用于投资决策、产业趋势研判和战略风险评估等实际场景。
关于 Newborn Ventures
Newborn Ventures 是一家 AI 原生的早期风险投资与孵化机构。
其核心信念是:投资的本质是预测,判断赛道是否会爆发、团队是否能跑出来、技术是否会成为主流,这些都是可以被系统化、模型化的预测问题。
Newborn Ventures 通过自研的 Deep Research Agent 和因果预测系统,在全球范围内追踪 AI 推理方向的创新信号,发现尚未被市场定价的结构性机会。