DigClaw预测框架Rhizome登FutureX榜首,同套系统跑通三个基座
DigClaw的Rhizome预测框架在FutureX实时预测榜单拿下第1、3、7名,同一套系统在Kimi-K3、Dee…
DigClaw旗下的预测框架 Rhizome v1 在 FutureX 实时预测评测平台上取得了第 1、第 3 和第 7 三个名次,分别由 Kimi-K3、DeepSeek-V4-Pro 等不同基座模型独立运行产生。DigClaw 是唯一在同一榜单中凭一套框架让三个基座同时进入 Top 7 的参赛方。
FutureX 榜单与评测机制
FutureX 被作者描述为「当前最具挑战性的实时预测榜单」:每周发布覆盖政治、经济、科技领域的真实事件预测题,提交预测时标准答案尚未产生,事后结算。评测数据集托管在 HuggingFace,评估框架开源在 GitHub,可复现、可验证。Rhizome 在三个基座上采用同一套预测框架与运行条件,各自独立生成并提交答案,不做跨模型聚合,因此三个名次可被视为一次跨基座对照实验。
Rhizome 的三层设计
Rhizome 的设计围绕三条工程判断展开,作者在配套技术报告中分别给出了说明。
搜索与推理解耦
Rhizome 将搜索与推理视为两个正交问题,交由不同模型分别处理:搜索 Agent 只优化信息相关性,推理层只在已有证据上做结构化推理。文中指出,Perplexity、Gemini Deep Research 等主流 DeepResearch Agent 将两者绑定在同一模型内,搜索质量会被推理负担拖累,推理质量会被搜索噪声污染。Rhizome 在训练上采用强化学习框架 SearchRL,对 8B/30B 级别的开源模型做 RL 微调(参考 Search-R1、ReSeek),同时为 Claude、GPT 等闭源模型构建外部搜索约束框架。
轨迹记录与概率校准
Rhizome 为每次预测保留完整轨迹,包含题目时间条件与结算标准、预测时可获得的证据、Agent 编排与工具调用过程、最终答案与概率,以及对应的模型和系统版本。事件结算后,系统将预测轨迹与现实结果放回同一条记录,回看当时遗漏了哪些反向证据、错误发生在哪个环节。同一道题会进行多次独立预测,结果先在对数几率(logit)空间聚合,再用已结算题目的 Brier Score 调整极端化强度。在此基础上通过 Platt 缩放识别持续过度自信或过度保守,并对后续概率进行校正。
因果链感知的概率更新
对于尚未结算的问题,新数据可能与旧证据重复、冲突或同源。Rhizome 为每条证据分别记录事件发生时间、内容发布时间和系统读取时间;单次概率变化超过 0.15 时必须指向触发变化的具体新证据。其正在开发的因果链感知贝叶斯更新框架包含四个层次:因果知识库、同链信号去重、全局后验帽、传导时滞感知。文中给出内部实验数据:与直接贝叶斯聚合相比,该机制将过度自信率(预测概率高于 85% 但最终判断错误的比例)从约 25% 降至 12%。
公司背景与服务方向
DigClaw 由 Newborn Ventures 发起,后者被定位为「全球首家以 AI 挖掘 Beta 趋势为驱动的投资和孵化机构」。Rhizome 的预测能力在对外接受 FutureX 公开评测的同时,也被用于内部投资决策,并面向产业方、金融机构和政府引导基金开放合作。作者将投资本质归结为预测,并认为 Beta——即对宏观事件和趋势的预测——目前缺少真正有效的 AI 解决方案,这正是 DigClaw 切入的方向。
几点观察
- FutureX 榜单本身尚处于较新的阶段,知名度与行业基准(如各类 LLM 综合评测)相比偏低,Rhizome 取得的成绩尚需在更广泛受众中获得验证。
- 文中给出的过度自信率从 25% 降至 12% 的实验数据来自 DigClaw 内部预测系统,并非 FutureX 榜单结果,引用时需注意区分。
- 文章带有明显的公司宣传色彩,多次强调「预测能力可沉淀在基座之外」「基座可更换,预测资产持续积累」等自家框架的卖点,读者宜结合独立验证再做判断。
