桃子桃子快讯
返回首页
产品功能

中科紫东太初升级项目级科研智能体

AutoProject 新增项目规划、长程执行和证据验证能力,尝试以统一任务网络推进完整科研流程。

2026.08.25 · 周二2 分钟阅读

量子位报道,中科紫东太初升级旗下科研原生智能体 ScienceClaw 的 AutoProject 引擎,将 AI4S 的工作单元从孤立任务扩展到完整科研项目。系统面向规划、拆解、长程执行、证据验证、动态修复与成果沉淀等环节,试图以统一任务网络承接宏观科研目标。

从单任务转向项目闭环

传统科研 AI 多在人类明确目标、边界和路径后,依次处理文献检索、数据分析、代码生成等任务。真实科研则包含相互依赖的子任务,并需根据新文献、实验结果和异常数据持续调整路径。AutoProject 的差异不在于简单延长任务链路,而是尝试把动态反馈纳入统一的项目执行框架。

三层能力协同

此次升级由三层核心能力组成:

  • Project2Task:根据研究目标、文献证据、资源约束和任务依赖规划路径,拆分子任务并安排串并行关系及资产复用。
  • TaskExecutor:持续执行数据处理、建模训练和实验优化等环节,监控项目状态,发现异常后回溯、重构任务网络并重新运行实验。
  • EviGraph:核验实验数据能否支撑假设、子任务之间是否逻辑一致以及结论是否超出证据范围,并在发现冲突后触发修正。

文章以带钢表面缺陷识别和 YOLO 建模为例,称系统能够自动研读论文、处理数据、训练模型、处理异常并生成指标和图表。其披露的 ARCBenchML 测试中,EviGraph 综合得分为 0.865,最优基线为 0.596;Result Analysis 指标由 0.442 提升至 0.794,Claim Support Rate 为 0.38,EDC 为 0.88。

需要注意的是,报道未提供完整测试设置、样本规模及第三方复现结果,因此相关数字目前更适合作为项目方披露的测试结果。AutoProject 也并未定位为「无人科研」:科研人员仍可检查研究路径、实验假设和中间数据,并随时纠偏。此次升级将 AI4S 的竞争重点从单体模型或单点智能体能力,扩展到多模态模型、专业工具、多智能体协同与证据验证的系统能力,其实际成熟度仍需更多学科场景验证。

信源