Imbue 开源 AI Scientist 工具 Catalyst,支持半自主理论发现
Imbue 推出开源 AI Scientist 工具 Catalyst,可自动解释现象并求解可验证的研究目标,当前聚焦机…
AI 研究公司 Imbue 近日在 Hacker News 发布了开源工具 Catalyst AI Scientist,定位为面向科研的半自主研究助手。它并非要取代 ChatGPT 这类对话式工具或通用编程 Agent,而是专注于两类有明确验证标准的研究任务:自动解释可观测现象,以及在可编程验证条件下求解或优化目标。
核心功能
Catalyst 提供两种核心研究模式:
- 解释现象(Explaining Phenomena):针对「做 Y 时观察到 X,为什么会这样」一类问题,自动构建理论来解释现象。系统也支持在用户提供理论草稿的基础上补全缺口、纠错和细化。
- 可验证目标求解(Verifiable Goal Solving/Optimization):在可由代码验证的前提下,自动求解研究目标,或最大化某个可量化指标。
两类工作流之外,Catalyst 还内置了一组手工可调用的「附加步骤」,包括理论正确性审查、提出改进建议、评估候选解等。
技术机制
Catalyst 构建在现有的 LLM 之上,但在模型之外叠加了两套机制,使其能够产出超出底层模型单独使用时的结果:
- 对抗式 review-refinement 循环:一组智能体持续改进生成的理论和候选解,另一组独立智能体专门负责证伪、找边界条件和暴露局限。
- 类进化种群搜索:维护一组相互竞争的理论或候选解,反复按经验和验证脚本进行排序,挑选最有潜力的继续细化和分支。
官方指出,在一次典型的「Develop Theory」流程中,约 65% 的 token 消耗在评审与打分步骤,25% 用于理论与解的开发,剩余 10% 用于杂项,整体流程常由 100 个以上子智能体协作完成。
支持模型与成本
Catalyst 本身不托管模型,而是依赖用户本机已安装的 agentic harness,目前兼容:
- Claude Code(Anthropic)
- Gemini CLI(Google)
- Antigravity CLI
- Codex CLI(OpenAI)
token 计费由各 provider 按既有认证直接结算。官方在博客中特别提醒,进化式工作流因子智能体数量众多,token 消耗可能非常显著,使用前应先阅读「Supported Models & Estimated Costs」一节。
适用场景与局限
官方明确列出了不适合 Catalyst 的几类问题,包括:缺乏可编程验证标准的开放式优化、主观或欠定义的成功标准、纯工程项目、超出底层模型能力的问题(如 P=NP)、需要非计算实验的领域(生命科学、心理学等),以及计算资源消耗过大的任务——默认单个实验运行时长被限制在 30 分钟以内,可通过环境变量调整。
在测试范围上,Catalyst 当前主要针对可通过计算实验和数学推导理解的现象,作者实测聚焦在机器学习与深度学习理论领域。问题的描述越精确、可以提前给出简化假设、能用脚本复现并探测,成功率越高。
项目已在 GitHub 开源,仓库地址为 github.com/imbue-ai/catalyst,官方推荐使用 stable 分支并配合 Quickstart Guide 上手。
