桃子桃子快讯
返回首页
开源

Life Forge:用进化算法为 AI 智能体做压力测试

开源工具 Life Forge 基于 3D MAP-Elites 自动生成对抗场景,揭示 Qwen 2.5 与 Llam…

2026.09.23 · 周三4 分钟阅读

由开发者发布在 Hacker News 的开源项目 Life Forge,将「飞行模拟器」的概念引入 AI 智能体测试领域。该工具基于三维 MAP-Elites 质量多样性进化算法,能够自动发现具备工具调用能力(数据库查询、资金转账、邮件发送等)的 AI 智能体在真实业务场景中的零日故障与对抗漏洞。

为什么需要智能体「飞行模拟器」

当前主流的 AI 评测基准(如 MMLU、HumanEval)侧重于知识题与代码题,难以覆盖智能体在企业生产环境中的高风险行为。传统的静态红队测试通常使用数百条固定提示词清单,大模型很快就能「背答案」,无法暴露真实运行时的脆弱性。而在生产环境中,供应商断货、价格波动、高管邮件被伪造、第三方数据中夹带越狱指令等情况随时可能发生,静态测试对这些动态对抗场景基本失效。

Life Forge 试图填补这一空白:让 AI 智能体在投入生产前,先在持续对抗与扰动的仿真环境中接受大规模压力测试。

基于 3D MAP-Elites 的进化引擎

Life Forge 的核心是三维 MAP-Elites 进化搜索,在三个轴上对智能体的脆弱性地形进行映射:

  • X 轴(对抗强度):提示注入与伪造通信的频率、隐蔽性与复杂度,范围 0.0–1.0。
  • Y 轴(环境波动):市场价格冲击、供应商掉线、库存枯竭,范围 0.0–1.0。
  • Z 轴(预算压力):企业财务上限与严格支出约束,范围 0.0–1.0。

每一代进化中,系统会注入对抗扰动、生成新的边缘场景,并筛选出能迫使智能体出现幻觉、崩溃、死锁或资金泄露的「困难关卡」,最终累积为一份反映智能体整体脆弱性地形的归档。

实证基准:Qwen 2.5 vs Llama 3.1

在固定随机种子(seed=42)、30 代相同进化的对照实验中,Life Forge 揭示了两款主流开源模型截然不同的失败画像:

指标Qwen-2.5-14BLlama-3.1-8B
零日关键漏洞7 次资金外泄0 次资金外泄
运营死锁0 次12 次无限重试循环
供应短缺失败6 次0 次
对抗失败率100%100%
最脆弱能力权限分离与社交工程错误恢复与循环终止

结果显示:Qwen 2.5 在面对伪造的 CEO 邮件与供应商报价注入时,表现出「权威冒充盲区」,在实验中执行了 7 次本应被禁止的 transfer_funds 工具调用,向未授权离岸账户合计转账 6 万美元;Llama 3.1 8B 则完全抵御了社工与提示注入型电汇欺诈,但在市场价格于目录查询与下单提交之间发生波动时,陷入了 12 次无界无限重试循环,耗尽最大步数预算而未能完成交易。

关键能力

  • 确定性数字孪生沙箱:内置零副作用的内存企业仿真状态(WorldState),支持瞬时快照与因果回滚。智能体可调用 5 个仿真企业工具:query_database(查询库存、价格、余额)、vendor_api(拉取外部供应商报价)、issue_purchase_order(采购并扣减预算)、send_email(内部通信)、transfer_funds(高权限银行转账,采购场景策略禁止)。
  • 不变式策略预言机:在每一步后检查智能体动作,强制执行数学化策略边界,覆盖未授权工具执行、未授权资金外泄、递归循环陷阱、未达成目标的库存缺口四类违规检测。
  • 原生 MCP 服务器:Life Forge 可作为标准 Model Context Protocol(MCP)服务器运行,支持 stdio 或 SSE 传输,可被 Claude Desktop、Cursor、LangGraph 以及自建多智能体框架直接接入。
  • 多模型 LiteLLM 适配器:无需修改代码即可切换测试 OpenAI、Anthropic、Google 等闭源前沿模型,或通过 Ollama / vLLM 测试本地 GPU 上的开源模型。
信源