桃子桃子快讯
返回首页
工具

Datadog 用 Mamba 小模型做安全事件初筛,降低 AI 调查成本

Datadog 提出两阶段检测流水线:先用约 9700 万参数的 Mamba 状态空间模型 Mambark 给每条事件打…

2026.07.28 · 周二5 分钟阅读

Datadog 近日在其工程博客中介绍了名为 Mambark 的小型语言模型,并围绕它搭建了一套「轻量初筛 + AI agent 深入调查」的两阶段安全检测流水线。该方案旨在解决一个现实矛盾:用前沿大模型对每一条安全事件做推理成本过高,但完全不借助 AI 又容易漏掉真正的高危信号。

为什么单靠 Agent 盯不住日志

Datadog 在文中指出,大语言模型 Agent 在安全分析上能力很强——给定一条可疑认证事件,Agent 可以拉取用户近期活动、检查资产补丁状态、查询威胁情报,并判断这是否构成真实威胁。这种推理能力与人工分析师的工作方式非常接近,但代价是高昂的前沿模型调用成本。

按照他们的估算,一家大型企业若用前沿大模型对每一条安全相关事件打分,单日费用可能达到「数千万美元」。即便让 Agent 改为交互式查询日志,也无法解决根本问题:在数十亿条事件里定位一条未知异常,本质上是排序问题而非检索问题,需要对每一条记录打分,而不是用关键词去搜。

这正是信息检索中经典的两阶段设计:用便宜快速的检索器缩小范围,再用昂贵但强大的阅读器对短名单做深度推理。在安全场景里,Agent 扮演阅读器角色,Datadog 需要的是一个召回率足够高的检索器,把每一条事件都过一遍,只把最可疑的候选交给 Agent。

Mambark:约 9700 万参数的 Mamba 状态空间模型

Mambark 的出发点是一个朴素观察:任何做「下一 token 预测」的语言模型天然就是一个异常检测器。如果模型对某条事件的预测概率很低,说明它在已知上下文中没见过这种模式,这条事件的负对数似然即可直接当作异常分数,无需任何标注。

在此基础上,Datadog 做了两个关键设计选择:

  • 架构与预训练:Mambark 基于开源 mamba-130m 骨干构建,是一个约 9690 万参数的 Mamba 选择性状态空间模型(SSM)。它在数千亿条安全事件上以「下一事件预测」为目标做预训练,从而学到正常活动的结构。相较于注意力复杂度随序列长度二次增长的 Transformer,状态空间模型是线性时间,这很关键:真实攻击往往跨很长的会话,一次入侵可能由成千上万条事件组成,Mambark 可以在单卡 GPU 上条件化上万条事件的上下文。
  • 统一表征:syslog、认证记录、网络流量、内部威胁活动等不同来源的遥测数据,被统一规范为按实体分组、字段扁平化、再哈希进共享词表的形式。模型不区分数据来源,只看到字段集合不同,架构、Tokenizer 和训练方案对所有基准完全一致,没有任何手工特征工程。

公共基准表现

Mambark 在六类常见日志异常基准上做了评测,单一骨干在不同数据集之间通用,无需为每个数据集单独调整。关键结果如下:

  • Thunderbird:F1 = 1.000(前 SOTA 0.990)
  • BGL:F1 = 0.999(前 SOTA 0.990)
  • UNSW-NB15:F1 = 0.994(前 SOTA 0.990)
  • LANL Cyber1:AUC = 0.987(前 SOTA 0.990)
  • HDFS(block):F1 = 0.941 / AUC = 1.000(前 SOTA F1 0.980)
  • CERT Insider Threat:AUC = 0.879(前 SOTA 0.910)

在 Thunderbird、BGL、UNSW-NB15、HDFS 等较成熟的数据集上,Mambark 达到接近或超过此前的最优结果;在 LANL Cyber1 和 CERT Insider Threat 等恶意事件极稀疏、更困难的场景下,也保持与专门方法相当的竞争力。

与 Agent 组成的检测流水线

在这套设计中,Mambark 的角色是对每一条事件打分,只把最可疑的候选转发给 AI Agent 做更深入的调查,从而把前沿大模型的调用量压缩到可承受范围。Datadog 表示,目前正与一小批 Cloud SIEM 设计伙伴测试这一检测模式。它不是要取代基于规则或传统 ML 的检测,而是在它们之上叠加一层低成本、覆盖全量事件的 AI 初筛,让 Agent 推理用在真正值得的地方。

信源