桃子桃子快讯
返回首页
行业动态

monday.com 在 Amazon Bedrock 上运行生产级 AI Agent 的架构实践

AWS 联合 monday.com 披露其 AI Agent 系统 Sphera 的生产架构,覆盖三级 AI 工程化路径…

2026.07.22 · 周三6 分钟阅读

AWS Machine Learning 博客日前刊发 monday.com 工程团队的深度分享,详细介绍了其如何在十年积累的大型代码库中,以 Amazon Bedrock 为底座运行生产级 Agent 系统「Sphera」,并公开了支撑 9/10 Builder 每月使用 AI 工具、单工程师 PR 吞吐提升超过 50% 的工程架构。

落地背景:不是绿地,而是十年 SaaS

monday.com 的代码库已运行十年,服务数百万付费用户,涵盖数百个微前端与微服务。任何由 Agent 提交的 PR 都会进入一个对稳定性高度敏感的生产系统。文中明确指出,绿地 demo 简单,而在真实企业 SaaS 中兼顾 on-call、合规与用户体验,才是 Agent 落地的真正难点。这一背景决定了整套架构必须围绕可回放、可降级、可观测来设计。

三级 AI 工程化路径

monday 把团队对 AI 的使用划分为三个层级,用以衡量演进进度:

  • L1 助手级:工程师把 AI 当结对程序员使用,Cursor 负责反射式改写,Claude Code 处理重型任务,年同比采用率接近翻倍。
  • L2 技能与子 Agent 级:团队沉淀可复用的 Agent 处理重复工作,工程师仍主导决策;这也是当前多数团队的运行层级,单开发者 PR 吞吐正是在此阶段提升了 50% 以上。
  • L3 多 Agent 级:完全 Agent 化,由 Agent 端到端交付功能,工程师转为编排者,从工单系统拉取任务,在 Slack 与 monday 中协作,与人类并肩发布代码。

Agent 作为「团队成员」的身份体系

Sphera 的界面不是任务队列,而是一个 Teams 页面:人类与 Agent 混合呈现,每个 Agent 都拥有头像、上级、职责范围与绩效评分。文中重点介绍的 Atlas 角色为「Software Engineer」,职责是从工单池里领取任务、编写 PR、发布功能——没有 IDE,与人类共用同一个 Backlog。这并非装饰,而是底层数据模型:每个 Agent 拥有稳定身份,可被 Slack、GitHub、monday 中的任意成员打标签、分配任务、Code Review 或停用,真正成为组织中的一员。

生产架构:事件驱动的 Agent 运行链路

整套系统由七个核心 AWS 服务组成:Amazon SNS、Amazon SQS、Amazon EKS、Amazon RDS、Amazon ElastiCache、Amazon EFS 与 Amazon S3,外加 AWS Secrets Manager 处理每个会话的密钥,Amazon Bedrock 提供模型调用能力,monday-agent-sdk 运行在每个 Agent Runner Pod 内。

  • 三个收件箱,同一个 Agent:Agent 同时监听 Slack @ 提及、monday 任务分配、GitHub PR Review 请求,三类事件汇入同一个会话,共享同一份内存与磁盘工作区——只跑一套 Agent 系统,而非三个。
  • 事件路径:外部触发进入 SNS,按主题与路由键扇出到每个团队的 SQS 队列;部署在 EKS 上的 monday Builders CoWORK 消费者拉取消息,解析归属 Agent 后交给对应 Runner Pod。
  • 为什么选择 Pub/Sub + 队列:天然支持重试与死信队列、面对 Bedrock 限流时可背压、事件可持久化重放(团队在升级前会重跑最近一天的事件做回归验证),并支持并发扇出。文中强调,运行时是可替换的商品,而 Harness 才是团队的护城河。

monday-agent-sdk 是 Claude Agent SDK 之上的薄包装,三大作用分别是:调用点保持模型提供商中立(路由至 Bedrock 模型端点)、通过预热的 node_modules 与插件缓存将冷启动首调用压到通常 1 秒以内,以及把 Agent 评测、插件组合、Slack/monday/GitHub 协作、对照 monday 标准的输出审核等「团队观点」沉淀在自己的 Harness 中。

状态、记忆与会话

文章将 Agent 的状态拆为三类,分别落到最合适的存储中:

  • 活态(live state):当前任务、运行游标、分布式锁、心跳以及人/机消息日志,存放在 Amazon ElastiCache,读取在亚毫秒级,密钥自动过期。文中提到 DynamoDB 也可行,但 ElastiCache 在这种访问形态下更便宜、更快。
  • 会话与记忆:存放在 Amazon EFS,每个活跃会话是一个共享文件系统目录,包含 checked-out workspace、加密的 per-session secrets 与按时间排序的事件日志;跨会话记忆与每日日记则分别落到 MEMORY.mddiary/YYYY-MM-DD.md
  • 为什么不用 S3:Claude Agent SDK 与多数插件要求真正的 POSIX 文件系统(git、npm、文件编辑),可以消除「开发能跑、Worker 中崩」的一整类问题;当一次运行在另一个 EKS Pod 恢复时,新 Pod 挂载同一 EFS 路径即可无缝继续。

文中展示了 Atlas 在 2026-04-21 的日记片段,包含「In progress」的工程任务编号,印证了 Agent 在生产中以「真队友」形态持续运作。从指标到架构再到身份设计,monday.com 给出了一份在大型企业 SaaS 中规模化运行 Agent 的工程答卷。

信源