OneAdvanced 在英国主权 AWS 上自托管 Llama 4 部署超 50 个 AI 智能体
英国企业软件商 OneAdvanced 基于 SageMaker AI 与 vLLM 自托管 Llama 4 Maver…
英国企业软件提供商 OneAdvanced 服务超过 1 万家客户,业务覆盖医疗、法律等强监管行业。由于客户对数据主权有严格要求——数据不能流出英国境内——OneAdvanced 选择了一条区别于托管服务的路径:在 AWS 完全自控的基础设施上自托管开源权重大模型,并以此为基础构建了超过 50 个专用 AI 智能体。该方案同时支持其获得 ISO 42001 AI 治理认证。
数据主权与模型托管的双重挑战
OneAdvanced 最初在 Amazon Bedrock 上进行了两周冲刺验证,完成了聊天补全、英国法规检索、Snowflake 数据接入与图表生成等原型。但 Bedrock 在英国区域当时尚未提供其所需的 Llama 4 Maverick 与 Llama Guard 4,无法满足数据驻留要求。为此,OneAdvanced 转向在自有 AWS 账户中独立部署、推理与扩缩容模型,并围绕其搭建生产级方案,涵盖内容审核、文档检索、智能体编排以及面向非技术人员的无代码智能体构建工具。
OneAdvanced CTO Andrew Henderson 表示,数据主权在英国是硬性要求,客户需要清楚掌握数据的存储位置、访问者身份以及所在的法律监管框架。
整体架构:四层组件协同
方案由四个核心组件构成:
- 模型推理层:vLLM 在 Amazon SageMaker AI 的 p5.48xlarge 实例上服务 Llama 4 Maverick(FP8 版本)与 Llama Guard 4,部署于伦敦(eu-west-2)区域。
- 智能体层:超过 50 个 Strands 智能体运行在 Amazon ECS 上,每个智能体拥有独立的系统提示词、工具集合和可选输入表单,配置存储于 Amazon DynamoDB。
- 数据与检索层:上传至 Amazon S3 的文档先转为 Markdown,再切片并向量化写入 Amazon Aurora PostgreSQL 兼容版的 pgvector 扩展中,供 RAG 检索。
- 安全审核层:Llama Guard 4 在主模型推理之前对用户输入进行有害内容筛查。
一次典型请求的流程为:用户发送消息 → Llama Guard 4 审查输入 → 路由至对应 Strands 智能体 → 智能体调用工具并从 pgvector 与 S3 检索文档,必要时触发网络搜索等专用工具。
部署细节与模型选型演进
Llama 4 Maverick 采用 meta-llama/Llama-4-Maverick-17B-128E-Instruct-FP8 权重,Llama Guard 4 采用 meta-llama/Llama-Guard-4-12B,二者均通过 Hugging Face 获取,并借助 AWS Deep Learning Containers 部署。
- 实例选型:OneAdvanced 目标上下文长度为 120K–128K token,以支持长文档分析与多轮对话。早期使用 p4d.24xlarge 进行验证,AWS 顾问支持下的负载测试确认 p5.48xlarge 可满足吞吐要求后转入生产,并利用预留实例折扣降低 GPU 计算成本。
- 审核模型迭代:Llama Guard 4 取代了早期部署的 Llama Guard 3,原因是 OneAdvanced 观察到旧版本存在较高的误拒率。
- 智能体编排:超过 50 个 Strands 智能体各司其职,配合 pgvector 向量检索与 S3 文档存储,形成可扩展的多智能体协作框架。
落地意义与适用条件
该方案为受监管行业提供了「开源权重 + 自托管 + 主权云」的参考模板:在保留对模型服务基础设施完全控制权的同时,仍能借助 AWS 的托管 SageMaker 与 ECS 能力快速交付生产级 AI 应用。
复现该路径需具备:目标区域的 p5.48xlarge GPU 配额、ECS 容器部署与 S3 存储管理经验、Hugging Face 上的模型权重访问权限(Llama 4 系列需接受许可协议)、Python ML 框架使用经验,以及启用 pgvector 扩展的 PostgreSQL 数据库。OneAdvanced 的实践表明,在数据主权强约束场景下,自托管开源权重模型已可作为托管服务的可行替代。
