硅谷巨头打响 AI Agent 全天候竞赛
OpenAI、微软、xAI、Meta、Anthropic 从不同方向推进可长期自主运行的 AI Agent,竞逐「全天候…
在比尔·盖茨公开预警 AI 引发的失业危机两天后,硅谷的科技巨头们已经从不同方向鸣响了 AI Agent「全天候运行」的竞赛发令枪。OpenAI、微软、xAI、Meta、Anthropic 五家公司在过去一段时间里相继推出或曝光了具备持续自主执行能力的产品与标准,目标指向同一个方向——让 AI 不再只是回答一次问题,而是承担一段完整的、跨时段的实际工作。
OpenAI 的「持续模式」与 Astra
OpenAI 的最新尝试出现在 Codex 命令行版本中。一个被称作「Persistent mode(持续模式)」的功能,属于「reasoning effort(推理投入)」设置的一部分,允许用户调整模型在处理任务时投入的计算资源、Token 数量与运行时间。一旦开启持续模式,Codex 不会在完成最初任务后立即结束,而是能根据此前的交流内容自行生成后续任务,并跨多个会话继续执行。
支撑这一方向的,是 OpenAI 内部代号为 Astra 的模型。在向客户展示的内部演示中,Astra 可以让多个 AI Agent 分解复杂数学题并分别处理子问题,也能在不同应用之间完成一套工作流程。OpenAI 首席科学家雅各布·帕乔基(Jakob Pachocki)表示,Astra 已经达到一项内部标准:给它一个实验想法,它可以在公司代码库中完成实现、运行实验并返回结果;给它一篇论文,它也能完成过去一名研究人员一周才能完成的工作。首席研究官马克·陈(Mark Chen)估计,公司距离内部定义的 AGI——「高度自主、能够胜任大多数具有经济价值的工作」的系统——大约完成了 80% 的进程。
需要注意的是,OpenAI 并没有因为持续运行能力的加入而放开 Agent 的全部权限;涉及修改用户系统之外的内容,仍需人工批准。
微软 Scout 与 xAI Grok Bot:企业办公与「AI 同事」
微软选择从企业办公场景切入。其推出的 Scout 属于 Autopilot Agent 类别,可长期运行在后台,并与 Microsoft 365 深度结合,能够连接 Teams、Outlook、OneDrive 和 SharePoint,读取聊天、邮件、日历和联系人等信息。用户可通过 Teams 与 Scout 交互,也可以让它延伸到桌面应用与浏览器。
Scout 主要处理安排跨时区会议、准备会议材料、跟踪待办等琐碎但持续存在的工作。微软为每个 Agent 设置了独立的 Entra 身份,企业可限制其能够访问的数据与资源,敏感操作需要人工确认。
相比之下,xAI 推出的 Grok Bot 更接近「AI 同事」的概念。Grok Bot 拥有独立的云端计算环境,可以登录用户使用的工具与应用,处理邮件、软件与网页任务,在需要批准时再交回用户。xAI 内部测试显示,Grok Bot 已被用于销售外联、市场活动、办公运营和软件漏洞修复等工作场景,并且支持多个 Bot 协同——可由一个管理型 Bot 协调分工,不同 Bot 之间共享上下文。
Meta Muse Glimmer:让 Agent 跑在本机上
Meta 的路线有所不同。其发布的 Muse Glimmer 是一个面向本地 AI Agent 的 30B 参数开放权重模型,目标是在个人电脑或 Mac 上直接运行,而非完全依赖云端。
为适配消费级硬件,Meta 对模型做了优化:
- 完整精度版本需要超过 55 GB 显存;
- 经量化后可控制在 20 GB 以内,从而运行在 24 GB 或 32 GB 显存的设备上。
训练重点放在任务执行、工具调用、多步骤推理以及任务失败后的恢复能力上——这些恰恰是 Agent 与聊天模型的关键差异:聊天模型只需给出合理答案,而 Agent 需要面对工具调用失败、步骤出错、计划需要调整等真实变化。
Anthropic MHS:给 AI 接上「硬件接口」
当 AI 不只操作电脑,还要操作实验仪器、机器人和工业设备时,软件接口就不够用了。Anthropic 推出的 Model Hardware Standard(MHS,模型硬件标准)正是为这一问题设计,目前处于研究预览阶段。
- 厂商可通过 MHS 定义设备的运行规则,包括移动速度、角度限制与安全操作范围;
- AI 调用设备时,可按照这些约束执行任务。
这一思路与 Anthropic 此前的 Model Context Protocol(MCP)类似,但范围从软件延伸到了硬件。Anthropic 技术人员亚力克·凯梅尼(Alek Kemeny)表示,MCP 解决软件连接,MHS 希望解决硬件连接,尤其适用于拥有大量设备的实验室环境。目前,MHS 已与 AWS、Danaher、Hugging Face、Raspberry Pi 等机构进行测试。在一项测试中,Genentech 的科学家向 Claude 提供实验设计文件,Claude 通过支持 MHS 的设备自动执行了实验流程。
从「谁更强」到「谁能真正把事做完」
综合五家公司的动向,可以看到一个清晰的共同点:AI Agent 正从一次性的「调用」变成长期存在的工作角色,赛道竞争也从「谁的模型更强」转向「谁能真正把事做完」。能力越强,权限边界与可控性就越关键——微软的独立身份机制、OpenAI 对敏感操作的人工审批、Anthropic 的设备安全约束,本质上都是在为这场「全天候竞赛」补上必要的安全护栏。
