开源
微软发布 Fara1.5 系列视觉驱动网页操作智能体
微软研究院推出 Fara1.5-27B 多模态计算机使用代理,截图理解浏览器并自动完成任务
2026.07.23 · 周四约 3 分钟阅读
微软研究院(Microsoft Research AI Frontiers)近日在 Hugging Face 上发布 Fara1.5-27B,这是一款面向网页浏览器的多模态计算机使用代理(CUA)模型,采用 MIT 协议开源权重。该模型通过截图观察浏览器界面,再以结构化工具调用(点击、输入、滚动、访问 URL、网页搜索等)替用户完成端到端任务,是微软在"computer use"赛道的最新成果。
模型架构与训练方式
Fara1.5-27B 的感知通道完全依赖视觉——模型只看浏览器截图,不读取 DOM 或可访问性树;内部推理与轨迹历史则以文本形式记录。给定当前截图与历史动作,模型预测下一步动作及对应参数(如点击的像素坐标)。
该模型基于 Qwen3.5-27B 进行监督微调,训练数据由微软自研的 FaraGen1.5 多智能体流水线生成:
- 自动合成网页任务
- 执行轨迹求解
- 验证结果后再用于训练
核心使用场景
- 自动化重复性网页任务:填表、网购、行程预订、餐厅订位、信息检索、账户操作等
- 作为其他智能体的"定位模型",提供像素级精确的动作预测
官方推荐与 MagenticLite 框架搭配部署,覆盖研究与生产环境。
明确边界与已知限制
官方在模型卡中划定了"超出范围"清单,提示以下场景不适用:
- 非英语任务(训练数据仅含英文)
- 法律、医疗、金融等高风险领域
- 影响法律地位、住房、就业、信用等资源的分配决策
- 未沙箱化且能访问敏感账户或文件的环境
- 未经额外测试与防护直接用于商业或现实生产
已知的模型局限包括:
- 纯视觉感知易被低质量页面渲染、页面内嵌的提示注入或 UI 视觉歧义误导
- 多步轨迹存在误差累积,早期一次误点击可能在后续步骤被放大
- 多轮任务运行间方差较大,基准分数均经过多轮平均
- 可能"幻觉"页面状态,或把早期截图中的信息错配到当前上下文
系列规格与部署
除 27B 主模型外,系列还包括两个更小的版本:
- microsoft/Fara1.5-4B
- microsoft/Fara1.5-9B
三个规格均已在 Hugging Face 上发布权重。Fara1.5-27B 与 MagenticLite 协同设计,后者提供代理编排、安全护栏与执行环境,是微软推荐的部署方案。
