PhysiClaw 用机械臂物理操控手机,绕过接口限制让智能体代办生活服务
PhysiClaw 通过三轴机械臂和电容笔在物理层操作手机,让 AI 智能体无需应用接口即可完成外卖、订票等任务,项目已…
当 AI 智能体已经能够写出高质量代码、辅助科研甚至求解数学难题时,让它代订一张火车票或点一份外卖,却仍然是多数产品迈不过去的坎。PhysiClaw 试图用一种颇为「物理」的方式打破这一僵局:让机械臂直接操控手机,从而绕开国内本地生活类应用几乎不向个人开放接口的现实约束。项目于 2026 年 3 月启动,目前已完成初代硬件原型,硬件图纸与智能体源代码均以 MIT 协议开源,正在寻求 2000 万元人民币天使轮融资。
痛点不在模型,而在接入
近两年大模型快速迭代,智能体在代码、视频生成、科研等场景中的可用性明显提升,但在日常生活场景的渗透率仍然偏低。点外卖、挂号、网购、订票、叫车等高频任务,主要仍由用户手动完成。
真正的瓶颈在于服务接入:
- 国内主流本地生活类应用大多不向个人用户开放接口,少数开放接口通常仅限企业级合作伙伴;
- 平台对自动化访问的风控持续收紧,软件层模拟用户操作既可能违反服务协议,也容易被风控拦截。
这意味着,智能体在生活服务场景的落地节奏,实际上被平台生态的开放节奏所左右,而后者并不掌握在开发者手中。PhysiClaw 因此选择下沉到物理层,寻找不依赖平台授权的通用接入路径。
屏幕即接口:机械臂 + 电容笔
PhysiClaw 的核心思路是不调用应用接口,也不依赖操作系统的特殊权限,而是用一台三轴机械臂直接操作一部完整的手机:
- 摄像头读取屏幕内容;
- 机械臂驱动电容触控笔完成点击、滑动与文本输入;
- 整个交互发生在物理层,从应用侧观察与真人操作没有区别。
硬件方面,采用 CoreXY 双步进电机驱动结构,占地约一张 A4 纸大小,可直接放在桌面运行,定位精度 0.1 毫米。设计图纸以 CAD as Code 方式编写,与智能体源代码一并开源,开发者可自行复现与二次开发。
三层模型架构压低推理成本
为控制单次任务的推理成本,算法层面采用三层分工:
- 端侧轻量视觉模型:负责屏幕文字识别与图标检测,全部本地运行,不产生云端开销;
- 中间层 Phone Use 专用模型:参数量百亿级,负责将任务规划转换为具体屏幕操作序列,目前仍在研发阶段;
- 云端多模态通用大模型:仅在任务规划环节以及执行失败需要接管时调用。
项目还提供宏机制,允许用户把高频操作序列预定义为可复用脚本,智能体一次调用即可执行整段流程,进一步压缩响应时间与 token 开销。在支付等敏感环节,系统会等待用户确认后再执行。
开源铺量,订阅变现
商业模式上,硬件以接近成本的价格销售,目标是将整机成本控制在 500 元以内、开箱即用;利润主要来自后续的月度订阅服务。团队判断,个人助理类产品的竞争关键在于装机量,硬件本身不构成长期盈利来源,因此选择以开源与低价先铺开入口,再通过订阅与开发者生态完成商业闭环。
目标用户分两步走:初期面向关注开源智能体的开发者与技术爱好者,通过社区共建补齐场景生态;中长期面向有日常事务代办需求的普通消费者。
本轮 2000 万元融资将主要用于 Phone Use 专用执行模型训练、端侧视觉模型调优、量产硬件工程开发与开源社区运营,预计支撑约 12 个月研发周期,目标是在资金周期内完成从原型到量产的推进。
