工业圈说 Agent 已能造世界,学术圈说它只是电灯泡
阿里博见社双城对话中,产业界与学术界对 Agent 现状给出截然不同的判断:前者已在搭建虚拟片场与多 Agent 协作,…
阿里硬核少年技术节 5.0 旗下博见社首次设置了两场对话——北京工业场与杭州学术场。两场相隔约一千公里,工业圈与学术界对 Agent 的现状给出了几乎南辕北辙的判断:一边认为 AI 已经能「造世界」,另一边则把它比作刚被发明的电灯泡。
北京工业场:AI 已在搭建真实生产世界
北京场的主题是「AI 下一站:从生成内容到构建世界」,虎鲸文娱、美图、群核科技等企业带来了各自的产业实践。
群核科技分享了一个颇具代表性的案例:团队将横店的部分线下片场扫描、重建后搬到线上,形成可复用的 3D 影视基地。群核科技 AI 业务线高级总监龙天泽指出,当前视频生成模型主要在二维像素层面学习,逼近三维却难以真正理解空间结构——同一房间的多个补出视角单看逼真,放在一起门窗、家具位置却常常互相矛盾,在长视频中更容易穿帮。其解法是先生成明确的 3D 空间,再把关键画面交给视频模型完成最终生成,龙天泽将这套分工概括为「视频模型负责审美和语言控制,3D 模型负责一致性」,核心思路是「一次搭建,全篇复用」。
虎鲸文娱集团 CTO 杜颜龙从影视工业的视角补充:影视行业过去一百多年在解决成本、周期和品质三个核心问题,AI 出现后迎来系统性重写。在他看来,降本增效只是表层,AI 真正的价值要落到能不能在更多观看场景里以极致视听语言讲好故事。他将影视品质拆为编剧审美、美术审美和导演审美三类,并判断「AI 不会取代真人,但一定会重写影视生产流程」,当内容供给大幅增加后,真正稀缺的不再是「能不能生成」,而是「什么值得被生成」。
美图公司技术副总裁兼美图影像研究院负责人刘洛麒则把焦点放在从强模型到用户低门槛使用之间的「产品鸿沟」上。其判断是:Agent 出现后,软件逻辑开始从「功能堆叠」走向「智能决策」,从「交付功能」走向「交付成果」。面对单个 Agent 难以胜任的多目标复杂任务,美图把软件从 Agent 升级为 Agent Teams——以美图设计室为例,4 个专业 Agent 与 70 个 Skill 协作,覆盖市场分析、内容生成、视觉创作到投放分析,最终交付一套可直接使用的商业物料。
杭州学术场:Agent 只是刚被发明的电灯泡
杭州场联合 CCF 人工智能与模式识别专业委员会,邀请清华大学、南京大学、上海交通大学、天津大学、山东大学及上海人工智能实验室等机构学者,讨论主题为「从生成式 AI 到智能体进化」。
南京大学教授高阳在致辞中指出,从早期逻辑智能体、强化学习智能体到今天的大模型智能体,AI 正把曾经的哲学设想逐步带入工程现实,但智能体在底层能力、工程框架、可靠性与安全性上仍有大量未解问题。
在圆桌讨论中,与会嘉宾首先追问「Agent 究竟发展到哪一步」,但没有给出统一答案。天津大学教授郝建业认为 Coding Agent 已很难再被简单划入初期,已能接手相当一部分过去由程序员完成的具体工作;但若把视角转向底层技术,他同样谨慎:今天 Agent 能力的提升仍高度依赖基座模型,MAS、Loop Engineering 等架构思想学术界早已研究多年,只是因强基模出现才获得大规模应用机会。
换到具身智能,进度条又要往回拉。机器人进入现实后需同时处理视觉、空间、动作及环境突发变化,实验室演示与工厂、家庭长期稳定工作完全是两个难度。真正能在开放世界里持续学习、自主发现并设置目标的 Agent,被现场嘉宾判断为「比初期更早」——这类 Agent 目前缺乏成熟理论,持续学习中还会遭遇灾难性遗忘与模型可塑性不足等基础难题。
第二个争论更加尖锐:从生成式 AI 走到 Agent,究竟是量变还是质变?多数嘉宾偏向量变,认为今天 Agent 能执行更长任务,主要得益于基模增强、上下文变长、工具调用更稳定与 Harness 持续优化,底层技术范式并未明显改变。质变应发生在 Agent 能突破基座模型原有能力上限之后——具体标志是:能判断自身结果是否正确、发现问题主动修正,并将执行过程沉淀为自我进化。山东大学教授韩忠义从产品形态出发给出另一种观察:从「告诉你怎么做」走到「它自己动手去做」,用户体验已发生实质变化。上海人工智能实验室青年研究员张航帆则尝试弥合两种观点——技术演进通常是小步积累,但当成功率跨过临界点时,用户体验会发生突变。
第三个问题聚焦在 Agent 真正获得自我进化能力还缺什么。四场主题报告从不同角度拼出了答案:
- 郝建业关注工具调用、长期任务、记忆与安全——工具让 Agent 进入真实环境,记忆让经验跨任务延续,安全决定其能否承担真正有风险的工作。
- 上海交通大学副教授温颖把问题放进持续强化学习,指出大语言模型中策略、环境模型与验证器彼此耦合,训练更易波动。
- 清华大学智能产业研究院副研究员周浩将大规模 Agent 系统所需能力归纳为三项:低时延基座模型、自演化强化学习、可学习的长程记忆。
- 张航帆关注 Harness——围绕大模型搭建的任务执行框架,并进一步研究 Self-Harness,让 Agent 能自动诊断与优化自己的运行框架。
把这些议题放在一起,杭州学术场关心的已不止「Agent 能不能干活」,还包括它能否判断对错、沉淀经验、形成自我进化——这正是「电灯泡」背后那套尚未建成的电网。
两种判断背后的现实张力
北京的产业案例表明,现有 Agent 能力已能在影视、设计、虚拟片场等具体场景中替代或重组部分生产环节;杭州的学术讨论则提醒,Agent 在开放世界、持续学习、自我进化等更基础层面仍未跨过门槛。两类声音并非简单对立,而是同一发展阶段从不同观察维度得出的结论。当下 Agent 的真实处境,或许正如张航帆所言:技术上看是量变,体验上看已临近质变临界点。
