图灵奖得主本吉奥 WAIC 警告:AI 安全措施已追不上能力狂飙
WAIC 2026 科学前沿论坛上,本吉奥、周伯文等中外学者聚焦 AI 安全治理,指出编程能力飙升至 88% 而科研仅…
2026 年 7 月 17 日下午,世界人工智能大会(WAIC)科学前沿论坛上,图灵奖得主约书亚·本吉奥通过远程连线发出警告:「AI 既降低了作恶的门槛,又抬高了危害的上限。」围绕「迈向 AGI 时代:前沿人工智能的安全挑战与全球治理」,本吉奥、上海人工智能实验室主任周伯文、西安电子科技大学校长高新波、复旦大学副校长姜育刚、香港科技大学(广州)协理副校长熊辉、SecureBio AI 研究负责人贾斯珀·戈汀、独立研究员杰夫·吴以及索伦·明德曼等多位学者展开深度对话,核心结论是:当前的安全措施,已经追不上 AI 能力狂飙的速度。
传统护栏失效,「内生安全」成新方向
当 AI 具备推理、规划与工具调用能力,传统「找漏洞、打补丁」式的安全护栏正从根基上崩塌。高新波将其失效方式归纳为四种:推理能力让 AI 找到防护盲区实施精准「越狱」;规划能力使其学会战略性欺骗;工具调用链条的复杂语义副作用难以辨别;三者叠加涌现出综合能力,让开放环境中的行为空间趋于无限。
对此,姜育刚提出「内生安全」概念,类比人的成长既需要教育把道德与法律变成内心「规矩」,也需要外部监管兜底。熊辉则引入东方视角,将安全框架归纳为「不敢为、不能为、不欲为」三层——从外部惩罚到数学底座内置约束,再到心智层面的本能自律。他进一步构想:若内核层面安全控制得以实现,可将安全内核保持闭源,而外围放心开源,为开源治理开辟新路径。
编程能力狂飙,科研能力原地踏步
周伯文在演讲中揭示了一组冷热反差:过去 18 个月,AI 的编程成功率从 5% 飙升到 88%,国外已有约一半基准测试因模型过强而失去参考价值;然而艾伦研究所端到端科学研究评测显示,同期表现最好的大模型在科学任务上的完成率始终停在 3%,大多数模型卡在 60% 到 70% 区间。NatureBench 评测也表明,AI 产出超越当前最好成果的科学论文成功率仅 17.8%。
周伯文将这一反差归因于三点:大模型只能被动观察世界,学到的是相关性而非因果性;科研反馈周期长,模型难以学习;训练集几乎只有成功数据,模型被锁死在已知分布。他据此判断:「AGI for Science(AI4S)不是通用人工智能的应用,而是人工智能的终极考题。」上海人工智能实验室推出的「书生·端砚」科学发现平台尝试将失败纳入学习闭环——清华课题组改造基因调控蛋白接入该平台后,仅两轮迭代 AI 就发现新突变组合,功能比此前《自然》报道的最好结果高出 77%。
生物风险与「证据困境」
在各类前沿风险中,化学、生物、放射性与核风险(CBRN)被视为最致命领域之一。本吉奥警告,开源模型一旦发布便不可逆转,双重用途能力无法被召回或修复,必须在模型能力跃迁之前就做好准备。戈汀引用实地调查指出,在尼日利亚,前恐怖组织「博科圣地」成员每日使用 AI 制造炸弹与制定攻击计划,甚至开设培训班教成员如何用 AI 开展恐怖活动。
明德曼提出更深的治理困境——「证据困境」:AI 能力常跳跃式提升,但在风险变成现实之前,人们很难拿到「一定会造成危害」的确凿证据。他以 Anthropic 为例,团队担忧模型网络攻击风险却无法证明「一定会出事」,最终自愿决定暂不投放市场。
治理分歧:从「立即行动」到「务实推进」
面对严峻前沿风险,全球科技界态度分化。本吉奥呼吁各国政府将「在能力跃升前做好准备」作为默认姿态;高新波认为不必陷入末日恐慌,更不能直接叫停研究,要把「安全锁」在工程与设计层面打造完美;姜育刚强调呼吁停止研发在现实中不可能,最务实的做法是新技术研发与风险防控同步推进;熊辉则坚定支持开源,认为闭源模型能力越强风险同样急剧增加,关键在于重构内核层面的安全架构。
在具体操作层面,杰夫·吴建议通过预训练与后训练阶段的数据过滤降低风险;明德曼则提出云服务商可在身份核查层面设置门槛,确保只有更可信的人才能获得模型权重访问权限。周伯文在演讲最后留下判断:「安全价值就是商业价值,它们并不对立。」
