哈佛 MIT 团队造 83 亿 AI 智能体镜像人类
哈佛 MIT 等机构发布 MatrAIx,构建 83 亿 AI 智能体覆盖 1290 个画像维度,模拟全球人口行为。
一支由哈佛与 MIT 研究者牵头,OpenAI、Anthropic、Google DeepMind、xAI 等机构超过 200 位科学家参与的项目团队,发布了名为 MatrAIx 的研究工作,声称构建了规模达 83 亿的 AI 智能体集合,用于镜像全球人口的真实行为。
83 亿智能体与 1290 个画像维度
MatrAIx 的核心是 Persona-8B 数据库,记录数与当前地球总人口相当。每个虚拟人由 1290 个画像维度刻画,涵盖五大类:
- 背景信息:参考联合国人口统计等来源
- 心理特征:参考 General Social Survey 等问卷
- 专业能力:参考 Stack Overflow 等开发者社区
- 行为互动:参考 Amazon 等消费平台评论
- 日常生活:参考 Wikipedia 人物志等
为防止出现「住在肯尼亚农村、只有小学学历、却拥有哈佛博士学位」的逻辑崩坏样本,团队引入了有向无环图(DAG)来约束属性之间的条件依赖:决定「英语能力」前必须先确定「主要语言」与「所在地区」,并叠加兼容性过滤器,违背常理的父子属性组合会被直接剔除。
四类评估环境与上千项任务
MatrAIx Playground 提供四种智能体交互沙盒:
- 调查问卷:测试概念、定价敏感度与支付意愿
- AI 聊天:完整记录对话轨迹,追踪情绪波动与追问习惯
- 网页:模拟搜索、比价、看评论并做出购买决策
- 应用程序:智能体可直接操控 Linux、macOS 与 iOS 桌面,通过虚拟鼠标、键盘、触控完成日常软件操作
目前已在 25 个领域部署 1,010 项评估任务,累计运行 18,189 次大规模模拟用户交互实验。
声称的一致率与评估准确度
团队报告,在 400 次控制实验中,智能体符合指定人设的一致率达到 91.5%。在对真实人设的一致性评估中,人类专家给出 4.135/5 的平均分。底层大模型在评估任务中的表现亦接近人类评估者水平:
- Claude Opus 4.8:93.8% 的情况下,评估误差与人类专家偏差控制在 1 分以内
- GPT-5.5:79.2% 的情况下误差在 1 分以内
闭环评估的边界
该体系本质上是「大模型扮演用户,去评估另一个由大模型驱动的虚拟人」——左、右手互相打分构成的闭环。论文作者在结尾明确指出:虚拟用户永远无法完全替代真实人类,对于关乎社会命运的高风险决策和重大科学结论,真实用户的亲自参与仍然不可替代。
另一层隐忧在于,人类历史上许多颠覆性的艺术、商业模式与科学突破,往往诞生于被 DAG 兼容性过滤器视为「不兼容」而剔除的异常值中,难以被 1290 个概率刻度所穷尽。
参考资料:matraix.ai、arXiv:2608.04205、GitHub: MatrAIx-Persona-8B。
