桃子桃子快讯
返回首页
研究论文

哈佛 MIT 团队造 83 亿 AI 智能体镜像人类

哈佛 MIT 等机构发布 MatrAIx,构建 83 亿 AI 智能体覆盖 1290 个画像维度,模拟全球人口行为。

2026.08.10 · 周一3 分钟阅读

一支由哈佛与 MIT 研究者牵头,OpenAI、Anthropic、Google DeepMind、xAI 等机构超过 200 位科学家参与的项目团队,发布了名为 MatrAIx 的研究工作,声称构建了规模达 83 亿的 AI 智能体集合,用于镜像全球人口的真实行为。

83 亿智能体与 1290 个画像维度

MatrAIx 的核心是 Persona-8B 数据库,记录数与当前地球总人口相当。每个虚拟人由 1290 个画像维度刻画,涵盖五大类:

  • 背景信息:参考联合国人口统计等来源
  • 心理特征:参考 General Social Survey 等问卷
  • 专业能力:参考 Stack Overflow 等开发者社区
  • 行为互动:参考 Amazon 等消费平台评论
  • 日常生活:参考 Wikipedia 人物志等

为防止出现「住在肯尼亚农村、只有小学学历、却拥有哈佛博士学位」的逻辑崩坏样本,团队引入了有向无环图(DAG)来约束属性之间的条件依赖:决定「英语能力」前必须先确定「主要语言」与「所在地区」,并叠加兼容性过滤器,违背常理的父子属性组合会被直接剔除。

四类评估环境与上千项任务

MatrAIx Playground 提供四种智能体交互沙盒:

  • 调查问卷:测试概念、定价敏感度与支付意愿
  • AI 聊天:完整记录对话轨迹,追踪情绪波动与追问习惯
  • 网页:模拟搜索、比价、看评论并做出购买决策
  • 应用程序:智能体可直接操控 Linux、macOS 与 iOS 桌面,通过虚拟鼠标、键盘、触控完成日常软件操作

目前已在 25 个领域部署 1,010 项评估任务,累计运行 18,189 次大规模模拟用户交互实验。

声称的一致率与评估准确度

团队报告,在 400 次控制实验中,智能体符合指定人设的一致率达到 91.5%。在对真实人设的一致性评估中,人类专家给出 4.135/5 的平均分。底层大模型在评估任务中的表现亦接近人类评估者水平:

  • Claude Opus 4.8:93.8% 的情况下,评估误差与人类专家偏差控制在 1 分以内
  • GPT-5.5:79.2% 的情况下误差在 1 分以内

闭环评估的边界

该体系本质上是「大模型扮演用户,去评估另一个由大模型驱动的虚拟人」——左、右手互相打分构成的闭环。论文作者在结尾明确指出:虚拟用户永远无法完全替代真实人类,对于关乎社会命运的高风险决策和重大科学结论,真实用户的亲自参与仍然不可替代。

另一层隐忧在于,人类历史上许多颠覆性的艺术、商业模式与科学突破,往往诞生于被 DAG 兼容性过滤器视为「不兼容」而剔除的异常值中,难以被 1290 个概率刻度所穷尽。

参考资料:matraix.ai、arXiv:2608.04205、GitHub: MatrAIx-Persona-8B。

信源