桃子桃子快讯
返回首页
研究论文

AI 真实使用方式仍不明:独立研究平台填补数据盲区

斯坦福与 MIT 等团队推出 AI Observatory 独立分析平台,整合 7 个数据集、52 个模型的使用对话,揭…

2026.08.18 · 周二4 分钟阅读

AI 公司虽然定期发布 ChatGPT、Claude 等产品的使用报告,但这些数据完全由厂商自行筛选和公开,缺乏独立来源加以印证。斯坦福可信 AI 研究实验室(STAIR)的计算机科学博士生 Anka Reuel 表示:「目前没有任何独立来源能够佐证这些报告。」她与 MIT 媒体实验室近期博士毕业生 Shayne Longpre 共同主导了一项名为「AI Observatory」的新研究项目,旨在填补这一空白。

项目定位:独立聚合真实对话

AI Observatory 是一个公开平台,整合并分析了来自 7 个现有数据集的真实 AI 对话,涵盖 Claude、Gemini 等主流模型。Reuel 指出,利益相关者目前正基于极其有限的数据对 AI 的收益与风险做出重大决策,该平台希望为研究者和政策制定者提供独立的参考信息。

研究团队成员来自 MIT、斯坦福、Data Provenance Initiative 等机构,共汇总了 2023 年至 2025 年间 5,000 名用户与 52 个不同模型产生的 24,521 段对话、85,633 轮交互。但与厂商可获取的数据相比,这一规模仍属微小:Anthropic 最新经济指数基于 100 万段 Claude 对话,OpenAI 关于 ChatGPT 使用的报告则分析了 150 万段对话。

关键发现:被过滤的近一半对话

研究团队将 Anthropic 的方法论套用至自有数据集后发现,约 48% 的对话会被 Anthropic 现行筛选规则剔除。被剔除的非工作类对话中,多类敏感内容的占比明显高于 Anthropic 自身报告中的水平:

  • 健康与情感话题:44.2%(Anthropic 报告为 31.2%)
  • 成人或违规内容:7.9%(Anthropic 报告为 2.1%)
  • 骚扰、仇恨言论:27.5%(Anthropic 报告为 5.66%)
  • 性相关内容:16.7%(Anthropic 报告为 2.4%)

OpenAI 2025 年关于 ChatGPT 的报告同样显示,仅 30% 的消费者使用与工作相关。这说明厂商报告主要聚焦生产力场景,对个人使用和敏感行为的覆盖存在显著盲区。Anthropic 代表回应称,其公开研究反映了研究团队的具体问题与兴趣,并强调支持外部独立研究的重要性。OpenAI 未回应置评请求。

模型差异:使用场景各有侧重

研究还揭示了不同模型之间、以及同一模型不同版本之间的显著差异:

  • Grok 与 Gemini 更常被用于信息检索;Grok 在新闻和政治类信息上尤为常用,同时也是虚假信息最集中的平台。
  • 用户更多使用 Anthropic 模型进行编程,使用 Gemini 进行社交和角色扮演,使用 ChatGPT 辅助作业。
  • 在 ChatGPT 内部,GPT-3.5 时期对话较短,而 GPT-4o 时期对话更长、更具迭代性——后者此前因引发情感依赖而受到关注。

趋势变化:对话更长、敏感行为下降

时间维度上,研究也观察到几个明显趋势:最大的数据集之一 WildChat 显示,对话的提示词 token、回复 token 和轮次都在增长,意味着交流更加深入和复杂;闲聊比例显著上升,AI 陪伴使用增加,而模型主动披露「我是聊天机器人」的比例则在下降。被研究人员标记为敏感使用的对话比例有所下降,可能反映出平台部署了更有效的安全防护措施。

Longpre 总结道:「没有任何一份厂商报告能讲述完整的故事。」AI Observatory 试图提供的,正是这种跨模型、跨时间的全景式独立观察,以弥补当前公开数据的结构性缺口。

信源