桃子桃子快讯
返回首页
工具

Ask Me Twice:每日追踪 41 款 AI 模型回答的纵向归档

一个开源项目每天向 41 款 AI 模型提出 130 个固定问题,记录回答并支持 API、MCP 与可视化对比。

2026.08.28 · 周五2 分钟阅读

一个名为 Ask Me Twice 的开源项目正在建立 AI 聊天机器人回答的纵向归档:每天由项目方挑选一组固定问题,向市面上多款 AI 模型提问并完整记录回答,使用户既能横向比较不同模型的回答,也能纵向观察同一模型随时间的回答变化。截至当前,该档案已覆盖 130 道问题、41 个模型,累计记录 16.94 万条回答。

项目定位与数据规模

Ask Me Twice 的核心思路是「同一问题、不同模型、不同时间」的三维对比。与一次性评测不同,它强调纵向一致性:题目长期固定,模型名单相对稳定,回答按日归档。这种设计便于发现两类信号:一是模型之间的能力差异,二是同一模型在版本更新、安全策略调整或后端切换后出现的回答漂移。

  • 题目数量:130 道精选问题
  • 覆盖模型:41 款
  • 累计回答:约 16.94 万条
  • 归档粒度:按日更新

三种使用方式

项目提供 REST API、MCP Server 和浏览器 Explorer 三种访问渠道,覆盖了从开发者到普通用户的不同需求。

REST API

支持通过 HTTP 查询问题、模型和回答数据,并提供每日批量导出以及机器可读的 OpenAPI 描述文件。这意味着研究者可以方便地把整个语料拉回本地做二次分析。

MCP Server

项目同时暴露了一个 Model Context Protocol(MCP)服务器,把问题、模型和回答封装为工具。AI 智能体可以直接调用该服务器,在对话场景中检索档案数据,实现「让一个 AI 去查其它 AI 的历史回答」。

Explorer

网页端提供浏览与筛选入口,用户可按问题、模型或日期过滤结果,并可将若干条回答加入对比托盘,并排阅读差异。

潜在用法与局限

对于关注模型迭代节奏的开发者与分析师,Ask Me Twice 提供了一个低门槛的「时间序列」视角:例如可以追踪某厂商在发布新版本前后,特定问题的回答是否发生明显变化。不过项目本身并未公开题目的来源、分类标准或评分体系,回答也仅做原始记录,不附带质量判断。因此它的价值更多在于「原始证据的累积」,而不是直接给出评测结论。对于要做严肃基准对比的用户,仍需结合自有方法对数据做进一步加工。

信源