Ora 在 Vercel 上对主流 AI 智能体做横向基准测试
Ora 平台对 Claude Code、ChatGPT、Gemini 等主流智能体在真实网站上进行端到端基准测试,并选择…
Ora 是一家聚焦 AI 智能体端到端评估的初创公司,核心产品部署在 Vercel 平台上。联合创始人 Assaf Elovic 此前创办的 Tavivy 曾构建面向智能体的搜索引擎,并于今年早些时候被 Nebius 收购。在他看来,搜索只解决了「找到产品」的一半问题,智能体仍需真正使用这些产品。Ora 的目标就是度量 Web 对智能体的就绪程度,并修补不达标的部分。
横向对比六大智能体框架
Ora 将智能体拆解为两部分:负责推理的模型,以及为模型提供工具并驱动其逐步执行的 harness(框架)。当前覆盖的框架包括 Claude Code、ChatGPT、Gemini、Hermes、OpenClaw,以及 Vercel 自研的 eve。
由于每个 harness 对基础设施的要求不同、执行步骤的暴露方式各异,Ora 为每个框架单独运行一套运行时环境,并追踪每一步。当智能体在注册流程中卡住时,客户可以直观看到是哪一步、尝试了什么操作。Ora 工程负责人 Ido Finder 认为,这种并排覆盖是平台为客户带来的最有价值的能力之一。
基准测试结果与 eve 入选
Vercel 发布 eve 后,Ora 并未给予特殊待遇,而是将其与其他框架纳入完全相同的基准测试。测试将 eve 与 Claude Code 在数百个真实任务上对比,两者均使用相同的 Claude Fable 5 和 Haiku 4.5 模型,任务内容是接入一家产品。
Ora 公布的对比数据包括:
- 完成目标的步骤数减少 7%
- 站内原生成功率提升 2 倍,更多任务在客户站点内完成,而非回退到网页搜索
- 有效端点增加 9%,智能体发现的端点中可调用的比例更高
测试结果同时反哺了 eve 的迭代。在某轮运行中暴露出提示缓存(prompt caching)问题,eve 团队随即发布修复,Ora 下一轮测试显示总成本下降约 15%。
为何最终在 eve 上构建
对一家以基准测试各大 harness 为生的公司而言,这一选型有充分依据。Finder 表示,eve 遵循 Next.js 范式,几乎无需配置,工具、技能和连接器只需少量代码即可接入。
决定性因素是沙箱覆盖(sandbox override)能力。智能体框架自带的沙箱默认在 Ora 的可观测环境之外运行,而 eve 的覆盖机制允许替换执行环境,使 eve 智能体像其他 harness 一样被完整记录,无需额外搭建追踪链路。目前 journey.ora.ai 同时在两端使用 eve——它既是被测试的框架之一,也是 Ora 自身构建所依赖的框架。
小团队的高频交付
Ora 工程团队仅 16 人,却保持每天数百次提交的节奏,基础设施的日常运维已交由编码智能体完成。一体化的部署栈使这些智能体可以端到端运行。Finder 估算,这一架构每周至少节省数小时时间。
按 Ora 自有口径,目前仍有 99% 的网站无法支撑智能体完成注册、接入与付费等任务。公司计划把平台拆分为更多微服务,全部继续部署在 Vercel 上,新服务可直接接入同一基础设施并互相通信,而无需额外配置。
