桃子桃子快讯
返回首页
工具

一款面向大模型的评估 API 上线:三类题型批量打分,支持 Claude Code 与 Codex

一款面向开发者的 AI 评估 API 进入早期访问阶段,支持三类题型批量评测,并提供 Python/JS SDK 及 C…

2026.09.16 · 周三2 分钟阅读

TestingCatalog 在 X 平台披露了一款面向大模型应用的评估 API 工具,目前已进入早期访问阶段,开发者可通过候补名单申请试用。该工具的核心设计是将评测问题抽象为三类结构化题型,便于在单次 API 调用中批量提交并稳定响应时间。

三类题型与批量调用

该 API 把所有评测问题归为三种形式,开发者可以混合搭配提交:

  • 选择题:从给定选项列表中选出一个最合适的答案;
  • 等级评分:让模型按有序等级对给定上下文进行打分;
  • 概率题:返回一个语句为真的概率值。

每次调用可一次性放入数十道题,每道题独立评估。官方表示这种批量方式有助于稳定响应时间,避免单次调用带来的延迟波动,适合需要在 CI/ 流水线中持续跑评测的团队。

配套 SDK 与编辑器集成

为了让开发者快速接入,工具同步上线了以下配套资源:

  • Python 与 JavaScript 官方 SDK;
  • 浏览器端 Playground,方便手动调试题型与提示词;
  • 为 Claude Code 与 Codex 提供的 agent skill,可直接在主流 AI 编程代理中调用评估能力。

尚不明确的信息

原文仅给出产品功能描述,未披露开发方公司名称、定价、速率限制、底层调用的大模型来源等关键细节。开发者目前只能通过候补名单申请早期访问权限,尚不清楚何时面向公众开放。TestingCatalog 作为聚合类技术媒体,此前多次首发过 AI 工具的小规模更新,但本次尚无一手官方博客或文档链接佐证,建议关注其后续公布的官方来源再做进一步判断。

信源