工具
一款面向大模型的评估 API 上线:三类题型批量打分,支持 Claude Code 与 Codex
一款面向开发者的 AI 评估 API 进入早期访问阶段,支持三类题型批量评测,并提供 Python/JS SDK 及 C…
2026.09.16 · 周三约 2 分钟阅读
TestingCatalog 在 X 平台披露了一款面向大模型应用的评估 API 工具,目前已进入早期访问阶段,开发者可通过候补名单申请试用。该工具的核心设计是将评测问题抽象为三类结构化题型,便于在单次 API 调用中批量提交并稳定响应时间。
三类题型与批量调用
该 API 把所有评测问题归为三种形式,开发者可以混合搭配提交:
- 选择题:从给定选项列表中选出一个最合适的答案;
- 等级评分:让模型按有序等级对给定上下文进行打分;
- 概率题:返回一个语句为真的概率值。
每次调用可一次性放入数十道题,每道题独立评估。官方表示这种批量方式有助于稳定响应时间,避免单次调用带来的延迟波动,适合需要在 CI/ 流水线中持续跑评测的团队。
配套 SDK 与编辑器集成
为了让开发者快速接入,工具同步上线了以下配套资源:
- Python 与 JavaScript 官方 SDK;
- 浏览器端 Playground,方便手动调试题型与提示词;
- 为 Claude Code 与 Codex 提供的 agent skill,可直接在主流 AI 编程代理中调用评估能力。
尚不明确的信息
原文仅给出产品功能描述,未披露开发方公司名称、定价、速率限制、底层调用的大模型来源等关键细节。开发者目前只能通过候补名单申请早期访问权限,尚不清楚何时面向公众开放。TestingCatalog 作为聚合类技术媒体,此前多次首发过 AI 工具的小规模更新,但本次尚无一手官方博客或文档链接佐证,建议关注其后续公布的官方来源再做进一步判断。
