桃子桃子快讯
返回首页
工具

CLM 亮相:对标 Jev 的开源智能体决策头

开发者推出基于 Qwen3-8B 的开源投影头 CLM,提供 Choice、Noul、Score 三类决策原语,在终端-…

2026.09.24 · 周四3 分钟阅读

一款名为 CLM(Contrastive Language Models)的开源投影头近日在 r/LocalLLaMA 上发布,作者将其定位为 TypeSafe AI 闭源产品 Jev 的开放权重替代方案。CLM 基于 Qwen3-8B 构建,专门面向智能体在多轮交互中的「System One」决策接口,强调本地化部署与可微调性。

功能层面的对等覆盖

CLM 在 API 层面复刻了 Jev 的三套核心原语:

  • Choice:对一组离散候选进行评估,返回类别概率分布。
  • Noul:对命题或护栏条件输出校准后的真/假概率。
  • Score:按有序量表对输入打分。

作者表示,原本使用 Jev 客户端的代码可直接指向 clm-serve 端点,迁移成本接近零。

性能与可定制性优势

CLM 在多个维度上超越 Jev:

  • 速度与缓存分离:CLM 将 state head 与 action head 解耦,工具或动作嵌入可一次性计算并缓存。在交互式浏览器智能体与游戏(T-Rex、Super Mario)等基准上,CLM 比 Jev 快 4× 到 13×。
  • 开源权重与可微调:Jev 为闭源 API,仅支持提示词调整;CLM 的两个 head 仅约 75 MB,用户可在自有智能体轨迹数据上微调。
  • 编码基准验证器:微调后的 CLM 在 Terminal-Bench 2.1 上达到 87.6%,在 DeepSWE 上达到 81.6%,零样本下的 Jev 在 DeepSWE 上仅约 71%。

仍存在的差距

CLM-v0.1-8B 在部分场景落后于 Jev:

  • 零样本广域知识:Jev 依托更大的闭源模型,在边缘案例准确率上仍有优势。例如 Berkeley Function Calling Leaderboard v4 上,Jev 为 99.2%,CLM-8B 为 95.2%;WikiRacing 中 Jev 为 30/30,CLM-8B 为 26/30。
  • 上下文预算:Jev 原生支持 64K token 上下文;CLM-8B 校准区间为 2K 到 8K,更长上下文下的表示尚未校准。
  • 概率归一化:CLM 的概率来自点积与 softmax,天然相对候选集;Jev 的评分则针对绝对标准进行内部校准。

小结

如果只关心 API 原语是否完整,CLM 提供了与 Jev 等价的功能面,并带来显著延迟收益和零 API 成本;其代价是在小部分零样本、长上下文场景上的泛化能力弱于 Jev 的托管服务。相关权重与代码已开源在 GitHub 与 Hugging Face 上,供开发者自行评估。

信源