桃子桃子快讯
←返回首页
模型发布

对比语言模型 CLM-8B 发布:智能体决策延迟降 9 倍

新型对比语言模型 CLM-8B 基于 Qwen3-8B,用对比学习连接状态与动作,在多个智能体基准上达 SOTA 且延迟…

2026.09.26 · 周六约 3 分钟阅读

Contrastive Language Models(CLM)是一类新提出的「系统一」(System One) 模型,借助对比学习目标连接状态与动作,旨在为智能体提供低延迟、可泛化的决策能力。研究团队发布了 CLM-8B,在电脑操作、游戏和工具调用任务上与基线 Jev 表现相当,但推理延迟降低最多 9 倍。

核心方法

CLM 把「状态编码器」和「动作编码器」分离训练,使用 InfoNCE 对比损失将每个状态拉向对应的 ground-truth 动作,同时推远所有其他候选。两路 embedding 可独立缓存与复用,因此训练和服务都更便宜、更快。

CLM-8B 基于 Qwen3-8B 作为基础编码器,训练分为三阶段:

  • 在 6000 万条 Nemotron Q&A 数据上进行预训练
  • 用 3000 万条合成 hard negative 做中间训练
  • 在 100 万条智能体轨迹数据上做后训练

性能与基准

零样本决策方面:在电脑操作、游戏和工具调用任务上与 Jev 持平,但延迟降低最多 9 倍。当候选动作数较大(如 WikiRacing)或同一动作在多状态间复用(如 T-Rex 游戏)时,加速效果最明显。

作为验证器使用时(先由 Opus 5 采样 DeepSWE 候选、Fable 5 采样 Terminal-Bench 2.1 候选,再由 CLM 或 Jev 选出最优):

  • Terminal-Bench 2.1(30 道题):87.6%,刷新 SOTA
  • DeepSWE(38 道题):81.6%,刷新 SOTA
  • 速度比 Jev 快 4.1–5.7 倍

Jev 在这类长时任务中无法直接充当验证器,得分低于 pass@1。

使用与部署

  • 安装:pip install contrastive-lm
  • 启动流程:先用 vllm 启动 Qwen3-8B embedding 服务(端口 8090),再运行 clm-serve 启动 API(端口 8700,首次运行会自动下载 75 MB 参考头)
  • 状态超过 2048 token 会被截断,需同时上调 vllm 与 clm-serve 的 --max-model-len 与 --max-tokens
  • 提供三种结构化问答类型:Noul(布尔概率)、Choice(分类选择)、Score(数值评分)
  • 提供 in-process 引擎 Engine.rank 对自由文本候选直接排序
  • 附带 Web Playground,可分享链接

开源与微调

数据与模型已发布在 Hugging Face 上的 Contrastive-LM 组织。仓库同时提供 DeepSWE 与 typed-decisions 任务的微调脚本,可复现 81.6% 的 held-out 结果,并支持把 CLM 头作为轻量验证器接入自有智能体框架与基准。开发者邀请社区在更多任务上测试该方法。

信源