RubricForge:用反射式进化生成评分标准,降低智能体评估误判率
arXiv 新文提出 RubricForge,通过反射式进化从标注轨迹中提炼评分标准,使 LLM 评委在无奖励环境下将失…
随着大语言模型驱动的智能体(agent)在真实场景中规模化部署,如何在缺少可执行环境奖励信号时可靠地评估其表现,成为业界日益突出的难题。arXiv 上发表的一篇新论文提出 RubricForge 框架,尝试用「反射式进化」从少量已标注轨迹中自动归纳出可读、可追溯的评分标准,从而让一个冻结的开源 7B 模型兼任智能体执行者与评判者,且整个评估过程无需访问环境奖励。
研究动机:现有 LLM 评委容易「放水」
当前常见的 LLM-as-a-Judge 方案大致分为两类:一类是手工编写评分细则(如 G-Eval),另一类是对评委模型的权重进行微调。论文指出,两类方法都存在一个共性缺陷——容易给那些「过程流畅但实际未完成任务」的轨迹打出高分,即过誉(over-credit)问题。在部署场景中,误判为通过的代价是上线一个失效智能体,而误判为失败至多只是多花一次重试成本,因此降低「假阳性」(false-pass)率比追求总体一致率更具实际意义。
方法:用反射式进化生成人类可读的评审规则
RubricForge 的核心思路是:给定一小批带有真实成功/失败标签的轨迹,将评分标准视为一段可优化的文本,通过「反射式进化」迭代修改其内容,使评委按此标准给出的判定与真实环境奖励尽量一致;进化完成后将规则文本冻结,对未见过的轨迹仅用一次模型调用即可评分,且每一条判定都能追溯到具体命名的评审维度。这一设计使评分标准本身保持人类可读,避免了黑盒微调带来的不可解释性。
实验结果:总体打平,过誉率显著下降
论文在 tau-bench(173 条标注轨迹,来自 220 次 rollout)与 WebShop(160 条)上进行了测试,使用同一个冻结的 7B 模型同时担任智能体与评委,主要结果包括:
- 相比通用 G-Eval 评委,在 tau-bench 上的总体一致率优势在统计上不显著(McNemar p = 0.248),绝对分数校准甚至略逊(|err| 差值 -0.048,p = 2×10⁻⁴)。
- 但在部署真正关心的过誉率上,RubricForge 将 tau-bench 的假阳性率从 0.173 降至 0.115,约砍掉一半;并捕获了 3 次过誉判定,0 次反转。
- 在 WebShop 上,按分级结果排序的忠实度更高,Spearman 相关系数为 0.410,对照为 0.370。
意义与局限
论文强调,对于无奖励环境下的智能体评估,false-pass 率才是部署层面的关键指标,单纯追求与真实奖励的总体一致率可能掩盖严重的过誉风险。RubricForge 提供了一条「文本级、可解释」的优化路径,适合在中小规模标注预算下替代手工或微调评委。不过研究也存在局限:实验仅基于单一 7B 模型,尚未覆盖更大或商用闭源模型;同时反射式进化的计算开销、对标注集规模的敏感性等工程问题,仍有待进一步验证。
