研究论文
Chollet:以外部市场做奖励信号,智能体评估的新思路
ARC 基准作者 François Chollet 在 X 上谈一种用真实经济交互替代静态基准或内部奖励模型来评估智能体…
2026.07.27 · 周一约 2 分钟阅读
ARC 基准作者、Google 研究员 François Chollet 近日在 X 上分享了他观察到的一种智能体(agent)评估思路:用真实的经济交互作为奖励信号,而不是依赖静态基准或内部生成的奖励模型。他评价这一概念「非常有趣」,但同时指出该方向并未公开的具体实现细节仍待披露。
核心思路:用外部市场替代静态奖励
Chollet 提到,传统智能体训练通常围绕两类奖励来源组织:其一是静态基准(benchmarks),其二是由系统自身生成的奖励模型(reward models)。他观察到的新做法则把「外部市场」引入奖励信号,让智能体的表现由真实经济交互中的反馈来评定。
在他看来,这一设计从根上改变了优化的目标函数:智能体不再只针对已有的固定任务或内部偏好进行调优,而是在持续变化的外部反馈中接受评估。
对奖励黑客问题的态度
Chollet 也提醒,新的奖励来源并不等于消除奖励黑客(reward hacking)。他强调,把学习过程「锚定」在系统之外生成的反馈上,虽然不能根除被钻空子的风险,但相比纯内部的奖励回路,至少增加了一层外部校验。
仍待验证的开放性问题
对于「这种基于真实经济交互的评估能否长期训练出更强的智能体」,Chollet 称之为「一个值得验证的假说(interesting hypothesis)」,并未给出定论。由于他本人这次只看到概念层面的描述,原文未关联到具体的论文、系统名称或可复现的实验结果,这一方向目前仍停留在思路讨论阶段。
