研究论文
RoCo-ACE:面向知识注入的 rollout 条件在线蒸馏方法
arXiv 新论文提出 RoCo-ACE 训练目标,在多模态大模型中注入新知识时兼顾准确性与能力保持。
2026.07.29 · 周三约 2 分钟阅读
arXiv 最新提交的一篇论文提出了名为 RoCo-ACE 的训练目标,用于在预训练多模态大模型(MLLM)中注入新知识,同时尽量减少对模型原有能力的干扰。论文针对的核心矛盾是:直接让模型拟合完整权威答案容易导致非更新行为的漂移;而传统的在线蒸馏方法虽然能缓解漂移,但均匀地以参考答案作为条件进行蒸馏时,对 rollouts 中被参考答案支持的 token 关注不足,对被遗漏的事实也只能提供间接监督。
方法:RoCo + ACE 双重机制
RoCo-ACE 由两个互补组件构成:
- RoCo(Rollout-Conditioned Contrast):基于同一 rollout 上的「无参考答案 / 有参考答案」似然对比,将额外的蒸馏权重重新分配给那些被参考答案支持的 rollout token,从而在模型自己生成的轨迹上做更精细的蒸馏。
- ACE(Anchored Correction):在参考答案侧做稀疏的锚定修正,专门处理被 rollout 遗漏的权威事实锚点,避免对完整答案的整体模仿。
两者结合后,方法不再依赖对完整答案的拟合同步来间接监督遗漏内容,而是直接对遗漏锚点施加稀疏修正,对保留能力更友好。
实验设置
论文在以下条件下评估 RoCo-ACE:
- 三类知识注入场景;
- 六个能力保持(retention)基准;
- 多个基线方法以及多个基座模型。
主要结果
根据论文摘要披露的结论,RoCo-ACE 在参与对比的方法中取得了最高的注入知识准确率,同时在评估的 retention 指标上与基座模型保持接近,意味着新方法在「学会新知识」与「不丢失旧能力」之间取得了较好的平衡。
适用与局限
该工作面向需要持续更新预训练 MLLM 知识库的研究与工程场景,例如让模型适配新领域事实或时效信息。其方法设计避免了全答案模仿带来的行为漂移,但仍依赖具体的 rollout 采样质量与锚点选择策略,论文中尚未给出超大规模模型与生产环境下的部署数据,更多性能与成本细节有待正文与后续版本披露。
