开源
阶跃星辰开源内部 LLM 数据标注工具 onPanda
阶跃星辰开源内部 LLM 数据标注与模型检查工具 onPanda,支持 token 级监督与多模态 agent 轨迹标注…
2026.09.23 · 周三约 2 分钟阅读
阶跃星辰(StepFun)近日在 X 平台宣布,正式开源其内部用于大模型数据标注与模型检查的工具 onPanda🐼。该工具此前用于团队内部的 LLM 微调与调试流程,本次以开源形式向社区开放,并附带论文说明。
数据标注能力
onPanda 的核心使用流程是「找到错误 → 修正 token → 让模型继续生成」,强调在模型自身生成轨迹上直接进行修正,而非事后离线编辑。官方披露的关键数据包括:
- 中位标注耗时较人工后编辑降低 52%;
- SFT(监督微调)与偏好数据可在同一工作流中完成;
- on-policy 保真度高,与模型重采样基线相比困惑度差异 ΔPPL 小于 1%;
- 支持 token 级精监督,配套成对的正负样本;
- 可标注覆盖图像、音频、视频的 agent 轨迹数据。
模型检查与调试
除标注功能外,onPanda 还提供面向模型行为的检查与调试界面,开发者可在浏览器中完成以下操作:
- 查看每个 token 的输出概率与 top-k 候选;
- 按 token 逐步引导解码方向;
- 直接在页面上探索 SVG 生成、Web 开发以及 agent 任务等场景下的模型行为。
工具页面支持移动端访问,并已附论文链接供开发者参考实现细节。
对社区的意义
对于从事大模型对齐、RLHF 与多模态 agent 训练的团队而言,onPanda 提供了一套将「标注—检查—调优」串联在同一界面内的轻量级方案。token 级配对样本与多模态 agent 轨迹标注能力,恰好对应当前主流 LLM 后训练流程中最耗人时的环节。开源后,社区可基于该工具改造或集成到自有训练流水线中,但其在生产级大规模场景下的稳定性与扩展性,仍有待实际使用验证。
