桃子桃子快讯
返回首页
研究论文

PRO-LONG:用程序化日志增强 LLM 智能体长程推理

PRO-LONG 通过追加结构化日志并让智能体程序化检索,在 ARC-AGI-3 上取得 97.4% best@2,并大…

2026.08.17 · 周一4 分钟阅读

PRO-LONG 是一种面向长程任务 LLM 智能体的极简记忆增强方案。它把智能体的每一步观察、动作和结果以结构化形式追加到单一 log.txt 中,再让智能体通过 grep、Python 等程序化手段检索并推理该日志。整个系统不依赖子智能体或专用检索模块,系统提示词仅约 30 行。

核心思路与实验结果

研究团队在 ARC-AGI-3 公开游戏集上对 PRO-LONG 进行了系统评测。整体来看,PRO-LONG 在不显著增加复杂度的情况下,相较于不带日志的同一编码智能体,平均提升了 18 个百分点;与多种专用 harness 相比,达到同等或更优效果的同时,计费 token 数为后者的 1/4.2 至 1/5.8。在 ARC-AGI-3 Fable 5 上,PRO-LONG 取得了 97.4% 的 best@2,对应总成本约 1,750 美元。

这种「把上下文搬出 prompt、改由程序读取」的思路,与近期减少 prompt 膨胀、降低 token 成本的方向一致;其优势在于实现门槛低,且不依赖额外的向量库或重排序模型。

实现方式

PRO-LONG 同时支持 OpenAI Codex CLI 与 Claude Code CLI 两类后端:

  • Codex 后端:构建 codex-sandbox 容器与 openai-proxy,配合 CODEX_API_KEY 使用。
  • Claude Code 后端:构建 claude-sandbox 容器与 anthropic-proxy,可使用 CLAUDE_CODE_OAUTH_TOKEN 或 ANTHROPIC_API_KEY。

智能体容器默认仅挂载游戏工作区,且除模型 API 代理外没有其他网络访问,从而在保证可复现性的同时降低评测开销。CLI 入口为 prolong-swarm,例如:

  • prolong-swarm --suite all -m gpt-5.5 --max-actions 500
  • prolong-swarm --suite all --backend claude-code -m claude-opus-4-6

关键参数包括 --backend、--suite、--game、--max-actions、--reasoning-effort 与 --operation-mode(online / offline / normal),便于在完整日志、仅保留最后 25 段、无日志和全日志但工作区重置等多种消融条件下对比。

消融条件与评估产物

论文设计了四类记忆条件用于消融:

  • prolong(默认):完整游戏日志。
  • lw25(--log-window 25):仅可访问日志的最后 25 个动作段。
  • no-log(--log-window -1):无日志文件,仅把当前棋盘加入 prompt。
  • stateless(--workspace stateless):保留完整日志,但每次调用前清空工作区。

仓库中的 scorecards/ 目录提供了论文使用的全部 25 次 Fable 5 在线成绩单(fable_online_scorecards.txt),每一份都可在 arcprize.org 上核验;release_logs/ 则收录了这些在线运行的完整游戏日志、智能体转录与工作区快照,便于复现与进一步分析。

开源情况

代码已开源:github.com/alexisfox7/PRO-LONG,仓库此前以 Read-Grep-Bash(RGB)Agent 之名在 ARC-AGI-3 预览游戏上发布。论文对应 arXiv 编号 2607.20064,题为《PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning》,作者包括 Alexis Fox、Junlin Wang、Paul Rosu 与 Bhuwan Dhingra。对于关注智能体记忆架构、token 经济性与 ARC-AGI-3 评测的开发者与研究者,这一方案提供了一个低复杂度、可直接对照的参考基线。

信源