SAPO:分段级自动提示词优化新方法
arXiv 论文提出 SAPO,将提示词拆分为角色、上下文、任务和输出格式四段进行针对性优化,在五个基准上优于多种主流基…
在面向大语言模型(LLM)的应用开发中,提示词质量直接决定模型表现。传统自动提示词优化(Automatic Prompt Optimization, APO)方法通常将整段提示词视为一个整体进行重写,容易出现"改善某一行为却退化另一行为"的问题。arXiv 上的一篇新论文提出了一种分段级优化方法 SAPO(Segment-level Automatic Prompt Optimization),试图用更细粒度的方式解决这一矛盾。
核心思路:从整体改写到分段优化
SAPO 的核心是将提示词分解为四个语义段落:
- 角色(Role):定义模型身份与立场。
- 上下文(Context):提供背景信息。
- 任务(Tasks):明确需要完成的工作。
- 输出格式(Output Format):规定返回结构。
优化流程采用「top-5 / bottom-5 示例」机制:算法选取表现最好与最差的各 5 条样本进行弱点分析,再由 LLM 结合静态 meta-prompt 与结构化输出,对问题段落提出候选改写。这种方式相当于先"诊断"再"开药",避免一刀切式修改。
两阶段生成流程
论文描述的生成过程分为两个阶段:
- 分段级诊断与建议提取:识别弱段并产出改进建议。
- 候选合成:在弱段信号与强段信号的约束下生成新提示词。
整个优化循环仅使用一个 LLM,配合静态 meta-prompt 完成分段、弱点分析与候选生成,结构较为清晰,便于复现。
评测设置与结果
研究者在以下五个基准上对 SAPO 进行了评估:
- SQuADv2(阅读理解)
- TweetEval(情感/分类)
- XSUM(摘要生成)
- CommonGen(常识生成)
- GSM8K(数学推理)
所用模型为 GPT-3.5-Turbo 与 GPT-4o-mini。对比的基线方法包括 Zero-shot 以及多个具有代表性的 APO 方案:APE、OPRO、EvoPrompt、GEPA、StraGO。论文报告称,SAPO 在上述基准上的平均得分优于全部对比基线。
意义与局限
分段级优化的思路呼应了近年来提示词工程中"模块化"的趋势,即把系统提示拆成可独立维护的组件。从论文摘要可以看出,SAPO 的实验覆盖了阅读理解、分类、摘要、生成和推理等典型任务类型,具备一定说服力。不过,由于目前可获取的信息仅为摘要,缺乏具体数值、训练/验证协议细节以及消融实验,正式影响力仍需以完整论文与代码为准。对于关注自动提示工程的研究者和应用开发者来说,这是一项值得跟踪的方向。
