桃子桃子快讯
返回首页
研究论文

SAPO:分段级自动提示词优化新方法

arXiv 论文提出 SAPO,将提示词拆分为角色、上下文、任务和输出格式四段进行针对性优化,在五个基准上优于多种主流基…

2026.08.13 · 周四3 分钟阅读

在面向大语言模型(LLM)的应用开发中,提示词质量直接决定模型表现。传统自动提示词优化(Automatic Prompt Optimization, APO)方法通常将整段提示词视为一个整体进行重写,容易出现"改善某一行为却退化另一行为"的问题。arXiv 上的一篇新论文提出了一种分段级优化方法 SAPO(Segment-level Automatic Prompt Optimization),试图用更细粒度的方式解决这一矛盾。

核心思路:从整体改写到分段优化

SAPO 的核心是将提示词分解为四个语义段落:

  • 角色(Role):定义模型身份与立场。
  • 上下文(Context):提供背景信息。
  • 任务(Tasks):明确需要完成的工作。
  • 输出格式(Output Format):规定返回结构。

优化流程采用「top-5 / bottom-5 示例」机制:算法选取表现最好与最差的各 5 条样本进行弱点分析,再由 LLM 结合静态 meta-prompt 与结构化输出,对问题段落提出候选改写。这种方式相当于先"诊断"再"开药",避免一刀切式修改。

两阶段生成流程

论文描述的生成过程分为两个阶段:

  1. 分段级诊断与建议提取:识别弱段并产出改进建议。
  2. 候选合成:在弱段信号与强段信号的约束下生成新提示词。

整个优化循环仅使用一个 LLM,配合静态 meta-prompt 完成分段、弱点分析与候选生成,结构较为清晰,便于复现。

评测设置与结果

研究者在以下五个基准上对 SAPO 进行了评估:

  • SQuADv2(阅读理解)
  • TweetEval(情感/分类)
  • XSUM(摘要生成)
  • CommonGen(常识生成)
  • GSM8K(数学推理)

所用模型为 GPT-3.5-Turbo 与 GPT-4o-mini。对比的基线方法包括 Zero-shot 以及多个具有代表性的 APO 方案:APE、OPRO、EvoPrompt、GEPA、StraGO。论文报告称,SAPO 在上述基准上的平均得分优于全部对比基线。

意义与局限

分段级优化的思路呼应了近年来提示词工程中"模块化"的趋势,即把系统提示拆成可独立维护的组件。从论文摘要可以看出,SAPO 的实验覆盖了阅读理解、分类、摘要、生成和推理等典型任务类型,具备一定说服力。不过,由于目前可获取的信息仅为摘要,缺乏具体数值、训练/验证协议细节以及消融实验,正式影响力仍需以完整论文与代码为准。对于关注自动提示工程的研究者和应用开发者来说,这是一项值得跟踪的方向。

信源