桃子桃子快讯
返回首页
研究论文

研究提出黑盒条件下 LLM 提示词近似还原方法

arXiv 论文提出在无法访问模型权重或 logits 的黑盒场景下,通过训练逆向语言模型实现对 LLM 提示词的近精确…

2026.08.12 · 周三2 分钟阅读

一篇题为「Previous-Token Prediction Based LLM Near-Exact Prompt Reconstruction」的 arXiv 预印本论文,针对大语言模型(LLM)的提示词还原(即 LLM inversion)问题提出了新的解决思路。该工作由 Pirzada Suhail 提交,论文编号为 arXiv:2607.29378,分类归属计算语言学(cs.CL)与机器学习(cs.LG)。

研究背景

LLM 在自回归生成下一个 token 时,会形成「同一提示对应多种输出、同一输出对应多种可能提示」的多对多映射,这使得从观察到的回答反推原始提示词十分困难。已有研究大多把提示词恢复视为语义重构任务,依赖在大规模外部数据集上微调的序列到序列模型,并要求访问目标模型的权重或 logits,实用性受限。

方法思路

本文提出一种功能性的逆向路径,整体工作在纯黑盒条件下进行,不依赖任何辅助模型或内部信息。核心做法是:

  • 完全从零训练一个显式的逆向语言模型;
  • 训练数据由目标 LLM 自身合成生成;
  • 采用「前一个 token 预测(previous-token prediction)」作为训练目标,与正向的「下一个 token 预测」形成对称结构;
  • 通过采样天然支持多样化的提示词重构结果,且所有候选提示在正向目标 LLM 下都能诱导出相近的回答。

实验与结果

论文在多个数据集上验证方法的泛化能力,并展示了跨模型迁移特性——即用某 LLM 合成的数据训练的逆向模型,可以重构由其他不同 LLM 产生的回答所对应的提示词。在基于 token 的提示词与回答重构评价指标上,该方法优于既有工作。不过,摘录中未给出具体的基准分数、参数量或对比表格等定量细节。

意义与局限

这一工作把 LLM inversion 从「需要白盒访问 + 外部数据微调」推向「黑盒 + 自合成数据自训练」的范式,对评估商用 LLM 服务的提示词泄露风险具有参考价值。但目前可获取信息仅为摘要,缺乏完整实验设置、可复现性细节与失败案例分析,其实际效果与适用边界仍有待论文正文与后续复现工作进一步检验。

信源