桃子桃子快讯
返回首页
行业动态

AI 智能体提示注入攻击实战:以云服务比价为例

作者以挑选最便宜云服务商的办公任务为场景,实操演示如何通过 Excel 文件向 AI 智能体注入隐藏指令,揭示非编程场景…

2026.08.28 · 周五3 分钟阅读

一名开发者近日在 Hacker News 上发表了一篇关于「针对办公场景 AI 智能体的提示注入攻击」实操文章。作者跳出常见的编程编码场景,选取一个普通人也会遇到的办公室任务——在多份 Excel 比价表中挑选最便宜的云服务商——以此演示提示注入在实际办公流程中的可行性与危害程度。

什么是提示注入

文章首先给出概念定义:当攻击者将恶意指令偷偷塞进 AI 模型处理的文本或数据(如网页、文档、邮件)中,模型会误把这类隐藏指令当成用户真实意图执行,从而偏离原本任务。这一概念最早由 Simon Willison 于 2022 年 9 月在其博客上提出,被认为是 LLM 时代「SQL 注入」式的新型安全威胁,至今仍难以根除。

演示场景:挑选最便宜的云服务商

作者构造了一个贴近现实的办公任务:比对 Krendola Cloud、Nimbrastack、Thessvane Systems 三家虚构云服务商提供的报价,三者分别给出 Web 托管、Blob 存储、计算资源的价格。三份报价以 Excel 文件形式呈现,结构相似但措辞略有不同,人工比对较为繁琐,因此适合交给 AI 智能体自动化处理。

实际运行中,作者使用 Claude 桌面端的 Cowork 模式,采用较小模型(Sonnet 5)配合低推理档位执行任务,并通过 openpyxl 读取 Excel。提示词设计遵循了几条常见最佳实践:指令简洁直接、要求以严格 JSON 格式输出结果。Claude 成功识别出 Thessvane Systems 为最优报价。

攻击思路:将恶意指令藏进 Excel

在顺利完成基线任务后,作者转向攻击方视角。由于智能体读取的所有数据(Excel 文件)均来自不可信来源,而报价方天然有动机让自己中标,这就构成了典型的提示注入攻击面。作者选择让原本最贵的 Krendola Cloud「反败为胜」,通过在 Excel 文件中嵌入肉眼不易察觉的隐藏指令,试图诱导智能体改变判断、推荐该供应商为最优选项。

文章同时列出配套 GitHub 仓库,其中除 Excel 文件与提示词外,还包含基于 Promptfoo 框架的简易评测套件,可使用 Anthropic Agent SDK(Sonnet 5、Opus 5)以及 OpenAI Codex SDK(GPT 5.6 Terra、Sol)进行多模型对比测试。

局限与未完部分

需要指出的是,原文在「攻击具体如何实现、隐藏指令写了什么内容、模型是否被成功骗过」等关键演示环节被截断(以「But…」结尾),因此读者无法看到完整的攻击构造与最终结果。文章的价值更多在于提示一个被忽视的事实:提示注入并非只针对开发者,办公场景下的普通智能体同样面临风险,自动化比价、合同审阅、邮件分类等任务都值得提高警惕。

信源