桃子桃子快讯
返回首页
产品功能

Amazon Bedrock 上线高级提示词优化功能,可一次对比五个模型

AWS 为 Amazon Bedrock 推出 Advanced Prompt Optimization,支持同时为最多…

2026.07.30 · 周四4 分钟阅读

Amazon Bedrock 近日推出 Advanced Prompt Optimization 功能,旨在解决生成式 AI 应用中「模型迁移与提示词调优」这一长期高耗时环节。该功能允许用户在一个任务中同时为最多 5 个候选模型优化提示词,并自动对比原始版本与优化版本的质量、首 token 延迟(TTFT)和推理成本,帮助开发者在数天内完成原本需要数周的手动迭代工作。

背景:提示词调优仍是开发链路的瓶颈

在生成式 AI 应用的软件开发生命周期中,提示词迁移与优化是一个关键卡点。当新模型上线或需要在现有模型上提升性能时,团队往往要经历「改写提示词 — 跑测试用例 — 对比结果 — 再次调优」的循环;当这一过程需要覆盖生产环境中的每一条提示词模板与每一个候选模型时,工作量会随业务规模线性放大。

AWS 指出,这一瓶颈会反映在四个方面:

  • 模型锁定:团队因重调成本过高而不敢迁移,即使新模型在延迟和成本上更优。
  • 性能未达上限:面向某一模型写的提示词,往往未能发挥另一模型的全部能力。
  • 回归盲区:缺乏基于真值的系统化评估,团队无法区分「不同」与「更差」,可能无意中上线质量下降的输出。
  • 迭代缓慢:每次提示词改动都依赖人工 A/B 测试,工程师被锁在评估循环中。

工作机制:以评估指标为驱动的反馈循环

Advanced Prompt Optimization 采用「指标驱动」的反向反馈循环,逻辑类似强化学习,但不动模型权重。用户需要提供:提示词模板、示例用户输入(文本或多模态)、可选的真值答案,以及一项评估指标。系统会将模板和输入并行发送到所选的推理模型,根据评估指标对响应打分,然后重写提示词,再次评估,循环往复直至收敛。

每个候选模型在任务结束时都会同时产出「原始提示词」与「优化后提示词」,并附带评估得分、TTFT 与按需计费的推理成本估算,便于直接横向比较。该能力与具体模型解耦,兼容 Bedrock 上现有的多种基础模型。

三类评估方式

每个提示词模板只能选择一种评估方法,但支持组合成加权综合指标(输出必须为单一数值):

  • AWS Lambda 函数:适用于准确率、F1、ROUGE、JSON 匹配等可量化指标,需要用户编写 compute_score 逻辑。
  • LLM-as-a-Judge:适用于摘要、推理、生成等开放式任务,用户提供评分 rubric 提示词并指定 judge 模型。
  • Steering criteria:用于品牌语气、格式、安全约束等,最多 5 条自然语言描述的准则。

如果用户不填写任何评估字段,系统会回退到一个内置默认评分,综合考虑准确性、答案完整度与文风。AWS 建议用户自定义评估指标以获得最佳效果。

多模态输入与典型用法

Advanced Prompt Optimization 支持文本以外的多模态示例输入(原文此处内容被截断)。功能提供两种典型用法:

  • 模型迁移:以当前模型为基线,再追加最多 4 个候选模型,一次性获得各自的优化提示词与对比结果。
  • 同模型优化:仅选择当前模型,不更换底层模型也能拿到更好的提示词。

TTFT 衡量的是从请求发出到收到首个 token 的时间,反映用户感知到的「响应是否开始」,需与输出 token 数结合才能得到完整的延迟画像。AWS 同时提示,单次运行的 TTFT 受实时基础设施影响,应作为方向性信号阅读。综合来看,Advanced Prompt Optimization 把质量、延迟、成本三项指标统一呈现,降低了 Bedrock 上模型选型与提示词调优的工程门槛。

信源