Netlify 扩展 Agent Runners 支持多款前沿模型
Netlify 与 OpenRouter 合作,Agent Runners 新增 Kimi K3、GLM 5.2、Dee…
Netlify 近日宣布与 OpenRouter 建立合作,在其平台上推出两项新功能:一是用户可通过 Netlify 的 AI Gateway 调用 OpenRouter 上的任意模型;二是扩展 Agent Runners 可用的前沿编程模型,新增 Kimi K3、GLM 5.2、DeepSeek V4 等近期广受关注的开源模型,面向所有用户开放。
两大新功能上线
Agent Runners 是 Netlify 内置的聊天式编程入口,用户可以用它从零搭建项目,或在已有项目上迭代。在此之前,平台已支持 Claude Agent、OpenAI Codex 和 Gemini CLI 三种针对各自厂商模型优化的代理。Netlify 表示,他们运行的是完整的编程代理,而非精简版本,并会为代理提供项目上下文与 Netlify 平台能力说明,让代理知道何时、如何调用 Netlify Database、AI Gateway、Identity 等服务。
为驱动更多样的模型,本次新增了开源代理 OpenCode 作为可选的底层代理框架。AI Gateway 则允许用户在自有的 Web 应用中按需选择不同模型,兼顾任务类型与预算。
测试框架与方法
Netlify 内部使用名为 AXIS 的模型自动评估工具,该工具已在近期开源。AXIS 会接收一组测试用例,覆盖从零搭建站点到逐步迭代等场景,并按预设检查项对生成站点打分。检查重点是功能正确性而非设计美观,例如:用户需求中是否需要数据库,模型是否正确调用了 Netlify Database;对于只需静态站的场景,模型是否避免过度工程化、未设置多余的数据库。
若某模型测试分数持续偏低,Netlify 不会将其纳入 Agent Runners;若模型在某项 Netlify 技能上频繁出错,或功能正常但积分消耗明显偏高,则问题通常出在技能本身,团队会对此进行优化。
三个测试场景
为直观呈现不同模型在同一提示下的表现差异,Netlify 设计了三个相对简单的用例:
- 咖啡店静态站:单页站点,展示营业时间、地址、简短菜单和一张照片,无需 CMS;后续追加一个简单的座位预订功能,考察模型如何处理。
- 多人待办事项 Web 应用:需要从一开始就接入共享数据库,支持多人查看与新增任务;后续追加每条任务可选图片上传,检验模型是否使用了正确的 Netlify 原语。
- 「我能做什么菜」Web 应用:用户输入家中食材,由 AI 生成菜谱,验证生成的站点是否正确调用了 AI Gateway 来生成菜谱。
每个场景都会展示生成站点的实际效果、标注明显问题,并对比各模型消耗的积分数量。Netlify 强调这是一种偏主观的测试,但希望能为用户在「众多模型都说自己很厉害」的情况下提供直观参考。
第一个场景:咖啡店站点
测试使用的初始提示为:「为一家社区咖啡店搭建单页站点:包含营业时间、地址、简短菜单和一张照片。除非我手动编辑,站点内容不会变化。」最后一句用于暗示无需引入 CMS。Netlify 的默认技能中还包含一些 UI 设计引导,例如避免出现「千篇一律的紫色 AI 风格」,但除此之外,每个模型可以自由发挥。
所有模型均以 Netlify 上的默认设置运行。需要特别说明的是,目前 GPT 5.6 Sol 以「低算力」档位作为默认,提供比 Opus 更经济但质量仍然不错的替代选择;该档位已开放给用户自行调整,Netlify 的默认值也可能随时间变化。
在公布站点效果之前,Netlify 给出了一张各模型积分消耗对比表:每个模型运行三次,Claude Opus 5 平均每次运行约 519 积分,三次分别为 253、249 和 1055 积分。文章表示后续内容将继续覆盖另外两个测试场景,并对各模型的输出做更详细对比。
