同一模型不同输出:5 款 AI 编码代理横评
YouTuber 用同一 prompt 在 5 款 AI 编码代理上驱动同一 DeepSeek V4 模型,结果差异巨大…
当大模型本身日益趋同,开发者越来越关注围绕模型构建的「harness」(代理框架、工具与运行时环境)究竟在多大程度上影响最终输出。YouTuber Luigi Tech 在一段测评中,用同一句提示词分别喂给 5 款 AI 编码代理,它们底层运行的全部是 DeepSeek V4 模型,结果却大相径庭——再次印证了那句被反复引用的话:「如果模型是大脑,harness 才是眼睛和手。」
测试设置:一只简单的果冻团
测评围绕一个刻意保持简短、非技术化的 prompt 展开:
- 「一只浏览器里的小玩具。一个果冻团。你可以戳它、抓它、拉伸它。没有计分,没有关卡,只是一个手感不错的果冻团。」
没有指定框架,没有规定架构,每个代理在一个沙箱环境里以「YOLO 模式」自由运行,可以自行安装依赖。
- 参测的 5 款 harness:
- Codex(OpenAI 出品,Rust 编写)
- PI agent(极简 TypeScript 代理)
- Jcode
- OpenCode
- Reasonix(主打 DeepSeek 系列)
五个代理,五种结果
Codex:过度工程化但效果惊艳
Codex 输出了一套远超 prompt 要求的复杂结构,无法直接打开文件查看,必须在开发模式下运行。最终效果是一只会在拖动时跟随鼠标的弹性团块,并带有拉伸时的半透明效果,部分位置略有反转,但仍是 5 者中最具野心的实现。
PI Agent:简洁却脆弱
PI Agent 的结构简单很多,但视觉效果不错。代价是交互逻辑被反转,而且抓取操作在一次动作之后就会失效,必须刷新页面才能继续——「手感不错的果冻团」这一核心体验因此被打断。
Jcode:边调试边留痕
Jcode 在项目目录里留下了明显的调试截图,能看出它进行了无头浏览器测试:原本偏好 Firefox,但沙箱内无法配置,最后退回 Chromium。最终成品是带有重力的果冻团,并出乎意料地支持移动端多点触控,尽管 prompt 完全没有提到这些。
OpenCode:单文件但不交互
OpenCode 把 HTML 和 JavaScript 全部塞进一个文件,初看效果不错,但点上去才发现——它其实根本不能交互,是一只漂亮但静态的果冻。
核心发现:反馈循环比模型更关键
测评的核心结论并不指向 DeepSeek V4 本身,而是 harness 决定输出。差异主要来自反馈回路的可用性和质量:
- 能跑无头 Chromium 并在运行时审视自身输出的代理,普遍表现更好。
- 一些代理(如 Reasonix)在初期会主动列出待办,但当上下文膨胀到一定程度后就开始踉跄。
- Codex 则会主动分析自己测试浏览器中的截图,并据此迭代。
换言之,是否具备「看自己作品」和「基于观察继续改」的能力,比模型本身的代码生成能力更直接地决定最终成品。
对开发者的启示
- 换模型不如换 harness:模型没变、prompt 没变,结果却天差地别,说明工具链本身就是一个值得单独调节的旋钮。
- 运行时反馈是分水岭:能截图、能自测、能在观察后迭代的代理,往往显著优于「写完即交付」的代理。
- 简单 prompt 不等于简单输出:同一个玩具 prompt,有人交付一个多文件应用,有人交付一个单文件 HTML,中间还散布着各种中间形态。
这一测评再次提示:评估一款 AI 编码工具,模型只是其中一环,工具如何「看、如何做、如何迭代」,往往才是真正拉开差距的地方。
