AgentRE-Bench 评测:六款前沿大模型逆向工程能力排名
一个新 AI 安全基准对六款主流大模型进行逆向工程实测,发现小模型 Gemini Flash Lite 凭借低幻觉率居首…
AgentRE-Bench 是一个面向 LLM Agent 的逆向工程评测基准,目标是在没有源码、没有提示词的条件下,考核 AI 智能体对已编译二进制程序的还原能力。该基准采用确定性评分机制,包含 13 个 Linux ELF 任务以及规划中的 10 个 Windows PE 任务,难度从「明文 TCP 反向 Shell」一路覆盖到「仿 WannaCry 勒索蠕虫」级别。最新一次 V2 评测在统一 Docker 沙箱、25 次工具调用预算下,对六款前沿模型进行了端到端测试,并得出一条反直觉的核心结论:推理深度并不是决定胜负的关键,幻觉校准(hallucination calibration)才是。
核心发现:小模型反而领先
本次评测中,体型最小的非推理模型 Gemini Flash Lite 以 0.667 的正确性得分(Main score)登顶全场,并在全部 13 个任务上保持 100% 的有效提交率,平均每任务仅 1.92 次幻觉,是所有模型中最低的。相比之下,以推理深度为卖点的几款大模型(如 Opus 4.7、V4 Pro)在多个任务上虽然推理链更长,但因幻觉增多导致正确性显著落后。评测方认为,这说明在逆向工程这种「必须给出可信结论」的场景中,模型「知道自己不知道」的能力比「能想得更深」更重要。
六款模型的分任务表现
在 13 个 Linux ELF 任务中,各模型表现差异显著,部分代表性数据如下:
- TCP 反向 Shell(Level 1):Kimi K2.6 以 0.88 领先,Gemini Flash Lite 0.80,V4 Flash 0.72。
- XOR 编码字符串(Level 2):Kimi K2.6 0.83,Opus 4.7 0.75,Flash Lite 0.59。
- 反调试 Shell(Level 3):Flash Lite 0.61,V4 Flash 0.58,V4 Pro 0.00(完全失败)。
- 多阶段 Shell(Level 5):Flash Lite 0.70,V4 Flash 0.69,V4 Pro 0.00。
- 进程隐藏(Level 8):Flash Lite 与 Opus 4.7 并列 0.54,Kimi K2.6 0.00。
- JIT Shellcode(Level 12):Flash Lite 0.76,V4 Pro 0.64,GPT-5.5 0.17。
- 变形 Dropper(Level 13,Bonus):V4 Pro 0.27 最高,但全场整体均未超过 0.30。
可以看到,V4 Pro 在反调试、多阶段、ICMP 隐蔽通道等中难度任务上多次出现 0.00 的极端失败,而 Flash Lite 几乎在所有任务上都保持稳定的中等以上成绩。Gemini 3.1 Pro Preview 与 GLM 5.1 因 API 报错被排除出排行榜。
任务阶梯:从教学级到对抗级
AgentRE-Bench 的 Linux ELF 任务按难度分五档:
- Trivial(入门):明文 TCP 反向 Shell。
- Easy:XOR 编码、反调试延时。
- Medium:多态 Shell、ICMP 隐蔽通道、DNS 隧道。
- Hard:进程空洞、共享对象注入、AES 加密、Fork Bomb、JIT Shellcode。
- Bonus:综合 18 种对抗技术的变形 Dropper。
Windows PE 部分已准备好 10 个 PE32+ 任务样本,覆盖 DLL 注入、APC 注入、Code Cave、Hell's Gate 系统调用、反射型 DLL 注入,以及仿 WannaCry 的蠕虫样本(重构代码,非原始 WannaCry)。评测方表示 Windows 任务的结果将「很快公布」。
公开榜单与私有评测
AgentRE-Bench 的公开榜单强调开放性:任务公开、运行可复现、评分确定,可作为 AI 逆向工程领域的可信参考层;同时提供私有评测与训练环境试点,用于检验模型在未公开二进制上的泛化能力,而不是仅仅「生成看起来合理的报告」。该基准已被 arXiv 上的 CrackMeBench 论文和 IEEE Xplore 上的漏洞发现综述论文引用,作为剥离 ELF 逆向工程任务的代表性参考基准。
