ESQ-Bench:企业级 NL2SQL 新基准,揭示大模型在复杂 Schema 下严重退化
研究团队发布 ESQ-Bench,以 Oracle 等四种企业数据库和三档复杂度评估大模型的 NL2SQL 能力,发现执…
面向企业生产环境的自然语言转 SQL(NL2SQL)能力,正在成为衡量大模型实用价值的重要指标。arXiv 上一篇题为《ESQ-Bench: A Multi-Tier Enterprise Oracle Benchmark for Evaluating NL2SQL Dialect Generalization and Silent Semantic Divergence》的论文指出,尽管 GPT-4o 等模型在 Spider、BIRD 等学术基准上执行准确率已超过 89%,但放到真实企业级数据库场景中,性能会出现显著退化,并伴随大面积「静默语义偏差」——即查询可执行通过,但返回结果在业务语义上是错误的。
基准设计:三档复杂度 × 四种方言
ESQ-Bench 采用「Oracle 优先」的设计理念,围绕企业数据库的真实形态构建评测体系。
- Schema 规模:构建并发布了 6 个已填充数据的 Schema,共 465 张表、164,682 行数据,无空表,并确保在 Oracle、PostgreSQL、MySQL、SQL Server 四种方言上使用相同的种子数据。
- 题目规模:包含 550 道经过人工校验的问题-查询对,按复杂度分为三档——Tier-1 共 95 题、Tier-2 共 228 题、Tier-3 共 227 题。
- 评测指标:构建了四指标评测框架 EM(精确匹配)、EX(执行匹配)、SR(成功率)、SD(静默偏差),其中 SD 用于专门捕捉「执行通过但语义错误」的情况。
主流模型表现:随复杂度显著退化
研究团队以 schema-linked prompting 方式对 GPT-4o 进行了系统评测。
- 在 Tier-1、Tier-2、Tier-3 上,GPT-4o 的执行匹配率(EX,针对已执行查询)分别为 79.8%、60.3%、57.2%,呈现明显的单调下降。
- 精确匹配率(EM)在三档下均低于 7%,说明在企业 Schema 下,模型生成 SQL 的字面正确率极低。
- 更值得警惕的是,在执行通过的查询中,静默语义偏差率高达 73%–99%,即大多数「能跑通」的 SQL 在业务语义上仍然有误。
- 错误分析表明,随着复杂度提升,错误类型由语法层面逐步转向「结果错误但语法合规」类语义失败。
模型对比:Claude 优于 GPT-4o,开源差距明显
论文同时对比了 Claude Sonnet 4.6 与本地开源模型 Llama 3.2 的表现。
- Claude Sonnet 4.6(schema-linked)在三档上的 EX 分别为 87.4%、74.9%、68.7%,在所有档位上均超过 GPT-4o 的 schema-linked 设置。
- GPT-4o zero-shot 在已执行查询上的 EX 为 78.7%、73.5%、77.8%,由于执行成功率较低,在 Tier-2、Tier-3 上反而高于其 schema-linked 表现——论文指出这源于 zero-shot 与 schema-linked 之间存在幸存者偏差,分析时需谨慎。
- Llama 3.2(本地、schema-linked)整体银行场景 EX 仅 13.3%(550 题中通过 73 题),凸显闭源 API 模型与开源权重基线在企业 Oracle Schema 上的明显差距。
实践启示:学术基准与企业落地之间的鸿沟
ESQ-Bench 的核心贡献在于,把 NL2SQL 评测从「干净学术 Schema + 开源方言」推进到「真实企业 Schema + 跨方言 + 静默偏差检测」的层级。论文通过对 GPT-4o、Claude Sonnet 4.6 与 Llama 3.2 的实测,给出了量化证据:在企业级复杂度下,即便是当前最强的大模型,执行准确率也会下降二三十个百分点,并且绝大多数「成功执行」的结果在业务语义上并不可信。这对企业将 LLM 接入生产数据库时设计人机协作、结果校验和回退机制,具有直接的参考意义。
