桃子桃子快讯
返回首页
研究论文

LLM 查询生成能力跨 SQL/Cypher/TypeQL 基准评测

TypeDB 团队用 Claude Sonnet 5 与 DeepSeek V4 Pro,在 SQL、Cypher、Ty…

2026.09.23 · 周三4 分钟阅读

TypeDB 团队日前发布了一项跨数据库查询语言的大模型基准测试报告,对 Claude Sonnet 5 与 DeepSeek V4 Pro 两款模型在 SQL、Cypher、TypeQL 三种语言上的查询生成能力进行了系统对比,共计 3024 次运行。报告聚焦两个变量——上下文学习(in-context learning)与重试(retry)机制——对最终准确率的影响,并展示了一组颇有冲击力的数据。

测试设计:三种数据库语言、42 道题目

研究采用的底层数据为 Reactome——一个由专业人员维护的生物通路数据库,发布方同时提供 MySQL 转储与 Neo4j 图库。TypeDB 团队自行基于 Neo4j 图库构建了 TypeDB 版本,使三种查询语言可以对同一业务数据集作答。

被测的 42 道题目按难度与考察点分为多个层级:

  • easy:4 道,基础查询与计数
  • medium:5 道,含过滤条件的连接与图遍历
  • expert:11 道,涉及多跳结构、否定、子查询
  • recursion:4 道,针对通路层级的传递闭包
  • reification / argmax / aggregation / polymorphism:共 15 道,考察 n 元事实、组内极值、聚合叠加、通过父类型的查询
  • unanswerable:3 道,考察模型是否会拒绝作答

其中 3 道"不可作答"题在所有配置下均被正确识别,研究在后续统计中将它们排除。每个 prompt 都会附带目标语言的完整 schema(约 16k token),模型根据可选的上下文资源与单个自然语言问题生成查询,再在执行后与参考答案比对——只有执行结果一致才算通过。

核心发现一:上下文学习几乎可以弥补训练数据缺口

两款模型在 TypeQL 上都没有充分的预训练经验。在无上下文学习、无重试的基线下:

  • Sonnet 5:SQL 62%、Cypher 58%、TypeQL 25%
  • DeepSeek V4 Pro:SQL 56%、Cypher 62%、TypeQL 0%

加入查询编写技能文档(skill)与少量示例后,三种语言的准确率被迅速拉齐:

  • Sonnet 5:SQL 82%、Cypher 84%、TypeQL 75%
  • DeepSeek V4 Pro:SQL 78%、Cypher 74%、TypeQL 62%

报告据此得出一个概括性结论:只要 prompt 中提供足够资源,基线训练数据中的劣势几乎可以完全被上下文学习所补偿。

核心发现二:重试能带来显著提升,且越"会报错"收益越大

允许模型基于错误信息自我修正,可以进一步推高准确率——尤其是与上下文学习叠加时。但这一信号的强弱,关键取决于验证器(verifier)能否返回有意义的报错。

当 Sonnet 5 在有上下文资源的基础上获得最多 4 次重试:

  • SQL 从 82% 升至 83%
  • Cypher 从 74% 升至 82%
  • TypeQL 从 75% 升至 92%

TypeQL 成为最大受益者。报告将原因归结于 TypeDB 的验证器更强:除语法与执行错误外,其 schema 还能将语义层面的失败以类型检查错误的形式反馈给模型,从而为重试提供更明确的修正信号。

局限性与复现说明

研究的局限性也很明确:

  • 重试只能由可观测的失败触发,包括语法/执行错误、超时、结果格式异常、模型未返回查询等情形;查询执行成功但答案错误时,harness 无法知晓,结果被记为失败但无法再触发重试。
  • "不可作答"题在所有配置下都被拒答,报告据此承认这部分难度仍有提升空间。

配置细节、复现命令与原始数据分别在原文第 5、6 节及附录中给出。该基准由 TypeDB 自行设计与执行,结论对 TypeQL 在 LLM 友好度上的优势呈现是有利的,读者在引用结果时需将这一发布背景纳入考量。

信源