桃子桃子快讯
返回首页
研究论文

CladBench 开源评测基准发布:聚焦英欧建筑法规的 LLM 横评

CladBench 发布 536 道英国及欧盟建筑法规评测题,覆盖 12 个类别,对 Claude Opus、Gemin…

2026.08.17 · 周一6 分钟阅读

CladBench 是一个面向英国及欧盟建筑环境领域的开源大语言模型评测基准,由 CladBrain 团队于 2026 年 8 月 13 日释出。基准共包含 536 道题目,覆盖 12 个专业类别,包括英国建筑法规、EPC 评级预测、IFC 实体推理、BMS 传感器异常分类、 retrofit 优先级排序、BREEAM 信用判定、热舒适诊断、CIBSE 技术问答、材料与产品规格、能源账单异常检测、净零路径推演以及监管悬崖条款解读等。所有题目的模型回答与评分均已公开。

评测范围与题型设计

CladBench 主要围绕英国行业实践,并选择性地纳入欧盟监管内容。536 题按类别分布如下:

  • 英国建筑法规(55 题,选择题,精确匹配)
  • EPC 评级轨迹预测(50 题,简答题,区间容差)
  • IFC 实体推理(40 题,选择题)
  • BMS 传感器异常分类(48 题,选择题)
  • retrofit 优先级排序(30 题,排序题,Spearman + 评判模型)
  • BREEAM 信用达标判定(54 题,选择题 + 理由,精确匹配 + 评判模型)
  • 热舒适诊断(40 题,开放式,LLM 评判量表)
  • CIBSE 技术问答(50 题,选择题)
  • 材料与产品规格(50 题,选择题 + 理由)
  • 能源账单异常检测(30 题,简答题)
  • 净零路径推演(40 题,开放式)
  • 监管悬崖条款推理(49 题,简答题)

主流模型横评成绩

评测涵盖 7 个主流大模型,开放式题目的评分由 DeepSeek Chat 与 Grok 4 两位评判模型完成(它们自身不参评),并通过 1 万次 bootstrap 重采样给出 95% 置信区间。结果如下:

  • Claude Opus 4.7:0.888 [0.867, 0.908]
  • Claude Opus 4.8:0.869 [0.847, 0.890]
  • Gemini 2.5 Pro:0.831 [0.808, 0.854]
  • GPT-5:0.823 [0.795, 0.848]
  • GPT-4o:0.691 [0.660, 0.722]
  • Llama 3.3 70B Instruct Turbo(FP8):0.655 [0.622, 0.688]
  • Qwen 2.5 7B Instruct Turbo(FP8):0.540 [0.504, 0.575]

值得注意的是,Gemini 2.5 Pro 与 GPT-5 在该基准上未呈现统计显著差异,分差仅 +0.009,95% 置信区间为 [−0.022, +0.039],官方建议将其视为相当而非排名先后。CladBrain 进一步指出,总分其实是最不重要的结论——所有模型在 BMS 异常分类类目上得分均不低于 0.75,而在监管悬崖条款类目上 7 个模型的得分跨度从 0.901 一路降至 0.126,任务类别对结果的影响远大于模型本身的选择。

参考答案与适用前提

基准中的参考答案并非同等强度,团队标注了三种来源等级:

  • primary_source_verified(196 题):答案可在来源文件中直接找到或经重新推导得出
  • cross_validated / reviewed(257 题):三个前沿模型一致认定答案正确
  • unverifiable(83 题):经过核查但无法作为标准答案使用,并给出原因

其中交叉验证的认定方式较弱。例如 Category 1(英国建筑法规)虽号称通过全部 55 题,但其中 45 题在实际查阅 Approved Documents 后仍需订正。此外,55 题的答案依赖可能动态变化的政策立场,团队建议在 2026 年 8 月 13 日之后复用前重新核验。

复现与扩展使用

CladBench 已在 GitHub 开源(cladbrain/cladbench),并提供两种使用方式:

  • 不需 API 复现成绩:直接调用本地已发布的模型回答,可重算 536 行中 243 行由确定性方法打分的题目,结果与存储分数完全一致;其余 293 行需要调用 --judge anthropic 加 ANTHROPIC_API_KEY 重新让评判模型打分。
  • 自评新模型:通过 python -m cladbench evaluate 接入 anthropic、openai、google、together、hf 五个提供方,每次运行写入包含数据集哈希、harness 版本与 token 用量的 manifest。

已知局限

作者明确列出若干局限以避免误读:

  • 题目由模型生成,虽经一手来源核对,但措辞反映单一生成器风格。
  • 两类目暂定评分:Category 2 仅 2/50 题经一手来源核对,Category 8 仅 9/50;CIBSE 因素材授权问题,其中 29 题无法对照原始来源。
  • 选择题中存在「选项长度线索」:正确选项在 37% 的选择题中是最长的(随机基线约 25%),在 Category 6 中高达 69%。
  • 两款开源权重的成绩仅对应某提供方的 FP8 量化端点,不代表全精度版本。
  • GPT-5 与 Claude Opus 4.x 系列不支持锁定温度,因此七个模型中的三个及所有评判结果为采样而非贪心生成,论文中报告了重复运行的方差。
  • 仅覆盖文本,未涉及图纸、BIM 模型或 PDF 报告。
  • 每个类别样本量在 30–55 之间,单类别对比仅供指示。

仓库另保留了 120 题的私有留出集,从未发送给任何模型,用于在出现污染争议时以运行而非争论的方式解决。其生成器亦未公开,因为题目本身就是种子生成器的产物。

信源