桃子桃子快讯
返回首页
研究论文

DrawingVQA:首个面向建筑工程图纸的多模态大模型评测基准

研究者发布 DrawingVQA 基准,用 33 张施工图纸与 92 道题目评估 MLLM 在工程图纸上的多层次推理能力…

2026.07.20 · 周一1 分钟阅读

近期发表于 arXiv 的一项研究提出了 DrawingVQA,这是首个专门用于评估多模态大语言模型(MLLM)在真实建筑工程图纸上表现的基准。建筑工程图纸融合了几何图形、符号标注、表格数据、文字注释与领域术语,是工程实践中一种高度复杂的视觉—文本混合媒介,与自然图像或简化平面图有本质区别。

基准构成

DrawingVQA 包含 33 张「Issued for Construction」(正式施工版)图纸,以及 92 道由领域专家精心编写的问答对。题目按推理深度划分为三个层级:

  • 感知理解:识别图纸中的基本视觉元素与符号;
  • 上下文解读:理解图形、标注与文字之间的关联;
  • 领域专家推理:需要结合工程规范与专业知识作答。

评估框架

研究者提出一种双重分类框架,从 7 个建筑工程维度与 4 个 MLLM 能力维度对模型表现进行联合分析,这也是首次将工程工作流与 AI 推理能力显式映射的研究。

主要发现

研究团队对当前主流 MLLM 进行了测试,结果显示模型与人类专家之间存在显著性能差距,且推理深度越高,差距越明显。这意味着现有模型在处理真实工程图纸这一高度专业化视觉—文本任务时仍有明显短板。

意义

DrawingVQA 为领域专属的多模态推理研究提供了基础,有望推动 AI 驱动的图纸理解与真实工程流程进一步结合。

信源