桃子桃子快讯
返回首页
行业动态

ONESTRUCTION 联合 AWS 在 Qwen3 上构建建筑 IDS 专用基础模型

日本初创 ONESTRUCTION 基于 Qwen3 构建面向 BIM/IDS 的领域基础模型 Ishigaki-IDS…

2026.08.12 · 周三4 分钟阅读

日本建筑科技初创公司 ONESTRUCTION 在 AWS Generative AI Innovation Center(GenAIIC)的技术顾问支持下,基于阿里云开源大模型 Qwen3(8B / 14B / 32B)构建了面向建筑行业 BIM 工作流的基础模型 Ishigaki-IDS,专注于处理 IDS(Information Delivery Specifications)文件的编写与校验。该项目是日本 GENIAC(Generative AI Accelerator Challenge)第三期的成果之一。

背景:BIM 落地与 IDS 门槛

日本建筑业长期面临人手短缺,BIM(Building Information Modeling)作为可在设计、施工、运维各阶段共享信息的数字表示方式,被国家层面推广。但 BIM 的采纳需要专业知识,学习成本较高。IDS 是 buildingSMART 在 2024 年发布的基于 XML 的信息交付规范,用于定义附加在 BIM(IFC)模型上并加以校验的信息。编写 IDS 文件既要熟悉其特殊语法,也要掌握 IFC 的上千条术语与规则,对非 BIM 专家而言门槛偏高。Ishigaki-IDS 的目标,就是让不精通 BIM 的从业人员也能审查与管理属性信息。

三大核心挑战

  • 数据稀缺:IDS 是较新标准,建筑领域公开网络语料有限,远不及金融、医疗、法律等领域动辄千亿 token 的训练数据。即便爬取最新网页数据,体量与深度都不足以让模型从数据中掌握 IDS 相关知识。
  • IFC 词汇映射:IFC 词表包含数千条术语,例如「beam」对应 IfcBeam、「air conditioner」对应 IfcUnitaryEquipment,传统上靠领域专家手工映射,需要模型直接学会这种对应。
  • IDS 专有语法:IDS 不仅是普通 XML,其标签结构会根据附加信息的类型而变化,需要使用重复模式与专用标签;通用基础模型难以稳定生成符合规范的结构。

三阶段训练流程

ONESTRUCTION 采用了 CPT(持续预训练)→ SFT(监督微调)→ RLVR(带可验证奖励的强化学习)的三阶段管线。

  • CPT:使用网络语料加上由内部领域专家生成的合成数据,向模型注入 IDS 与 IFC 领域知识。团队大规模生成合法 IDS 文件,并构建从多角度解释 IDS 文档的合成数据集,合成数据占据了训练语料的绝大部分。
  • SFT:用「IDS 编写指令(CSV 或自然语言)→ 期望输出」的配对数据进行微调。但仅靠 SFT 仍会出现「看起来合理但标签或属性错误」的问题,因此引入第三阶段。
  • RLVR:以 buildingSMART 官方的 IDS-Audit-Tool 作为奖励函数,对 XML 良构性、IDS 结构合法性与语义一致性进行机械校验,让模型基于可验证信号迭代优化。RLVR 在数据匮乏的 IDS 场景下尤为合适,因为它无需大量监督数据即可提升输出质量。

基础设施与协作

训练在 Amazon EC2 P5en 实例上借助 AWS ParallelCluster 进行分布式训练,团队每两周与 GenAIIC 顾问进行一次技术对齐,围绕训练数据设计、评估基准、训练阶段与技巧、长上下文处理与奖励塑形等五个方向迭代评估指标,覆盖 IFC/IDS 知识、结构化生成与通用对话能力。

由于原文内容在训练技巧段落被截断,具体的最终 benchmark 数据、模型选择(最终在 8B / 14B / 32B 中选定哪一档)以及上线效果不在本次摘录范围内。但整体方案呈现了一条「通用底座 + 合成数据 + 三阶段训练 + 可验证奖励」的领域基础模型构建范式,可供数据稀缺行业的技术负责人与 ML 工程师参考复用。

信源