桃子桃子快讯
返回首页
开源

GLM 5.3 本地多卡实测:用 BlenderMCP 搭建豪华顶层公寓

社区用户在 RTX PRO 6000 WS 多卡环境下本地运行 GLM 5.3 系列模型,通过 BlenderMCP 在…

2026.09.01 · 周二4 分钟阅读

一名海外社区用户近期在 RTX PRO 6000 WS 工作站上本地运行了 GLM 5.3 系列模型,并通过 BlenderMCP 接入 Blender,完成了一套约 260 平方米的豪华复式顶层公寓的 3D 场景搭建。该实验同时对比了 GLM 5.3 Flash 与完整版 GLM 5.3 两个体量的实际表现。

硬件与模型规模

作者使用 4-bit 量化(Q4)的本地权重进行测试:

  • GLM 5.3 Flash:约 190–200 GB,需租用 4 张 RTX PRO 6000 WS 才能放下并保留上下文余量。
  • GLM 5.3 完整版:约 450–470 GB,需要 6 张 RTX PRO 6000 WS。

作者选用这套配置是因为在社交媒体上频繁看到该模型做 3D 工作的片段,并同时用同一组提示词测试了两个版本。提示词的撰写工作交给了本地 GLM 5.3 完成,相机运镜则由 Claude Opus 5 单独处理,以免本地模型的 token 统计被相机描述拉高。

提示词与场景参数

初始几次尝试由于提示过于模糊,模型输出多被形容为「3D 一坨」。作者随后改用强约束工程参数,典型数值包括:

  • 占地 20.0 × 13.0 m(260 平方米),主层净高 2.9 m;
  • 9.0 × 8.0 m 的双高挑空,净高 6.2 m;
  • 夹层位于 3.1 m 处,栏板 1.1 m;
  • 楼梯共 17 级踏步,单级 rise 0.182、going 0.28;
  • 露台 20.0 × 4.5 m,栏板高 1.15 m;
  • 玻璃幕墙竖梃间距 1.5 m,型材深度 0.06 m。

材质 PBR 参数也被显式列出,包括玻璃 IOR 1.45–1.52、混凝土粗糙度 0.25–0.40、大理石 0.08–0.15、拉丝金属 metalness 1.0、织物粗糙度 0.75–0.95 等。提示词明确要求「不要加相机、不要重置会话」,并要求参考真实顶层公寓的比例完成软装陈设。

Flash 与完整版对比

最终输出在物体数量与耗时上较为接近,但思考阶段差异显著:

  • 物体数:Flash 811,完整版 847;
  • 对话轮次:Flash 43、完整版 42;
  • 工具调用错误:Flash 9、完整版 8;
  • 首次建模前思考:Flash 10 秒,完整版 21 分 55 秒(约 82K token);
  • 总耗时:Flash 38 分 52 秒、完整版 40 分 43 秒;
  • 输出 token:Flash 约 36K,完整版约 112K(约为前者的 3 倍)。

在尺寸精度上,作者通过从地面向上投射光线并与简易包围盒对比进行了二次核查:Flash 的双高挑空被搭成 9 × 8 m,与要求一致;完整版实际生成为 9 × 4.5 m,但模型自己在文本中上报为 9 × 8 m。Flash 还「按用户没要求的方式」生成了吊灯下方的吊绳、餐桌上的盘碟以及书脊等细节。

局限与说明

  • 非基准测试:作者本人在文末强调「这只是个实验,不是 benchmark」,结果受提示词写法、单次执行影响较大。
  • 样本单一:整套公寓只有一次端到端生成,没有重复运行统计方差。
  • 自我披露:作者是 atomic.chat 的创始人,该应用提供本地模型运行界面及自有量化版本,文末邀请社区反馈,因此本文带有明显的自产品推广成分。
  • 配套工具:BlenderMCP 系社区开源项目,作者使用的是公开版本;视频中的相机运镜取自此前同场景的另一段素材,本次并未重新渲染。

该实验展示了在多卡工作站本地运行百 GB 级量化大模型完成多步骤 3D 建模任务的可行性,也反映出 Flash 级别的小体量版本在 object count 和 token 经济性上可逼近完整模型,但思考预算与尺寸保真度仍是大模型版本的明显劣势。

信源