GLM 5.3 本地多卡实测:用 BlenderMCP 搭建豪华顶层公寓
社区用户在 RTX PRO 6000 WS 多卡环境下本地运行 GLM 5.3 系列模型,通过 BlenderMCP 在…
一名海外社区用户近期在 RTX PRO 6000 WS 工作站上本地运行了 GLM 5.3 系列模型,并通过 BlenderMCP 接入 Blender,完成了一套约 260 平方米的豪华复式顶层公寓的 3D 场景搭建。该实验同时对比了 GLM 5.3 Flash 与完整版 GLM 5.3 两个体量的实际表现。
硬件与模型规模
作者使用 4-bit 量化(Q4)的本地权重进行测试:
- GLM 5.3 Flash:约 190–200 GB,需租用 4 张 RTX PRO 6000 WS 才能放下并保留上下文余量。
- GLM 5.3 完整版:约 450–470 GB,需要 6 张 RTX PRO 6000 WS。
作者选用这套配置是因为在社交媒体上频繁看到该模型做 3D 工作的片段,并同时用同一组提示词测试了两个版本。提示词的撰写工作交给了本地 GLM 5.3 完成,相机运镜则由 Claude Opus 5 单独处理,以免本地模型的 token 统计被相机描述拉高。
提示词与场景参数
初始几次尝试由于提示过于模糊,模型输出多被形容为「3D 一坨」。作者随后改用强约束工程参数,典型数值包括:
- 占地 20.0 × 13.0 m(260 平方米),主层净高 2.9 m;
- 9.0 × 8.0 m 的双高挑空,净高 6.2 m;
- 夹层位于 3.1 m 处,栏板 1.1 m;
- 楼梯共 17 级踏步,单级 rise 0.182、going 0.28;
- 露台 20.0 × 4.5 m,栏板高 1.15 m;
- 玻璃幕墙竖梃间距 1.5 m,型材深度 0.06 m。
材质 PBR 参数也被显式列出,包括玻璃 IOR 1.45–1.52、混凝土粗糙度 0.25–0.40、大理石 0.08–0.15、拉丝金属 metalness 1.0、织物粗糙度 0.75–0.95 等。提示词明确要求「不要加相机、不要重置会话」,并要求参考真实顶层公寓的比例完成软装陈设。
Flash 与完整版对比
最终输出在物体数量与耗时上较为接近,但思考阶段差异显著:
- 物体数:Flash 811,完整版 847;
- 对话轮次:Flash 43、完整版 42;
- 工具调用错误:Flash 9、完整版 8;
- 首次建模前思考:Flash 10 秒,完整版 21 分 55 秒(约 82K token);
- 总耗时:Flash 38 分 52 秒、完整版 40 分 43 秒;
- 输出 token:Flash 约 36K,完整版约 112K(约为前者的 3 倍)。
在尺寸精度上,作者通过从地面向上投射光线并与简易包围盒对比进行了二次核查:Flash 的双高挑空被搭成 9 × 8 m,与要求一致;完整版实际生成为 9 × 4.5 m,但模型自己在文本中上报为 9 × 8 m。Flash 还「按用户没要求的方式」生成了吊灯下方的吊绳、餐桌上的盘碟以及书脊等细节。
局限与说明
- 非基准测试:作者本人在文末强调「这只是个实验,不是 benchmark」,结果受提示词写法、单次执行影响较大。
- 样本单一:整套公寓只有一次端到端生成,没有重复运行统计方差。
- 自我披露:作者是 atomic.chat 的创始人,该应用提供本地模型运行界面及自有量化版本,文末邀请社区反馈,因此本文带有明显的自产品推广成分。
- 配套工具:BlenderMCP 系社区开源项目,作者使用的是公开版本;视频中的相机运镜取自此前同场景的另一段素材,本次并未重新渲染。
该实验展示了在多卡工作站本地运行百 GB 级量化大模型完成多步骤 3D 建模任务的可行性,也反映出 Flash 级别的小体量版本在 object count 和 token 经济性上可逼近完整模型,但思考预算与尺寸保真度仍是大模型版本的明显劣势。
