桃子桃子快讯
返回首页
行业动态

GPT-5.6 三档与 Claude Fable 5 物理建模对决:Fable 以 0.889 加权分领跑

JuliaHub 用 Dyad 代理在五道物理建模题上对比 GPT-5.6 系列与 Claude Fable 5,Cla…

2026.07.21 · 周二5 分钟阅读

JuliaHub 在其面向建模与仿真的 AI 代理 Dyad 中,对 OpenAI 的 GPT-5.6 系列(terra、sol、luna 三档)和 Anthropic 的 Claude Fable 5 进行了系统对比,五个难度递增的物理建模与仿真题目、共 52 次打分运行。结果显示 Claude Fable 5 以 0.889 的加权得分居首,GPT-5.6-sol、terra、luna 分别为 0.814、0.786、0.727。

为什么单看跑通代码不够

Physical AI 的关键在于建模出的物理是否成立。一架飞行器、一个分离柱或一个带电粒子的模型,可能编译运行都通过,但内含的物理却站不住脚。代理式 AI 还会放大这一问题:代理靠测试反馈推进,而测试往往就是它自己写的。在 Web 开发或编译器这类行为可校验的场景,闭环尚可;但在工程领域,真正的问题是「是否符合真实世界」,这要难得多——代理可以让自己写的每一条测试都过,而这些测试却建立在与目标工况不符的简化之上。

JuliaHub 也在文章中点出了对厂商自报 benchmark 的不信任:发布分数的一方恰恰最有动机去针对该分数调优,而 JuliaHub 自身则横跨多家厂商提供 Dyad 后端,激励方向相反——找出在物理建模上真正更强的那家并向用户推荐。

测试设置:只换模型,其他全部钉死

  • 题目:5 道密封物理建模题,按难度排序;前 4 道每道 3 次试验,第 5 道(NASA HL-20 飞行器,长链路)各 1 次;总计 52 次评分运行。
  • 代理外壳:Dyad AI agent harness 同一版本,所有试验固定。
  • 推理档位:xhigh;上下文窗口:1M;token 预算:128k。
  • 唯一变量:模型本身。
  • 评分方式:忽略代码是否能跑通,直接把模拟轨迹与密封真相对照,按难度加权汇总成单一分数;成本与时间另行记录,不参与加权。

这套设置刻意排除了「会不会写代码」这一干扰项,专门考察模型对物理本身是否真懂。

成绩单:四款模型横向对比

  • claude-fable-5:加权分 0.889,单次成本约 9.60 美元,平均用时 16.1 分钟。
  • gpt-5.6-sol:加权分 0.814,单次成本约 1.74 美元,平均用时 13.4 分钟。
  • gpt-5.6-terra:加权分 0.786,单次成本约 1.25 美元,平均用时 12.6 分钟。
  • gpt-5.6-luna:加权分 0.727,单次成本约 3.26 美元,平均用时 25.0 分钟。

Claude Fable 5 在得分上一骑绝尘,但单次成本是 terra 的近 8 倍;terra 性价比最突出;luna 则在分数、用时和成本三项上均处劣势。

工作风格画像:解题指纹各不相同

通过对每次试验的工具调用按「读题、推导与验证物理、编辑模型、编译、搜索可复用片段」分类计数,研究者归纳出四款模型的「工作指纹」:

  • Fable:靠「试图失败」来验证。 在相对论动力学题中,它把求解器容差扫了三个数量级观察质量壳不变量 u·u 的漂移,最终在 1e-10 提交;又把场在 200 个随机点上与独立重实现对照,并故意翻转一个场分量符号来检验检查是否能捕获错误;对初始四速的时间分量,拒绝当作自由输入,而是从质量壳约束推导。每次试验 28 次调用并非仓促,而是一遍写定因为已先试图击穿。代价落在后续的 token 账单上。
  • Sol:超出题目要求去规约。 在本构问题上,它构建了全队列中仅有的两个真正独立的 oracle 之一,把本构恒等式的求积检验关到 3.7e-12;但同一习惯在相对论问题上制造了失误——题目钉死四速 z 分量为 -0.62,它把状态重整化到「坐标速度」等于 -0.62,让粒子多带 27% 的纵向动量,自洽检查随即放行了这一误读。精度不等于忠于规约。
  • Luna:在应深挖的地方选择迭代。 带入运行的配置最少、读题最多,在较易题上因此受益;一旦进入需要更稳态判断的难题……(原文在此处截断)。

这份评测说明:在工程类物理建模任务上,「会写代码」和「懂物理」之间的差距,仍能在大模型之间被清晰拉开,而不同模型在「如何把物理做对」上展现出的风格差异,比单一分数更能指导选型。

信源