桃子桃子快讯
返回首页
行业动态

Anthropic 两款神秘模型代号流出:3D 推理与深度思考能力受关注

开发者通过 API 流量截获 Anthropic 两款未公开模型,实测显示其在 3D 空间布局上表现突出,并大量消耗思考…

2026.08.25 · 周二3 分钟阅读

近日,有开发者在 Anthropic 的 API 流量中截获了两个此前未公开的模型 ID,分别为 claude-marshmallow-eap(内部代号「棉花糖」)和 claude-melon-eap(内部代号「甜瓜」),相关实测帖在 X 等社交平台引发关注。

模型被发现的过程

据开发者披露,在 8 月 21 日 00:45–00:57Z 期间,claude-marshmallow-ht-eap 的 ID 在 API 流量中被高频调用了 57 次。随后,该模型以「Custom model」的身份出现在 Claude Code 的模型列表中,并显示支持 100 万 Token 的上下文窗口。

目前这两款模型并未对外开放 API 端点,仅出现在内部或红队测试人员的环境中。命名延续了 Anthropic 此前使用食物名称(如 claude-horchata-eap)的内部代号传统。

实测中的 3D 空间推理表现

多名参与早期测试的开发者表示,「棉花糖」与「甜瓜」在 3D 强化学习任务和建筑空间布局上表现突出:

  • 能够直接理解并生成包含复杂拓扑、几何与物理约束的 3D 坐标与场景数据;
  • 测试者反馈其在 One-Shot(一次性)条件下即可输出质量较高的 3D 布局,无需反复调整 prompt;
  • 部分开发者认为综合体验略优于当前公开版本中的 Opus 5,对话表现更自然。

大量消耗「思考 Token」

多个测试者提到一个共同现象:两款模型在回答前会消耗海量的「思考 Token」(Thinking Tokens),部分测试中触发了系统 <max-tokens> 上限。这一机制意味着模型在最终输出前会进行更长的内部推演与思维链构建,对算力的消耗显著高于常规版本。

测试者认为,这一变化反映了行业趋势——大模型的竞争正在从训练阶段的算力堆叠,转向推理阶段的算力消耗与深度推理能力的提升。

与 Opus 5 的时间节点及行业猜测

两款模型的曝光发生在 Anthropic 近期发布旗舰模型 Opus 5 之后不久。由于该版本在社区中收到较多负面反馈,外界普遍猜测 Anthropic 正在加速迭代以回应市场期待。关于「棉花糖」与「甜瓜」的具体定位,目前存在几种说法:

  • 可能是 Opus 5.1 的内部测试版,针对 Opus 5 的短板进行强化;
  • 也可能是 Sonnet 或 Haiku 系列的新迭代,因测试反馈中提到其响应速度与性价比表现良好;
  • 还有开发者认为其能力定位低于 Anthropic 内部代号为「Fable」的顶级模型。

截至目前,Anthropic 尚未对这两款模型发布任何官方说明,相关能力与定位仍以社区实测与推测为主。

信源