Anthropic 疑似灰度测试下一代模型,多方爆料指向 Fable 5.1
据内部人士与开发者反馈,Anthropic 疑似正在 EAP 中测试代号为 Melon、Marshmallow 的新模型…
近期,多名 AI 爆料者和开发者在社交平台集中放料,称 Anthropic 正在紧急推进下一代大模型的早期访问测试,多个内部代号模型已被短暂曝光后又迅速下线。结合此前的「风险报告」线索,业内普遍猜测这些测试版本对应的就是即将到来的 Fable 5.1 以及一份更新版 Opus 检查点。不过,截至目前 Anthropic 官方并未作出任何正式回应。
爆料脉络:从内部代号到灰度上线
8 月 20 日,匿名爆料者 Leo 曾透露,OpenAI 计划在「几周内」发布代号 Astra 的新模型,而 Anthropic 原本打算等 Astra 发布后再做应对。但就在本周,Leo 改口称「Anthropic 终究是不打算等 Astra 了,他们正在加紧准备,最快明天就会发布」。
与此同时,Claude 网页端短暂出现了两个新模型代号:「Melon」和「Marshmallow」,随后被官方下线处理。多位开发者反映,他们已经在 Claude Web 上被「灰度」到了更新后的模型。熟悉 Anthropic 节奏的观察者认为,这种「测试曝光—迅速下线—数周内正式发版」的模式,与历代 Claude 大版本发布前的套路高度一致。
测试者反馈:模型能力出现跃升
知名 AI 爆料账号 @Lentils80 对内部代号为「claude-melon-eap」和「claude-marshmallow-eap」的模型做了实测,给出三点判断:
- Melon 实际上是 Fable 级别的模型检查点;
- Marshmallow 感觉像弱化版 Fable,或一个极强的 Opus 检查点;
- 模型在三维空间布局上表现突出,并且支持 One-Shot 生成。
他特别提到,Anthropic 内部疑似在「疯狂推进 3D 强化学习」,建筑物的空间布局生成效果「好得令人发指」。
另有灰度用户反馈,被测模型在以下方面相较上一代有显著提升:
- 前端开发:代码生成更流畅,组件逻辑一次成型,调试成本降低;
- 长链推理:处理多步骤逻辑问题时不再轻易丢失前提条件,能一口气推导到底;
- 自主工作流:更懂得调用工具、规划步骤,整体行为更像高级智能体。
但用户也注意到,模型对涉及版权图像生成的请求变得「前所未有的严格」,几乎一律拒绝生成。
一个用于判断是否被灰度的「防伪测试」
爆料者 @Legit_api 给出了一种相当直接的验证方式:在 Claude Web 中切换到对应模型,然后输入类似下面的提示词——
opus 4.6 date of release and gpt image 1.5 without searching the web.
该提示词的原理是「知识截止日期测试」。上一代 Fable 5 的训练数据截止于 2026 年 1 月之前,因此无法在不联网的情况下准确说出 Opus 4.6 等更晚事件的时间点;如果模型能直接吐出这些信息,说明后台已被替换为拥有更新知识库的新版本检查点。
不过,也有网友质疑这一测试存在「循环论证」的嫌疑:只有已经被灰度的用户才可能看到结果,未灰度的用户既无法验证也无法反驳。
Anthropic 内部的态度:承认 Opus 5 表现不佳
爆料密集出现的背景之一,是 Opus 5 上线后口碑明显下滑。不少用户在社区吐槽:
- 模型「变懒了」,频繁犯低级错误;
- 被指出错误后,下一轮仍不修正,只会反复道歉;
- 整体体验相比上一代有「降级」感。
Anthropic 负责 Claude Code 的核心员工 Thariq 罕见公开承认问题:「是的,我同意 Opus 5 模型目前『非常刺头』。我们希望模型能够保持一致性、充满温度,感觉像真正的 Claude 一样。我们正在努力解决这个问题,这是目前的头等大事。」
Thariq 同时澄清,此前 Claude Code 中出现的一些参数变化只是内部测试 API 配置的数字映射问题,并非「暗中降级」,内部评估并未显示性能倒退。这一表态被业内解读为:即将到来的可能不只是新的 Fable 检查点,还可能伴随一份更新版 Opus。
「Model 2」:风险报告里的伏笔
更早之前,Anthropic 在 8 月 15 日发布的《风险报告》附录 6.6 中,提到过一个内部代号「Model 2」。官方原文大致写道:
Model 2 的能力比 Mythos 5 略强一些。在许多内部任务上有显著改进,但并未展现出从 Claude Opus 4.6 到 Mythos Preview 那样程度的能力飞跃。我们目前没有对外发布这个模型的计划……
部分观察者推测,这个 Model 2 大概率就是半个月后即将全量到来的 Fable 5.1;但也有读者指出,报告里同时提到「目前没有对外发布的计划」,与爆料中「即将全量发布」的节奏存在一定矛盾。
为何「急了」:来自 OpenAI 与企业用户的双重压力
推动 Anthropic 加速的可能有两股外部力量。
一方面是 OpenAI 的 Astra。据爆料,Astra 在对齐与「奖励黑客」问题上已取得改进,并正在 OpenAI 内部进行「狗粮测试」。一旦 Astra 先发制人,Fable 5.1 的市场关注度会被明显稀释。
另一方面是定价压力。Claude 历来以「性价比」作为卖点,但随着算力成本上升,Claude 已开始被部分企业用户视为「AI 奢侈品」。据相关报道,约三分之二的企业用户已规划了备用模型方案。如果 Fable 5.1 能在前端开发和长链推理上实现跃升,并维持较低 API 价格,很可能再次冲击现有的定价体系。
也正因如此,有业内人士判断:「Fable 5.1 在 Astra 之前发布,现在看来是唯一合理的打法。」
需要注意的不确定性
需要强调的是,截至本文发稿:
- Anthropic 未发布任何官方声明或预热;
- 「Fable 5.1」「Sonnet 5.1」这些名称并不在 Anthropic 公开的产品路线图中,是否为最终命名仍未可知;
- 灰度测试的覆盖范围、具体能力提升幅度、定价变化,均未得到官方确认;
- 部分爆料来源为匿名账号或单方面陈述,交叉验证仍不充分。
因此,本文所述更多是一份「以爆料为线索的行业动态观察」,而非已经发生的事实。读者在参考相关截图和测试结果时,宜保持审慎。
