过去两天,Claude 社区又开始猜新模型了。
这次冒出来的不是 Opus、Sonnet 或 Haiku,而是两个听上去更像甜品菜单的名字:
claude-marshmallow-eapclaude-melon-eap
有开发者称,这两个名称出现在 API 访问记录或开发者社区的模型列表中。随后,关于它们定位和能力的说法迅速扩散:Marshmallow 比 Melon 强、Marshmallow 聊天体验超过 Opus 5、两者又都没有达到 Fable 级别……

问题也恰恰出在这里。
截至 2026 年 8 月 25 日,Anthropic 的官方模型目录、新闻中心和开发者文档,都没有列出 Marshmallow 或 Melon。官方当前公开的主力产品仍是 Fable 5、Opus 5、Sonnet 5 和 Haiku 4.5。
所以,这不是一篇“Claude 新模型发布报道”。更准确的说法是:社区捕捉到了一组疑似预发布模型的基础设施痕迹,而这些痕迹正在透露 Anthropic 下一阶段的测试方式和产品节奏。
先把事实、线索和猜测分开
围绕这两个代号的讨论很多,但可信度并不在同一层级。
| 信息 | 当前状态 | 应该如何理解 |
|---|---|---|
社区截图中出现 claude-marshmallow-eap 与 claude-melon-eap |
有多处转发和截图支持 | 可以确认这些字符串在社区流传,但不能单凭截图确认它们已正式开放 |
名称带有 eap 后缀 |
可观察事实 | 通常被社区解释为 Early Access Program,但 Anthropic 没有为这两个代号发布官方说明 |
| Marshmallow 强于 Melon | 早期使用者主观评价 | 没有公开测试集、参数设置和可复现结果 |
| Marshmallow 的聊天体验超过 Opus 5 | 单点体验说法 | “更好聊”不等于推理、编码和工具调用能力全面领先 |
| 两者对应 Opus 5.1、Sonnet 5.1 或新 Haiku | 社区推测 | 官方尚未确认产品映射 |
| 近期会正式发布 | 时间预测 | 没有官方发布日期,测试模型也可能更名、合并或取消 |
后续线索还让事情变得更微妙。
开发者 Chetaslua 随后表示,普通的 claude-marshmallow-eap 和 claude-melon-eap 并没有留下可确认的“第一方输出”;真正曾在 8 月 21 日留下 API 流量记录的名称,可能是 claude-marshmallow-ht-eap。据其整理的流量记录,这个模型曾返回自身名称,并在某些安全任务上回退到 Opus 4.8。
这条后续修正非常重要。它说明“列表里出现一个名字”“请求真实命中了模型”和“模型产生了可验证输出”,其实是三件不同的事。
模型泄露最容易被忽略的,恰恰就是这三层证据之间的距离。
社区所谓的“实测”,现在还不足以说明性能
原文里的两张讨论截图放在一起看,很有意思。
有人说 Marshmallow 聊天比 Opus 5 好,紧接着就有人说 Melon 才比 Opus 5 好。

两种说法互相冲突,却都没有给出提示词、输出原文、采样参数、测试次数和对照条件。这样的信息适合用来判断“社区正在讨论什么”,不适合直接写进模型排行榜。
尤其是“聊天体验更好”这种结论,本来就带有很强的主观性。回答更自然、更简短、更愿意顺着用户说,可能会让人感觉更好聊;但换到长程 Agent、代码修改、检索准确率或复杂推理任务,结论可能完全不同。
真正有参考价值的模型对比,至少需要回答几个问题:
- 两次请求是否使用相同提示词和系统指令?
- temperature、effort 和工具权限是否一致?
- 是否确认请求没有经过路由、回退或安全分类器切换?
- 测试的是短对话体验,还是可以客观验收的任务?
- 是否有足够多的样本,而不是一次“手感很好”的偶然结果?
现在公开的信息显然还没有达到这个标准。
食物代号不重要,命名开始变得“不可预测”才重要
Claude 的正式产品名称长期使用文学体裁:Haiku、Sonnet、Opus、Fable、Mythos。社区过去捕捉到的内部名称,则出现过动物和食物等不同主题。
这次 Marshmallow 和 Melon 集体变成食物,很容易让人联想到此前流传过的 Honeycomb、Fruitcake 等名称。也有人据此推测,Anthropic 正在用“食物名 + EAP”标记某一批预发布 checkpoint。

但内部代号不能直接拿来推导正式产品线。
同一个内部模型可能经历多轮训练、后训练和安全配置,最终并入另一条产品线;一个外部看到的名称也可能只是路由器、实验组或部署环境,而不是独立基础模型。此前社区曾把 Honeycomb 与 Opus 5 联系起来,但 Anthropic 从未确认二者存在一一对应关系。
因此,代号真正能说明的不是“Opus 5.1 已经来了”,而是 Anthropic 的模型测试已经进入更频繁、更分散的阶段。开发者可能先在模型列表、错误信息、客户端配置或响应字段中看到痕迹,正式名称和产品定位则要晚得多。
为什么 Claude 的内部模型越来越容易被看到?
过去,模型发布更像一场安排好的发布会:官网公告、模型卡、API 文档和产品入口同时上线。Agent 时代的模型部署更复杂,测试痕迹也更容易提前出现在外部系统中。
一个新 checkpoint 上线前,可能要经过模型路由、权限白名单、红队测试、安全回退、客户端兼容、上下文窗口、工具调用和计费链路等多轮验证。只要其中某个环节需要接入真实生产基础设施,模型 ID 就可能短暂出现在日志、列表或报错中。
这也是 EAP 线索比单纯的代号更有价值的原因。它暗示的不是某个营销名称,而是一套发布前测试机制:
- 先向少量账号或测试人员开放;
- 在真实客户端和 API 链路中观察表现;
- 对高风险任务设置分类器或回退模型;
- 根据稳定性、成本和安全结果决定是否扩大范围;
- 最后才确定正式名称、价格与可用区域。
当然,这套流程是根据公开痕迹作出的合理推断,并非 Anthropic 对 Marshmallow 和 Melon 的官方流程说明。
一个月三条主力线,Anthropic 的节奏已经发生变化
把这次传闻放回 2026 年的 Claude 产品线,会更容易理解它为什么引发关注。
Anthropic 在 6 月 9 日公开了 Fable 5,6 月 30 日发布 Sonnet 5,7 月 24 日又发布 Opus 5。官方模型目录目前把三者放在不同位置:Fable 5 面向最高能力和长程 Agent,Opus 5 面向复杂 Agent 编码与企业任务,Sonnet 5 强调速度、智能和成本的平衡。
| 模型 | 官方定位 | 公开时间 |
|---|---|---|
| Claude Fable 5 | 最高能力、长时间运行的 Agent | 2026 年 6 月 9 日 |
| Claude Sonnet 5 | 速度与智能的平衡,面向规模化工作负载 | 2026 年 6 月 30 日 |
| Claude Opus 5 | 复杂 Agent 编码和企业工作 | 2026 年 7 月 24 日 |
不到两个月,三条主力产品线先后更新。现在又出现新的 EAP 代号,至少说明 Anthropic 没有把“年度大版本”当成唯一迭代单位。
模型公司的竞争正在从“多久发布一代”转向“能否持续训练、测试、路由和部署多个 checkpoint”。正式发布只是最容易被公众看到的一刻,后面还有更长的模型运营链路。
Marshmallow 和 Melon 可能在测试什么?
在没有模型卡和可复现实测之前,不能把它们直接命名为 Opus 5.1 或 Sonnet 5.1。但结合 Anthropic 现有产品线,仍然可以观察几个更有意义的方向。
1. 不一定追求更高上限,可能优先修复体验
社区反复提到“更好聊”,而不是某项权威基准大幅提升。这可能说明测试重点包含语气、服从度、简洁程度和多轮对话稳定性。
对于已经进入生产环境的模型,这些体验指标并不次要。一个基准分数更高、但经常过度解释或长任务中途偏航的模型,未必比旧模型更适合真实业务。
2. 新模型可能服务于更细的成本分层
Anthropic 当前已经形成 Fable、Opus、Sonnet、Haiku 的能力和价格梯度。两个不同强度的 EAP 模型同时出现,可能是在测试新的性能成本点,而不是简单准备一个“最强模型”。
企业用户需要的往往不是所有请求都调用旗舰模型,而是让摘要、分类、代码审查和复杂推理分别落到合适的档位。谁能把模型做得更容易路由,谁就更容易进入长期工作流。
3. 安全回退可能继续成为模型发布的一部分
如果 marshmallow-ht-eap 回退到 Opus 4.8 的流量记录属实,那么测试内容可能不仅是能力,也包括在敏感任务触发时如何切换到更成熟的模型。
Anthropic 此前在 Fable 5 的官方说明中已经公开过类似做法:部分话题会转交给下一档模型处理。因此,未来判断一个 Claude 模型,不能只看它的主模型名称,还要看路由、分类器和回退逻辑。
对开发者来说,现在最合理的动作是什么?
答案可能有点无聊:不要提前迁移,也不要把内部代号写进生产配置。
Anthropic 官方文档明确说明,正式 Claude 模型 ID 对应固定版本。当前文档可查的正式 ID 包括 claude-fable-5、claude-opus-5、claude-sonnet-5 和 claude-haiku-4-5-20251001,并不包括 Marshmallow 或 Melon。
如果应用需要跟进新模型,更稳妥的方式是把模型 ID 放在配置层或路由层,而不是写死在业务代码里:
CLAUDE_FAST_MODEL=claude-sonnet-5
CLAUDE_STRONG_MODEL=claude-opus-5
CLAUDE_FRONTIER_MODEL=claude-fable-5
CLAUDE_FAST_MODEL=claude-sonnet-5
CLAUDE_STRONG_MODEL=claude-opus-5
CLAUDE_FRONTIER_MODEL=claude-fable-5
等新模型正式进入文档和控制台后,再通过灰度测试替换配置。这样即使模型命名、价格或接口能力发生变化,也不需要修改整个业务系统。
在 Apito 中,也建议只调用账号控制台当前真实可见的模型。平台展示的模型、价格和可用状态以控制台实时信息为准,不会因为社区出现一个内部代号,就把它包装成已经正式可用的产品。
比猜型号更值得看的,是模型发布方式的变化
Marshmallow 和 Melon 最后叫什么,甚至会不会正式发布,现在都没有答案。
但这场小小的代号风波已经暴露出一个更确定的变化:模型不再只以几个月一次的发布会形式演进,而是在白名单、客户端、路由器和安全系统里持续滚动测试。
我们看到的“泄露”,很多时候只是这条流水线上掉下来的一张标签。
标签可能被撕掉,产品可能被改名,checkpoint 也可能永远不会进入公开目录。真正稳定的判断标准仍然只有三个:官方模型文档是否出现、API 是否向目标账号真实开放、模型卡与价格是否已经明确。
在这三件事完成之前,可以关注 Marshmallow 和 Melon,但没必要急着为它们改代码。
FAQ
Claude Marshmallow 和 Claude Melon 已经发布了吗?
没有。截至 2026 年 8 月 25 日,Anthropic 官方模型目录和新闻中心尚未列出这两个名称。现有信息主要来自开发者社区截图和转述。
eap 是否代表 Early Access Program?
社区通常这样解释,但 Anthropic 没有针对这两个模型代号给出官方定义。因此可以把它理解为早期访问线索,不能据此推导正式发布时间。
Marshmallow 是 Opus 5.1 吗?
目前没有证据。Opus 5.1、Sonnet 5.1 和新 Haiku 都只是社区猜测,内部代号不一定与正式产品一一对应。
Marshmallow 真的比 Opus 5 强吗?
目前只有零散的主观体验评价,而且社区说法互相矛盾。没有公开、可复现的测试能够证明它在综合能力上超过 Opus 5。
现在可以通过 Claude API 调用这两个模型吗?
普通开发者不能把社区截图当成可用性依据。请以 Anthropic 官方模型列表或服务平台账号实际可见的模型为准。
生产系统应该如何准备新模型?
把模型 ID 放入环境变量或模型路由层,准备一组固定验收任务。正式模型开放后先做灰度测试,再决定是否替换现有模型。
参考资料
- Anthropic Newsroom
- Claude Platform:Models overview
- Claude Platform:Model IDs and versioning
- Claude Platform:Models API reference
- Introducing Claude Sonnet 5
- Claude Fable 5 and Claude Mythos 5
- 开发者社区关于 Marshmallow/Melon 的公开讨论汇总
- Chetaslua 对 Marshmallow API 记录的后续修正
- TokenPost:两款 Claude 实验模型在开发者社区出现
信息核验说明:本文中的 Marshmallow、Melon 和
marshmallow-ht-eap均属于尚未获 Anthropic 正式确认的社区线索。涉及产品名称、能力、价格和发布时间时,请以 Anthropic 官方公告与实时模型目录为准。



