Claude Fable 5.1 与 Mythos 5.1:一个你能用,另一个你用不了的前沿模型
Anthropic 于 2026 年 9 月 1 日发布 Claude Fable 5.1 与 Claude Mythos 5.1。两者使用同一个底层模型,但 safeguards 不同:Fable 5.1 面向所有用户开放,Mythos 5.1 则仅通过 Anthropic 的受信访问计划提供给经过审核的组织。
这次发布有两个看点。第一,Anthropic 声称 Fable 5.1 在长期 coding、research、文档、表格、幻灯片、视觉和 computer use 工作流上有明显提升。第二,Anthropic 通过降低 cache read 价格、改进安全路由、推出由客户控制的企业监控架构,试图让 Fable 级模型更适合生产环境。
早期社区反馈对困难、混乱的工作很兴奋,但对速度、使用额度、文风、safeguards、数据保留,以及单位价格下降是否真的会带来更低账单更加谨慎。最合理的判断是:Fable 5.1 更像专业工作引擎,而不是一个应该对每个 prompt 盲目开启的模型。
Anthropic 实际发布了什么
公开版本是 Claude Fable 5.1,API model ID 为 claude-fable-5-1。Claude Mythos 5.1 使用同一底层模型和规格,但只通过受信访问计划提供给部分网络安全与生命科学组织。
关键操作细节如下:
- 上下文窗口:1M tokens。
- 最大输出:128K tokens。
- Thinking:adaptive thinking 始终开启,通过
effort控制深度。 - 默认 effort:Claude Code 为
high,Claude.ai 和 Claude Cowork 为medium。 - 基础价格:每百万输入 token 10 美元,每百万输出 token 50 美元。
- Cache read:每百万 token 0.25 美元,是 Fable 5 价格的四分之一。
- Batch 价格:每百万输入 token 5 美元,每百万输出 token 25 美元。
- 可用平台:Claude API、Amazon Bedrock、Claude Platform on AWS、Google Cloud 和 Microsoft Foundry。
Anthropic 估计,按 token 计费的典型工作流成本约低 25%,高度 agentic 的工作最多可低约 45%。这是公司估算,不是独立成本研究。机制很明确:输入和输出基础价格与 Fable 5 相同,但 cache read 从每百万 token 1 美元降到 0.25 美元。反复读取稳定 prompt 或工具上下文的长期 agent 最可能受益。
Fable 5.1 还带有 Anthropic 的统计文本水印。Anthropic 表示它对读者不可见,不增加 token,不识别用户或组织,对速度影响可以忽略;检测 API 目前面向符合条件的组织私有预览。
能力提升:更适合长尾工作
Anthropic 的发布 benchmark 显示,Fable 5.1 相比 Fable 5 在 agentic coding、knowledge work、科学研究、computer use 和长周期问题解决上都有提升。官方表格中的部分数据如下:
| 评测 | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|
| Terminal-Bench 4.0,agentic coding | 55.8% | 42.0% | 52.3% |
| GDPval-AA v2,知识工作 | 1853 | 1723 | 1824 |
| OSWorld 2.0,strict | 41.7% | 36.1% | 39.6% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% |
这些数字必须结合脚注理解,而不是当成普遍适用的排行榜。Anthropic 说 Fable 5.1 使用生产 safeguards 测试;如果 safeguard 介入,一些任务会记为零分,或由 fallback 模型完成。OSWorld 使用评测作者在 2026 年 8 月发布的任务集,不能直接与早期 OSWorld 数字比较。Terminal-Bench-Science 0.1 的标准误约为 3.5–4.5 个百分点。
更有用的描述是:Fable 5.1 被设计为在任务不断展开时保持连贯。它可以映射大型代码库、跨多个服务追踪罕见故障、根据大量文档制定计划、运行实验、修改 artifact,并带着证据返回,而不只是给出一个看似合理的第一答案。
这也是它对 Claude Code 团队可能比对普通聊天用户更重要的原因。预期收益不一定是更会回答短问题,而是更少卡住、更少浅层修复、更好的根因分析,以及在数小时会话中更完整地交付 工作。
Fable 与 Mythos:一个模型,两套运行策略
最重要的产品区别不在原始智能,而在模型周围的 policy layer。
Fable 5.1 面向一般用途,它的 safeguards 比 Fable 5 更精确:
- 可以为了防御性工作识别源代码漏洞,但不会生成 exploit、执行 penetration testing 或进行基于二进制的漏洞扫描。
- Anthropic 称,在基础 biology 和医疗问题上,新 safeguards 对良性请求的介入比 Fable 5 发布时减少 85%。
- 双重用途 biology 与 chemistry research 仍可能被路由到 Opus 模型。
- Claude API 可能返回
stop_reason: "refusal"和stop_details.category;应用必须把它当作运行时结果处理,而不是认为每个 HTTP 200 都代表任务完成。
Mythos 5.1 是限制更少的版本,面向 Cyber Verification 和 Life Sciences Verification 计划中的批准参与者。访问仍然有限,Anthropic 目前表示只有一部分美国组织可以使用。Claude Security 也由 Mythos 5.1 驱动。
这解释了为什么 Fable 5.1 在某些 cyber 评测中会低于 Mythos 5.1,尽管二者共享同一模型:拒绝或 fallback 会改变测量结果。它也解释了为什么用户的实际体验可能不同于 headline capability——模型可能有能力完成任务,但公开产品不允许它完成。