跳到主要内容

Claude Fable 5.1 与 Mythos 5.1:一个你能用,另一个你用不了的前沿模型

· 阅读需 12 分钟
Claude Dev
Claude Dev

Anthropic 于 2026 年 9 月 1 日发布 Claude Fable 5.1Claude Mythos 5.1。两者使用同一个底层模型,但 safeguards 不同:Fable 5.1 面向所有用户开放,Mythos 5.1 则仅通过 Anthropic 的受信访问计划提供给经过审核的组织。

这次发布有两个看点。第一,Anthropic 声称 Fable 5.1 在长期 coding、research、文档、表格、幻灯片、视觉和 computer use 工作流上有明显提升。第二,Anthropic 通过降低 cache read 价格、改进安全路由、推出由客户控制的企业监控架构,试图让 Fable 级模型更适合生产环境。

早期社区反馈对困难、混乱的工作很兴奋,但对速度、使用额度、文风、safeguards、数据保留,以及单位价格下降是否真的会带来更低账单更加谨慎。最合理的判断是:Fable 5.1 更像专业工作引擎,而不是一个应该对每个 prompt 盲目开启的模型。

Anthropic 实际发布了什么

公开版本是 Claude Fable 5.1,API model ID 为 claude-fable-5-1Claude Mythos 5.1 使用同一底层模型和规格,但只通过受信访问计划提供给部分网络安全与生命科学组织。

关键操作细节如下:

  • 上下文窗口:1M tokens。
  • 最大输出:128K tokens。
  • Thinking:adaptive thinking 始终开启,通过 effort 控制深度。
  • 默认 effort:Claude Code 为 high,Claude.ai 和 Claude Cowork 为 medium
  • 基础价格:每百万输入 token 10 美元,每百万输出 token 50 美元。
  • Cache read:每百万 token 0.25 美元,是 Fable 5 价格的四分之一。
  • Batch 价格:每百万输入 token 5 美元,每百万输出 token 25 美元。
  • 可用平台:Claude API、Amazon Bedrock、Claude Platform on AWS、Google Cloud 和 Microsoft Foundry。

Anthropic 估计,按 token 计费的典型工作流成本约低 25%,高度 agentic 的工作最多可低约 45%。这是公司估算,不是独立成本研究。机制很明确:输入和输出基础价格与 Fable 5 相同,但 cache read 从每百万 token 1 美元降到 0.25 美元。反复读取稳定 prompt 或工具上下文的长期 agent 最可能受益。

Fable 5.1 还带有 Anthropic 的统计文本水印。Anthropic 表示它对读者不可见,不增加 token,不识别用户或组织,对速度影响可以忽略;检测 API 目前面向符合条件的组织私有预览。

能力提升:更适合长尾工作

Anthropic 的发布 benchmark 显示,Fable 5.1 相比 Fable 5 在 agentic coding、knowledge work、科学研究、computer use 和长周期问题解决上都有提升。官方表格中的部分数据如下:

评测Fable 5.1Fable 5Opus 5
Terminal-Bench 4.0,agentic coding55.8%42.0%52.3%
GDPval-AA v2,知识工作185317231824
OSWorld 2.0,strict41.7%36.1%39.6%
CursorBench 3.2.073.4%70.5%70.0%

这些数字必须结合脚注理解,而不是当成普遍适用的排行榜。Anthropic 说 Fable 5.1 使用生产 safeguards 测试;如果 safeguard 介入,一些任务会记为零分,或由 fallback 模型完成。OSWorld 使用评测作者在 2026 年 8 月发布的任务集,不能直接与早期 OSWorld 数字比较。Terminal-Bench-Science 0.1 的标准误约为 3.5–4.5 个百分点。

更有用的描述是:Fable 5.1 被设计为在任务不断展开时保持连贯。它可以映射大型代码库、跨多个服务追踪罕见故障、根据大量文档制定计划、运行实验、修改 artifact,并带着证据返回,而不只是给出一个看似合理的第一答案。

这也是它对 Claude Code 团队可能比对普通聊天用户更重要的原因。预期收益不一定是更会回答短问题,而是更少卡住、更少浅层修复、更好的根因分析,以及在数小时会话中更完整地交付工作。

Fable 与 Mythos:一个模型,两套运行策略

最重要的产品区别不在原始智能,而在模型周围的 policy layer。

Fable 5.1 面向一般用途,它的 safeguards 比 Fable 5 更精确:

  • 可以为了防御性工作识别源代码漏洞,但不会生成 exploit、执行 penetration testing 或进行基于二进制的漏洞扫描。
  • Anthropic 称,在基础 biology 和医疗问题上,新 safeguards 对良性请求的介入比 Fable 5 发布时减少 85%
  • 双重用途 biology 与 chemistry research 仍可能被路由到 Opus 模型。
  • Claude API 可能返回 stop_reason: "refusal"stop_details.category;应用必须把它当作运行时结果处理,而不是认为每个 HTTP 200 都代表任务完成。

Mythos 5.1 是限制更少的版本,面向 Cyber Verification 和 Life Sciences Verification 计划中的批准参与者。访问仍然有限,Anthropic 目前表示只有一部分美国组织可以使用。Claude Security 也由 Mythos 5.1 驱动。

这解释了为什么 Fable 5.1 在某些 cyber 评测中会低于 Mythos 5.1,尽管二者共享同一模型:拒绝或 fallback 会改变测量结果。它也解释了为什么用户的实际体验可能不同于 headline capability——模型可能有能力完成任务,但公开产品不允许它完成。

企业隐私也是本次发布的一部分

Fable 5.1 和 Mythos 5.1 默认要求 30 天数据保留,不会自动适用于 zero-data-retention 安排。组织在发送专有代码、受监管记录或敏感研究数据前,应确认资格和不同平台的条款。

Anthropic 同时推出 Enterprise Frontier Safeguards(EFS)。按已公布的设计,客户可以把活动数据存储在自己控制的云基础设施中,使用自己的加密密钥、访问策略和审计日志。自动安全监控仍可识别严重滥用模式,但默认由客户团队而不是 Anthropic 负责人工复核。EFS 将从 2026 年秋季开始分阶段推出。

这回应了企业的一个核心问题:不仅是模型是否足够聪明,还包括日志由谁保存、谁可以查看,以及安全告警由谁负责。在 EFS 或明确获批的 zero-retention 安排生效前,不要把 Fable 5.1 当成与 ZDR 模型等价。

社区怎么说

发布后几天的反馈不是受控评测,但足以看出产品成功的地方,以及期待与运行时之间的冲突。

正面信号:混乱上下文与困难工作

在 r/claude 一篇高互动的上手报告中,用户称赞模型更能在大量混乱文件中定位调用链,更愿意指出请求的修改会破坏系统其他部分,处理长文档更强,而且对简单问题的回答更短。同一报告也指出:面对最近变化的网页,仍需明确要求搜索;模糊 prompt 仍可能导致错误行动;要模仿用户文风仍需提供样例。

这很好地描述了它的可能甜蜜点:当任务包含隐藏依赖、相互冲突的证据或很长的决策链时,Fable 5.1 更有帮助。它并不能替代最新检索、清晰规格或人类判断。

实际顾虑:速度与额度消耗

r/ClaudeAI 的发布讨论区既有兴奋,也有用户立即反馈 Fable 5.1 更慢、更消耗上下文,或只发几个 prompt 就触及五小时 session limit。r/ClaudeCode 中还有用户称,一次长 code review 的结果很好,但大约 30 分钟就到达 100% usage marker。其他用户在类似工作中报告了更低的周使用量,因此目前不足以称之为经过测量的退化或提升。

最公平的结论是:Fable 5.1 可能在“每个完成任务”的成本上更高效,但在“每个交互 session”上仍然更昂贵。两件事可以同时成立:更好的推理减少了重试,但 adaptive thinking 和长 tool loop 也可能在结果出现前消耗大量订阅额度。

Hacker News 信号:能力不等于可用性

Hacker News 的发布讨论获得了异常高的参与度。评论并不只谈 benchmark,也质疑 pay-as-you-go agent 的经济性、Fable 相对于 Opus 5 的价值、30 天保留、safeguard fallback,以及输出是否过于密集或冗长。

也有相反的正面反馈:一些开发者称 Fable 5.1 在早期会卡住或引入新 bug 的困难任务上取得了进展。这类证据值得收集,但应该通过可重放的任务集,而不是单个惊艳案例来验证。

跨 Reddit 和 Hacker News,当前共识是有条件的:

  • 有希望:长周期 coding、跨文件推理、根因分析、research 和文档密集型工作。
  • 尚未定论:交互式写作风格、延迟、token 消耗和小型一次性任务。
  • 有风险:网络安全、生命科学研究、专有数据,以及依赖稳定 model identity 的工作流。

开发者迁移清单

从 Fable 5 或 Opus 5 迁移,不只是换 model ID。

1. 更新模型并重新运行真实评测

model = "claude-fable-5"    # before
model = "claude-fable-5-1" # after

准备一套包含长 coding 任务、失败任务、tool loop、refusal 和日常 prompt 的 replay set,测量完成质量、耗时、输入/输出 token、cache hit 和 fallback 频率。

2. 删除不受支持的控制项

Adaptive thinking 始终开启。thinking: {"type": "enabled", "budget_tokens": N} 等手动配置,以及关闭 thinking,都会返回错误。使用 effort 控制预算,并重新评估 max_tokens

tool_choice: {"type": "any"}{"type": "tool", ...} 这类强制工具选择也不受支持。使用 tool_choice: {"type": "auto"}、strict tool schema 或 structured outputs,并通过明确指令说明何时必须调用工具。

3. 把会话历史视为 append-only

Fable 5.1 的 thinking block 与此前的 system prompt、tools 和 conversation history 绑定。修改旧 turn、重建 system prompt 或改变 tools 数组,可能使后续 thinking block 失效,并在新账号上触发 400 错误。

把新指令放进 mid-conversation system message,用 server-side compaction 或 context editing 裁剪上下文,并明确选择 prefix_mismatch_behavior。如果框架每轮重写 messages 数组,应该在发送生产流量前完成迁移测试。

4. 修正 agent loop 假设

Fable 5.1 可能在每轮只发一个 tool call,而 Fable 5 会批量发送多个;它在长运行中也可能显示更少的进度更新。如果 UI 依赖过程播报,应在支持的 beta 流程中请求 thinking.display: "updates",并把非空 thinking block 作为进度文本渲染,而不是原始 chain of thought。

对于相互独立的读取,明确要求模型批量调用工具,否则一个正确的工作流也可能仅仅因为 round trip 增多而变慢、变贵。

5. 为 refusal 与 fallback 做设计

记录请求模型、实际响应模型(如果可用)、stop_reasonstop_details.category、token 使用量和 fallback 决策。可以考虑 Anthropic 的默认 fallback 或经过测试的客户端重试。不要假设成功的 HTTP response 就代表请求的模型完成了任务。

我们的判断:把 Fable 5.1 当作升级层

Anthropic 的模型总览建议大多数工作先使用 Opus 5,只有当任务要求更高、持续时间更长,或 Opus 在更高 effort 下仍然失败时,才使用 Fable 5.1。这是合理的路由策略:

  • Sonnet 5:常规实现、小型重构、广泛自动化和成本敏感的执行。
  • Opus 5:复杂工程与企业工作的默认选择。
  • Fable 5.1:大型迁移、困难调试、长期 research、文档密集型分析,以及重复失败成本高于模型费用的任务。
  • Mythos 5.1:需要更宽松 policy surface 的、经过批准的网络安全和生命科学工作流。

社区反馈也支持这个路由模型。Fable 5.1 最有价值的地方,似乎是阻止错误方向、保持长计划连贯,或找到便宜模型遗漏的根因。对短答案、常规编辑,或延迟和额度比最大深度更重要的交互 session,则更难证明它值得。

结论

Claude Fable 5.1 是 Anthropic 最新的公开前沿模型,Mythos 5.1 是它的受信访问版本。它在 autonomous work 真正重要的地方有可信提升:长上下文、多步骤 coding、research、computer use 和复杂 artifact 生成。对反复读取同一上下文的 agent 来说,cache-read 价格降低 75% 可能和 benchmark 提升一样重要。

但这次发布也让 runtime policy 无法被忽略。Fable 5.1 可能更慢、更吃额度,在敏感任务上 fallback,要求 30 天数据保留,并改变自定义 API 客户端处理工具和 thinking block 的方式。正确的采用策略是选择性迁移:用自己的困难任务做 benchmark,测量每个完成结果的成本,在路由中保留 Opus 与 Sonnet,并在企业上线前确认隐私和 safeguards 行为。

Fable 5.1 不只是“最聪明的 Claude”。它是模型、安全策略、计费模型和会话状态契约共同组成的产品。把这四部分一起评估,团队才能知道升级是否值得。

参考来源