Fable 5 被暂停后重新部署:关于“越狱”的真实故事

Fable 5 被暂停后重新部署:关于“越狱”的真实故事

一份安全报告如何导致出口管制、短暂的全球停工,以及 Anthropic 在仔细检查后发现了什么

2026 年 7 月 1 日,Anthropic 在三周的暂停后,在全球范围内重新部署了其 Claude Fable 5 模型。这次暂停背后的故事提供了一个有用的视角,让我们实时了解人工智能安全、政府政策和安全研究如今是如何发生碰撞的。2026 年 7 月 3 日,随着该模型重新上线,澄清发生了什么是有价值的——因为简短的版本(“一位研究人员越狱了 Fable 5”)忽略了几乎所有重要的细节。

让我们从什么是 Fable 5 开始。Fable 5 是 Anthropic 的 Claude 5 系列模型之一,于 2026 年 6 月 9 日与功能更强大的同系列模型 Mythos 5 一同发布。与所有 Anthropic 的模型一样,两者都配备了分层的保护措施,旨在拒绝有害请求。引发这一系列事件的并不是一次戏剧性的黑客攻击,而是通过正规渠道提交的一份安全报告。

研究人员到底发现了什么

这一发现来自于 Amazon 的研究人员,而不是一个单独的个体。他们发现,如果你提示 Fable 5 识别软件漏洞,你可以让它跳出其预期的保护行为。在一个案例中,该模型生成了演示如何利用此类漏洞的代码。

这就是在重述中丢失的部分。它不是一个短语暗号、一种奇特的语言技巧或冗长的 Unicode 操控。这是一个处于真正边界区域的请求:这项工作与例行、合法的防御性网络安全(安全团队每天都在做的那种)严重重叠,但却可能越界提供漏洞利用的细节。

为什么该模型被完全撤下

这就涉及到政策问题了。2026 年 6 月 12 日,美国政府对 Fable 5 和 Mythos 5 都实施了出口管制,要求 Anthropic 限制外籍人员的访问。Anthropic 无法实时核实每个用户的国籍,因此为了不冒违反管制的风险,它向所有人暂停了这两个模型。

这是关键的微妙之处:Fable 5 下线并非因为它“坏了”。它下线是因为由安全报告引发的政府限制无法被选择性地执行——所以唯一合规的选择是在情况解决之前进行全面暂停。

Anthropic 仔细检查后发现了什么

Anthropic 自己的测试为任何认为这是一种独特的、特定于模型的危险的人提供了一个令人清醒的结果。能力较弱的模型也能识别相同的漏洞——包括 Claude Opus 4.8、GPT-5.5 和 Kimi K2.7。用 Anthropic 的话来说,它测试的每一个模型都能生成相同的演示,Claude Haiku 4.5 和 Sonnet 4.6 也在其中。

换句话说,报告的技术触及了与常规防御性安全工作相关的保护行为的“边界情况”,而且它并没有暴露任何其他系统缺乏的独特的、Mythos 级别的网络能力。这种重新定性很重要:问题在于如何在模糊的地带划清界限,而不是关于隐藏在一个模型内部的单一超级武器。

修复措施与回归之路

Anthropic 并没有简单地等待管制解除。它部署了一个改进的安全分类器,可以在超过 99% 的情况下阻止特定的 Amazon 报告的绕过。在此功能推出期间,受影响的请求被重新路由到 Claude Opus 4.8,并且用户收到了通知。

政策方面分阶段推进。2026 年 6 月 26 日,美国政府批准了选定的美国组织对 Mythos 5 的访问。6 月 30 日,出口管制被解除。7 月 1 日,Fable 5 在 Claude Platform、Claude.ai、Claude Code 和 Claude Cowork 上进行了全球重新部署,并在 7 月 7 日前,为 Pro、Max、Team 和 Enterprise 计划包含每周 50% 的使用率。

衡量严重程度的新方法

一个持久的成果是试图使这些判断不再是临时的。Anthropic 与 Amazon、Microsoft 和 Google 合作制定了一个评估越狱严重程度的共识框架。它衡量四个标准:能力提升、该能力提升的广度、武器化的容易程度以及可发现性。其目标是建立共享词汇表,以便整个行业能够在发现究竟是真正的紧急情况还是边界边缘情况时达成一致——正是这种区别让这次事件变得如此令人困惑。

为什么这影响深远,不仅限于一个模型

Fable 5 事件预演了 AI 事件将如何越来越多地展开。一份负责任的安全报告现在可能引发政府的出口管制、全球性的产品暂停、跨公司的测试以及新的行业标准——所有这些都在几周内发生。技术、监管和安全研究不再是相互独立的对话。

它也是一个提醒,“越狱”作为一个词承载了太多含义。这里发生的事情更接近于在一个真正灰色地带被披露的边缘情况,而不是一场灾难性的失败。系统、披露流程和政策响应都发挥了作用——虽然不完美,但它们起作用了。

结论

Amazon 研究人员报告说,可以提示 Fable 5 跨越防御性安全工作与漏洞利用之间的界限。该报告引发了美国的出口管制,Anthropic 无法选择性地执行该管制,因此暂停了全球范围内的 Fable 5 和 Mythos 5。经过仔细检查,其他模型也能做到同样的事情,所以风险是一个边缘的政策问题,而不是一项独特的能力。Anthropic 发布了一个分类器,在超过 99% 的情况下阻止了报告的绕过,管制被解除,Fable 5 于 2026 年 7 月 1 日回归——同时还伴随了一个评估越狱严重程度的全新跨行业框架。

优点

  • 澄清事实:发现者是 Amazon 的研究人员,引发事件的是出口管制,而不是模型故障
  • 表明负责任的披露按照预期发挥了作用,从报告到缓解
  • 证明所报告的行为并非 Fable 5 独有——较弱的模型也能做到
  • 强调了一个具体的修复措施:一个在超过 99% 的情况下阻止特定绕过的分类器
  • 引入了一个用于判断越狱严重程度的共享跨公司框架

缺点

  • 一次短暂的全球暂停干扰了这两个模型的每一位合法用户
  • 实时验证国籍是不可行的,迫使面对出口管制采取生硬的要么全有要么全无的回应
  • “边界”安全案例很难裁决,并可能引发不一致的政策反应
  • 公开讨论绕过行为,即使是负责任地披露,也可能招致模仿者的试探
  • 防御性安全和漏洞利用之间的重叠使得划定清晰的护栏变得极其困难

警告

本文中的名称、日期和技术细节取自 Anthropic 关于 Fable 5 和 Mythos 5 的公开发布声明。本文仅供教育参考,并非试图绕过任何 AI 安全系统的指南。安全系统和出口管制的存在是出于现实的法律和安全原因,试图规避它们违反了几乎所有 AI 平台的服务条款,并可能触犯法律。如果您研究 AI 系统,请通过官方渠道报告发现,而不是利用它们,并且在依赖本文之前核对本文中的任何主张与原始来源。

常见问题解答

  • 为什么 Claude Fable 5 在 2026 年 6 月被暂停?
  • 究竟是谁报告了 Fable 5 绕过事件?
  • 什么是出口管制,为什么它们导致了全球停工?
  • 所报告的漏洞是 Fable 5 独有的吗?
  • Anthropic 做了哪些改变来防止绕过?
  • Fable 5 什么时候重新上线的,在哪些平台上?
  • 什么是新的跨行业越狱严重程度框架?
  • 边界安全案例和真正的紧急情况有什么区别?

标签

#aiSafety #languageModels #cybersecurity #responsibleDisclosure #anthropic #machineLearning #exportControls

Free field guide

Kubernetes Security Checklist

Harden cluster access, workload identity, pod security, network boundaries, software supply chain, secrets, and operational monitoring.