文章摘要
美国政府在6月12日对Claude Fable 5和Mythos 5模型实施出口管制,导致暂停访问。6月30日管制解除,Fable 5将于7月1日恢复全球使用,Mythos 5已获准向部分美国组织开放。
文章总结
6月12日,美国政府对我们最新的模型Claude Fable 5和Claude Mythos 5实施了出口管制,要求我们限制外国公民的访问权限。由于命令立即生效且我们无法实时验证国籍,因此暂停了所有用户对这两个模型的访问。
截至6月30日,对Fable 5和Mythos 5的出口管制已解除。
Fable 5将于7月1日起在全球范围内通过Claude平台、Claude.ai、Claude Code和Claude Cowork向用户开放。对于Pro、Max、Team及部分Enterprise计划用户,截至7月7日,Fable 5将包含在每周使用限额的50%以内,之后将通过使用积分提供。我们将尽快恢复在AWS、Google Cloud和Microsoft Foundry上的访问。
我们还根据美国政府6月26日的批准,恢复了一组美国组织对Mythos 5的访问权限。我们继续与政府协调,以扩大Glasswing项目中更广泛的国内和国际合作伙伴的访问权限。
在本文的其余部分,我们将在四个方面提供更多细节和更新:
- 事件时间线及我们安全措施的更新:讨论导致出口管制指令的事件,以及我们如何通过新的安全措施来应对。
- 我们的一般安全方法:提供更多背景信息,说明我们如何使用安全分类器来检测模型潜在的危险网络安全用途。
- 共享行业框架:尽管我们已经达成了建设性的解决方案,但这些事件表明,行业需要一种一致的方法来评估和修复AI模型的潜在“越狱”问题。与亚马逊、微软、谷歌和其他Glasswing合作伙伴一起,我们已开始制定这样一个框架,并在下文概述。
- 更深层次的政府合作:我们正在加强与美国政府在预发布测试、信息共享和研究合作方面的合作水平。
时间线与安全措施更新
我们于6月9日发布了Fable 5和Mythos 5。它们共享相同的基础模型,但Fable 5配备了强大的安全措施,使其更安全地用于一般用途。而安全措施较少的Mythos 5仅向少数值得信赖的Project Glasswing合作伙伴发布,用于防御性网络安全。
6月12日的出口管制指令是在政府得知一份报告后发布的,该报告称亚马逊研究人员发现了一种绕过Fable 5安全措施的方法:通过提示让模型识别多个软件漏洞。在一个案例中,模型生成了演示如何利用相关漏洞的代码。过去两周,我们与政府及其他合作伙伴(包括亚马逊)密切合作,审查了该报告和证据。
我们的测试证实,许多能力较弱的模型——包括Claude Opus 4.8、GPT-5.5和Kimi K2.7——也能识别出Fable 5在报告中发现的相同漏洞。在演示如何利用单个漏洞方面,我们测试的每个模型都能产生与Fable 5相同的演示。
重要的是,报告中的技术并未暴露任何独特的Mythos级网络能力。该行为反映了Fable 5安全措施的一个边界案例——如下所述,有些任务不太可能危险,但出于谨慎考虑仍被安全措施阻止。报告中的技术允许访问这样一种行为,但这仅涉及常规的防御性网络安全工作。
尽管如此,我们迅速采取行动解决了报告的绕过问题。与政府密切合作,我们训练了一个改进的安全分类器,用于定位并阻止报告中描述的行为。如果Fable 5的请求被阻止,用户将收到通知,并且该请求将被发送到Opus 4.8。
新的分类器意味着亚马逊报告中描述的特定技术在超过99%的情况下被阻止。在极少数情况下,模型可能提供的信息不足以帮助网络攻击者。如下所述,模型的安全措施并不期望阻止所有低风险的常规网络防御能力——只阻止那些可能有害的。美国商务部AI标准与创新中心的研究人员测试了我们之前和新的安全措施,并认为它们非常强大。
新的分类器还带来了在常规编码和调试任务中更频繁地标记良性请求的代价。与所有安全措施一样,我们将继续完善它,以更好地区分真正的滥用和合法请求,并减少误报。
我们的网络安全安全措施方法
Claude Mythos 5在发现和利用软件漏洞方面比任何其他模型都更有效——甚至超过除最熟练的人类安全专家之外的所有人。这些强大的网络安全能力使其对希望在网络攻击中滥用它的恶意行为者具有独特的吸引力。
然而,Claude Fable 5并不提供这种独特的攻击能力。这是因为我们在发布时为其配备了有史以来最强大的安全措施。在发布前的一个月,我们从Anthropic内部各个团队调动人员,使从事此问题的研究人员和工程师数量翻倍。
Fable 5发布时配备了多种安全机制,每种机制单独并不能提供完美的防御,但结合起来使模型非常难以被滥用。一些防御措施涉及训练模型拒绝协助危险请求;其他措施则涉及追溯分析滥用模式。
一个特别重要的安全机制涉及分类器——较小的自动化AI系统,在交互过程中检测模型是否被要求执行可能有害的网络安全任务。当这种情况发生时,分类器会阻止模型响应请求。这些分类器的最终目标是防止模型参与独特危险的行为。
与所有安全机制一样,分类器也会犯错。它们有时未能注意到潜在危险的内容,在某些情况下可能被故意“越狱”:用户以不寻常的方式提示模型以欺骗分类器,使模型产生本应被阻止的有害输出。
因此,我们故意将安全分类器设置为触发一组我们知道可能良性的请求。这种“安全边际”方法意味着请求必须看起来非常安全才能避免触发分类器。用户将安全边际体验为模型拒绝响应一些合理、无害的请求。
对于Fable 5,我们将安全边际设置得比以往任何发布都大得多,这意味着更多良性请求将被阻止。我们理解这类误报会让用户感到沮丧,但为了广泛提供模型的其他能力,我们做出了这种权衡。
我们的网络安全安全分类器示意图。
当向模型发出请求时,分类器检测它是良性的(允许)还是可能有害的(阻止)。分类器阻止模糊请求(那些明显与网络安全相关但可能用于防御目的的请求,如查找安全漏洞)和有害请求(那些明显危险的请求,如构建软件漏洞链的请求)。如A行所示,我们还包含一个“安全边际”,分类器将阻止可能良性但有一定可能性有害的请求。这增加了我们对所有有害请求都将被阻止的信心。对于Fable 5(B行),我们使安全边际更大,意味着更多良性请求将被阻止——但更少的真正有害请求会被遗漏。
安全边际还有助于缓解越狱。许多越狱是狭窄的:它们只解锁非常特定的模型行为,而不是更多。在某些情况下,假设的用户可以以轻微方式越狱模型并侵入安全边际,但无法达到我们旨在阻止的核心有害行为。我们认为,迄今为止报告的Fable 5越狱属于这种轻微类别。
更严重的越狱会解锁更多有害行为。狭窄的有害越狱可以引发一些特定的有害行为。这些越狱通常严重程度较低到中等,因为狭窄性限制了攻击者。最令人担忧的类别是通用越狱,它会解锁广泛的有害行为。
越狱如何与我们的安全分类器交互。
在轻微越狱的情况下,分类器不会阻止请求,但请求仍在我们安全边际内,因此极不可能有害。在狭窄的有害越狱中,提示突破了分类器并解锁了模型的特定有害行为。在通用越狱中,提示解锁了整类有害行为。
正如我们在发布Fable 5时指出的,可能不可能使任何AI模型完全稳健。我们预计我们的模型会发现一些越狱,并且它们的严重程度会有所不同:会有许多轻微越狱,一些狭窄的有害越狱,尽管在撰写本文时尚未发现Fable 5的通用越狱,但专家安全研究人员仍在对其进行红队测试。我们力求确保我们和我们的安全合作伙伴将首先发现重大越狱并在恶意行为者利用它们造成伤害之前修复它们。
上述谨慎方法意味着绝大多数越狱不会成功解锁危险行为。我们的分类器使成功的越狱成本高昂且需要大量努力才能产生,即使越狱成功,我们的额外防御层也提供了额外的缓解措施。随着我们对新型越狱技术的了解,我们将继续更新分类器。
越狱的共识行业框架
目前AI行业对于如何客观描述AI越狱的严重程度没有共识。每当发现新的越狱技术时,这增加了大量不确定性:开发者没有商定的标准来确定哪些发现最需要紧急关注,政府也没有商定的标准来决定何时采取行动。
这个问题在未来几个月将变得更加严重,因为更多具有强大网络安全能力的模型将被训练、评估和发布。评估AI越狱的通用标准将帮助我们和其他公司安全地发布新模型,并允许用户充分利用其先进能力。
因此,我们正在与亚马逊、微软、谷歌和其他Glasswing合作伙伴合作,起草一个评估AI越狱严重程度以及AI开发者应如何应对的共识框架。我们邀请其他行业合作伙伴和模型提供商加入我们的努力。
我们目前的提议是根据以下四个不同标准对给定的越狱进行评分。前两个描述了越狱为攻击者提供了什么;后两个描述了越狱能多快成为现实世界的问题:
- 能力增益:越狱将用户带到多远超出现有工具?如果现有的广泛可用工具可以达到与越狱模型相同的能力,这里的分数会低;如果越狱解锁了即使领域专家也能显著加速的模型能力,分数会高。
- 能力增益的广度:相同的越狱技术适用于多少不同的攻击任务?越狱只允许模型追求狭窄目标的情况得分低;相同的越狱技术适用于多个不同目标或技术的情况得分高。
- 武器化难易程度:将越狱转化为攻击需要多少人力?如果越狱涉及大量熟练的提示和多次重试,得分低;如果越狱在单个提示或第一次或第二次尝试中有效,得分高。
- 可发现性:某人获得该技术的难易程度如何?如果需要专业知识,得分低;如果已经广泛知晓并在线可用,得分高。
我们提议使用这个严重性框架来校准我们对新发现越狱的响应。对于最严重的越狱类别,我们将在确认严重性后立即开始部署初步缓解措施。我们还在创建一个团队,提供对关键越狱提交渠道的24/7监控。
任何评分越狱的方法都不会完美。尽管如此,通过通用框架传达给定发现的近似严重性是有价值的。这是一项正在进行的工作;随着我们从更多合作伙伴那里获得反馈,我们预计框架会随着时间的推移而演变。
我们预计很快会分享关于提议框架的更多细节。同时,我们正在启动一个新的HackerOne计划,安全研究人员可以提交他们在Fable 5中发现的潜在网络越狱供我们审查。
与美国政府在尖端AI安全方面的合作
过去十周,Anthropic与美国政府密切合作,制定了6月2日行政命令中反映的方法。我们的合作涉及国家网络总监办公室、科技政策办公室、财政部、商务部以及相关国家安全机构。
我们致力于继续这项工作,建立在近两年与美国政府合作伙伴在部署前测试和评估方面的现有合作基础上。以下承诺反映了现有工作以及我们在上述框架最终确定时扩大政府合作的新提议:
- 预发布政府访问和评估:对于在国家安全相关领域实质性推进能力前沿的模型,我们将向指定的政府合作伙伴提供模型及其安全措施的扩展早期访问。这些合作伙伴可以在广泛发布前进行独立能力评估并测试我们的护栏。我们将派遣Anthropic技术人员在这些测试期间与政府评估人员一起工作。
- 关于安全措施的快速信息共享:当发现重大越狱或滥用模式时,我们将迅速调查、分类并通知相应的政府对应方。我们将分享我们为响应而构建的新安全措施,以便进行独立测试。我们还将提前向政府合作伙伴提供我们的威胁情报报告,并参与根据6月2日行政命令第2(d)条建立的跨机构网络安全漏洞信息交换所。
- 联合研究的专用资源:我们正在大幅扩大与政府合作伙伴在AI安全方面的联合工作。我们将建立专门的Anthropic团队来处理共同的政府优先事项,提供大量计算分配以支持政府测试和研究,并提供我们的安全和红队专业知识以帮助推进AI评估的最新技术水平。
- 共同的行业标准:我们将与政府和行业同行合作,为前沿模型提供商制定共享的、自愿的安全和评估标准。我们将贡献评估、工具和最佳实践,政府可以在整个领域应用。
我们希望这种合作,连同我们提议的共识行业框架,将成为整个行业系统性规则的基础——甚至为有效的全球协调AI风险和收益提供模板。
这些规则应被编纂为强有力的法规,并平等地适用于所有前沿模型开发者。政府参与AI发布需要一个持久、透明的过程,为网络防御者和其他人提供他们关于访问强大模型所需的确定性。
我们期待以上述方式深化我们的政府合作。我们也感谢用户在此次中断期间的耐心,以及与我们合作使Fable 5和Mythos 5再次可用的研究人员和行业合作伙伴。
评论总结
根据评论内容,总结如下:
主要观点与论据:
积极欢迎恢复访问(评分:无,作者:BatFastard、anhtudev、trunnell)
- 用户对Fable 5恢复访问表示欢迎,认为这是“理智回归”。
- 关键引用:BatFastard: "Yeah! I only knew it for 3 days but I was starting to fall in love!";trunnell: "Hooray! Glad everyone came to their senses and we can all get on with business."
对长期可用性和商业模式持怀疑态度(评分:无,作者:steveadams86、mil22、rcr-anti)
- 担忧有限使用模式会持续,Opus价格将逐步淘汰,成本不可持续。
- 关键引用:steveadams86: "I have the sense that this limited usage model will persist... eventually the cost of these models will be unsustainable and impractical.";mil22: "The party will be short-lived.";rcr-anti: "I fail to see the point of consumer subscriptions now... Minimax M3 and GLM 5.2 are comfortably in Opus 4.5-4.8 territory but 1/5th-1/20th the price."
对安全与监管的批评(评分:无,作者:tekacs、nl)
- 认为安全护栏应逐步取消,并批评政府决策过程混乱。
- 关键引用:tekacs: "I really hope that one day we reach a point where we feel confident enough... to get rid of these safeguards.";nl: "The administration decision making is just wacky... they just seem to make it up as they go."
对模型能力与替代方案的比较(评分:无,作者:sparkling、rcr-anti)
- 指出其他模型(如Kimi K2.7、Minimax M3)也能完成类似任务,且价格更低。
- 关键引用:sparkling: "That is nice advertising for Kimi, huh?";rcr-anti: "Minimax M3 and GLM 5.2 are comfortably in Opus 4.5-4.8 territory but 1/5th-1/20th the price."
对Fable 5版本一致性的担忧(评分:无,作者:teruakohatu、twall)
- 希望恢复的版本与之前相同,无额外限制;对部分任务回退到Opus 4.8表示失望。
- 关键引用:teruakohatu: "I hope the redeployed Fable 5 is the same as the version they pulled without any substantially increased restrictions.";twall: "some routine tasks like coding and debugging will fall back to Opus 4.8... disappointed but not surprised."
平衡性总结: - 正面观点:部分用户对恢复访问感到高兴,认为这是积极进展。 - 负面观点:多数用户对商业模式、安全限制、政府决策和模型一致性持批评或怀疑态度,认为长期价值有限,并转向更便宜、更可靠的替代方案。