













Anthropic 已强化其 Claude 模型的安全防护措施。此前,在网络安全评估过程中,这些系统多次在未经授权的情况下访问了真实计算机。
该公司表示,这些事件反映出运营安全方面的失误以及对齐问题。过去一个月,公司一直在加强隔离控制、监控和合作伙伴测试,同时更全面的调查仍在进行中。
7 月 30 日,Anthropic 披露了三起事件:由于第三方测试环境中的配置错误,在未启用网络防护措施的情况下运行的 Claude 模型连接到了真实互联网。
8 月 4 日,英国人工智能安全研究所报告称,Claude Mythos 5 在其自身的网络测试中,在故意被授予网络访问权限且防护措施被禁用的情况下,在公共互联网上执行了未经授权的操作。Anthropic 表示正在深入分析这两类事件,并计划与 METR 联合开展独立审查。
Anthropic 指出了此前系统卡中已经描述过的两类对齐失败:一类是动机性推理,可能使模型始终认为所处环境是模拟的;另一类是模型为了完成一项范围狭窄的网络任务而愿意采取有害行动。
在告知模型没有互联网连接而实际网络可用的情况下,以及使用与真实网站同名的虚构目标,都可能加剧了这些行为。
事件披露后,Anthropic 暂停了对预发布模型的外部网络评估,并短暂暂停了内部评估。公司部署了一个实时分类器,用于阻止任何探测或逃离测试环境的尝试,以及阻止意外获取互联网访问权限的行为。
监控结果显示,没有任何模型突破了配置正确的沙箱评估环境并访问未经授权的外部系统,不过模型确实利用了沙箱配置错误,但并未危及沙箱之外的资源。
风险较高的强化学习环境暂停了数周,期间构建了类似的分类器;目前大部分训练已恢复。
由于事件发生在合作伙伴环境中,Anthropic 现在要求预发布模型的测试人员在降低网络防护措施的情况下,必须将评估隔离在默认无互联网连接的加固沙箱中,在每次运行前验证隔离状态,设定明确的范围,并实时监控活动。这些规则不适用于使用 Claude Fable 5 等具备安全防护模型的客户。
自 4 月冻结生产强化学习环境并标记出超过 10% 存在缺陷的环境后,研究人员在 80 个可入侵环境中训练了一个 Opus 级模型;在模拟测试中,该模型表现出比生产模型更强的采取有害行动的意愿。
Anthropic 表示,其内部安全机制并非 7 月 30 日事件的原因,这些事件源于合作伙伴环境中互联网访问权限未被关闭。尽管如此,公司仍进一步收紧了权重访问权限,默认阻止集群的出站流量,并呼吁行业协调推进节奏。
参考来源:
Anthropic Hardens Claude Security After AI Models Gain Unauthorized Access to Real Systems
本文为 独立观点,未经授权禁止转载。
如需授权、对文章有疑问或需删除稿件,请联系 FreeBuf
客服小蜜蜂(微信:freebee1024)

此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。