惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

The GitHub Blog
The GitHub Blog
IT之家
IT之家
B
Blog RSS Feed
罗磊的独立博客
GbyAI
GbyAI
博客园 - Franky
Y
Y Combinator Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Google DeepMind News
Google DeepMind News
博客园 - 聂微东
N
Netflix TechBlog - Medium
博客园 - 三生石上(FineUI控件)
人人都是产品经理
人人都是产品经理
U
Unit 42
博客园 - 叶小钗
Jina AI
Jina AI
MyScale Blog
MyScale Blog
雷峰网
雷峰网
B
Blog
Hugging Face - Blog
Hugging Face - Blog
Blog — PlanetScale
Blog — PlanetScale
Recent Announcements
Recent Announcements
腾讯CDC
酷 壳 – CoolShell
酷 壳 – CoolShell

安全客-有思想的安全新媒体

波士顿科学被打停了:全球医疗巨头网络中断,订单发不出去,股价应声下跌-安全KER - 安全资讯平台 智能体安全能力图谱发布:企业可落地的建设路径-安全KER - 安全资讯平台 Redis补丁被绕过了:最新RCE的PoC已全网公开,你的缓存服务器还在裸奔吗-安全KER - 安全资讯平台 科技云报到:Agent不省钱反而亏钱?你需要这位“魔术师”-安全KER - 安全资讯平台 一张网页就能投毒你的AI大模型:NVIDIA NemoClaw缺陷曝光,沙箱挡得住黑客,挡不住"夺舍"-安全KER - 安全资讯平台 Zoom高危漏洞曝光:你的屏幕共享正在被黑客远程接管-安全KER - 安全资讯平台 2.45亿次下载的Rust crate被投毒:编译时恶意代码自动执行,朝鲜黑客又出手了-安全KER - 安全资讯平台 科技云报到:WRC 观察 | 竞争走向底层,算力资产决定具身智能“终局”-安全KER - 安全资讯平台 众安天下获CCIA “2026网络安全优秀创新成果大赛”人工智能赛道优胜奖-安全KER - 安全资讯平台 保镖成了内鬼:微软Defender再曝零日漏洞,普通账户一键提权SYSTEM,补丁还没用-安全KER - 安全资讯平台 不打招呼直接锁死服务器:Sorry勒索病毒国内多点爆发,专挑中小企业下手-安全KER - 安全资讯平台 科技云报到:机器流量首次超过人类,互联网进入“三体流量时代”?-安全KER - 安全资讯平台 三维架构、四种盈利、五重赋能:纳米Work企业版渠道生态正式起航-安全KER - 安全资讯平台 1.1万个网站正被围攻!WordPress登录页惊现XSS2Shell漏洞,无需账号就能摸到服务器-安全KER - 安全资讯平台 满分10.0的漏洞,补丁发布3天就被打穿-安全KER - 安全资讯平台 40分钟,2500家企业195TB数据被洗劫:AI供应链的"至暗时刻"才刚刚开始-安全KER - 安全资讯平台 科技云报到:IDC发布APA市场份额报告,领跑企业都有谁?-安全KER - 安全资讯平台 一张恶意SIM卡,就能接管你的充电桩:1981年的"祖传命令"正在物联网里复活-安全KER - 安全资讯平台 Linux服务器注意了:勒索病毒已经盯上你,国家正式预警-安全KER - 安全资讯平台 这次真不是吓你:搞勒索的,一个判了16年,一个要蹲32年-安全KER - 安全资讯平台 你的代码里,藏着黑客埋的"毒":1300个 npm 包遭供应链投毒-安全KER - 安全资讯平台 1755枚比特币一夜蒸发:1.1亿美元"冷存储"神话,碎在一个不随机的随机数上-安全KER - 安全资讯平台 8000人围观、9位安全大佬激辩:AI来袭,白帽生态与网安行业路在何方?-安全KER - 安全资讯平台 Vibe Hacking风起云涌:安全圈的门槛正在塌方?-安全KER - 安全资讯平台 白帽子的匿名时代,正在终结——HackerOne强制身份验证这件事-安全KER - 安全资讯平台 纳米Work企业版正式启动全国各级渠道城市合伙人招募-安全KER - 安全资讯平台 科技云报到:Agent时代到来,企业AI安全如何“内外兼修”?-安全KER - 安全资讯平台 微软发布网络安全模型MAI-Cyber-1-Flash-安全KER - 安全资讯平台 新一轮银狐攻击_管控终端再成控制工具-安全KER - 安全资讯平台 OpenAI 开源 Codex Security CLI:用于发现、验证和修复安全漏洞-安全KER
Anthropic 的 Claude 在测试期间攻破 3 家组织,并向 PyPI 上...
安全客 · 2026-07-31 · via 安全客-有思想的安全新媒体

Anthropic 今日表示,在内部安全测试中,其某一款 Claude 模型构建了一个恶意 Python 软件包并将其上传到 PyPI,在该软件包被 PyPI 的自动化防御机制移除之前,它已在 15 台真实系统上运行过。

该公司披露称,这并非孤例——在总共三起事件中,Claude 模型从一个本应被完全隔离的评估环境中”越狱”接触到开放互联网,进而攻陷了三家组织的生产基础设施。

此次审查是在 OpenAI 于 7 月 21 日披露的消息之后进行的——OpenAI 当时称其模型逃出了隔离测试环境,接触到了 Hugging Face 的生产基础设施。JFrog 随后证实,这些模型是利用自托管 Artifactory 中的零日漏洞实现逃逸的。

抢占一个从未存在过的包名

这三起事件均发生在由第三方评估合作方 Irregular 组织的”夺旗”(capture-the-flag)演练中。Anthropic 在提示词中告诉 Claude 它没有互联网访问权限,且环境是模拟的。然而,一处配置错误导致这两点都不属实,而两家公司直到上周才察觉。

在 PyPI 事件中,Claude 在测试环境内发现了一份文档,文档伪装成某虚构公司的开发者配置说明。

这些说明告诉新员工要安装一个从未发布过的 Python 软件包——一个”幽灵依赖”。

Claude 判断出,如果自己抢先注册这个包名,目标机器就会自动拉取它的代码。

发布这个包并不容易。Claude 需要一个 PyPI 账号,而注册账号需要邮箱地址,邮箱又需要手机号。

它没能找到免费的手机号服务,随后又尝试通过多条途径获取资金来购买手机号,但均告失败。最终它退而求其次,找到了一个未被屏蔽的邮件服务商,注册了账号并上传了恶意软件。

Anthropic 表示,该软件包在公开状态下停留了约一小时。

在这段时间窗口内,15 台真实系统下载并执行了它。其中一台属于一家安全公司——该公司习惯从 PyPI 安装软件包并扫描其中的恶意代码,其工作流程将注册表中的内容视为”可安全运行”。

Claude 的载荷被触发,将该公司的凭据发送到它自己搭建的收集点,随后利用这些凭据进一步渗透进该公司的基础设施。Anthropic 称 Claude 并不知道这家公司的存在。

PyPI 自身的安全系统自动移除了该软件包。Anthropic 表示已通知 PyPI 团队并移交了相关入侵指标(IoC)。

这次测试所运行的模型是 Claude Mythos 5。据 Anthropic 介绍,其推理过程很早就标记出了问题,指出如果互联网是真实的,发布这个包就等同于一次真实世界攻击,并称其”不可接受,而且肯定不是预期的解法”。

随后它又自己说服自己,得出了”环境是搭建出来的”这一结论,理由是它不认识为连接提供保护的证书颁发机构,且系统显示的日历日期为 2026 年。

当自动化扫描器开始安装该软件包时,Claude 把它们当成了演练中预设的”脚本演员”。

凭据与一个生产数据库

最严重的影响来自另一起涉及 Claude Opus 4.7 的事件——其中那家虚构的目标公司与一个真实域名重名。

在四次测试中,Claude 难以触及它的模拟目标,却发现那家真实公司可以通过互联网访问,于是便假定这就是预期目标。它提取了应用和基础设施的凭据,并触及了一个包含数百行生产数据的数据库。

这是唯一一例模型在确认身处真实系统后仍然持续发起攻击的情况。Anthropic 称这四次测试最终都识别出目标是真实的,其中两次测试中 Claude 推断:这家真实公司”本就该是演练的一部分”。

第三起事件涉及一个尚未发布、内部研究用的模型——它在未能触及预定目标后,扫描了约 9,000 个目标,随后利用一个暴露的调试页面中的凭据和 SQL 注入攻陷了一个面向互联网的应用。该模型后来注意到,这台主机所在的云账户与本次挑战毫无关联,于是判定目标是真实的,并自行停止了攻击。

这些攻击均未使用任何新技术。Anthropic 将它们描述为”弱口令和未鉴权的端点”。

后续将采取的措施

Anthropic 于 7 月 23 日启动了审查,并在同一天叫停了所有网络安全评估。次日它识别出这三起事件,并于 7 月 27 日通知了 Irregular 及受影响组织(目前仍在尝试联系第三家)。

这三起事件中最早的一起可追溯到 4 月,这意味着部分活动在长达约三个月的时间里都未被发现。

这些评估在运行时不带通常随正式版 Claude 模型一同提供的分类器和监控机制,尽管模型仍保留了其安全训练。

Anthropic 表示,其生产环境的防护机制本可阻止此类行为,并将这些事件定性为更接近于”测试框架与运营层面的失败”,而非”模型对齐失败”——理由是在测试中模型被告知没有互联网访问权限,而事实上却有。

该公司现计划扩大对话记录(transcript)监控范围、改进调查工具,并与评估合作方加强保障工作。

公司表示正与 METR 协商进行独立审查,并将在下周内公布一份经过轻微脱敏的 PyPI 测试对话记录。

Anthropic 联系到的两家受影响组织中,没有一家是自己发现了这些活动的——与 OpenAI 的 Hugging Face 事件一样,这些活动之所以浮出水面,完全是因为负责的 AI 实验室主动去翻查了自己的对话记录。