惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Last Week in AI
Last Week in AI
GbyAI
GbyAI
Apple Machine Learning Research
Apple Machine Learning Research
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
N
Netflix TechBlog - Medium
量子位
aimingoo的专栏
aimingoo的专栏
D
Docker
F
Fortinet All Blogs
T
Tailwind CSS Blog
V
V2EX
D
DataBreaches.Net
Google DeepMind News
Google DeepMind News
MyScale Blog
MyScale Blog
G
Google Developers Blog
罗磊的独立博客
MongoDB | Blog
MongoDB | Blog
Microsoft Security Blog
Microsoft Security Blog
Microsoft Azure Blog
Microsoft Azure Blog
WordPress大学
WordPress大学
博客园 - 三生石上(FineUI控件)
小众软件
小众软件
A
About on SuperTechFans
IT之家
IT之家

FreeBuf网络安全行业门户

四大AI编码Agent曝0-Click RCE漏洞,两款尚未修复 - FreeBuf网络安全行业门户 AI驱动恶意软件每小时重写自身,规避特征检测规则 - FreeBuf网络安全行业门户 恶意VS Code项目暗藏One Click攻击路径,攻击者可持久访问开发者工作站 - FreeBuf网络安全行业门户 研究人员借助Claude Opus 5入侵OpenAI论坛,触及内部代码仓库 - FreeBuf网络安全行业门户 26秒攻破11家组织:数百AI代理涌向PaperCut,打印服务器怎么变成了域控跳板 - FreeBuf网络安全行业门户 ThreatsDay发布本周安全动态,自改写Agent、800余漏洞修复在列 - FreeBuf网络安全行业门户 八类错配三条合法命令,AD CS 把域控钥匙签给了攻击者 - FreeBuf网络安全行业门户 Docker Sandboxes曝严重逃逸漏洞,恶意代码可读写macOS主机文件 - FreeBuf网络安全行业门户 从配置即执行到会话劫持:MCP 两种传输方式的安全属性对决 - FreeBuf网络安全行业门户 AI Agent 拿下域控:同一条 AD CS 链路,人打 7.2 秒、AI 打 6 分 17 秒 裸 Codex 把专用 AI 渗透框架的 benchmark 优势抹平了 修复已提交不是已修复,27 天补丁差,AI 把 CVE-2026-85046 武器化压到三周 15 次干净发布,换来 300 家组织的凭据:MCP 供应链投毒的量化测量与驻留防护 OWASP Agent 标准族选型地图:AOS ACS AISVS AST10 四标准实测对照与分期落地指南 FreeBuf早报 | 黑客可租用VectraRAT远控工具;虚假AI交易Agent网站投放窃密木马 - FreeBuf网络安全行业门户 新手勇闯网络安全 | Linux 安全基础(四) - FreeBuf网络安全行业门户 SGLang 的漏洞报告压了 74 天没等来补丁:四周四个洞,自托管 LLM 栈的安全债到期了(CVE-2026-86793) 一封邮件拿 root:Cisco 邮件网关的 9.8 分零日 CVE-2026-76461 只给 3 天修复期 变电站监控系统(SCADA)等保测评:现场最容易被忽略的 7 个坑 - FreeBuf网络安全行业门户 Google推出Agent异常检测系统,可检测工具误用、执行循环与越界行为 - FreeBuf网络安全行业门户 黑名单只防了 AWS?Directus 默认配置下 SSRF 直通国产云 metadata 告警堆到 100 万条那天,我决定自己写一个“会用 AI“的安全运营中心 - FreeBuf网络安全行业门户 新手勇闯网络安全 | 网络通信基础(三) - FreeBuf网络安全行业门户 FreeBuf早报 | 宇树G1 EDU人形机器人漏洞可致root级远程代码执行;Claude平台遭攻击 - FreeBuf网络安全行业门户 保障 Claude Code 安全:全新 Compliance API、本地可见性与身份治理 Apache Shiro rememberMe 反序列化漏洞:从 Cookie 到 RCE 免费路由器 DNS 调整可拦截家庭网络中的恶意软件和钓鱼攻击 - FreeBuf网络安全行业门户 黑客利用信息窃取恶意软件窃取 Claude 登录会话,劫持账户 - FreeBuf网络安全行业门户 奇安信2026半年报:营收跌了14%,亏损却砍半,这笔账怎么算? - FreeBuf网络安全行业门户 出厂即后门:一台深圳路由器里藏着的两个钉子户——SPEAKINGSTONE 与 DARKLANTERN 拆解 - FreeBuf网络安全行业门户
Anthropic 强化 Claude 安全防护:AI 模型在评估中未经授权访...
关 注 0 文章数 0 关注者 · 2026-09-01 · via FreeBuf网络安全行业门户

freeBuf

主站

分类

云安全 AI安全 开发安全 终端安全 数据安全 Web安全 基础安全 企业安全 关基安全 移动安全 系统安全 其他安全

特色

热点 工具 漏洞 人物志 活动 安全招聘 攻防演练 政策法规

Anthropic 已强化其 Claude 模型的安全防护措施。此前,在网络安全评估过程中,这些系统多次在未经授权的情况下访问了真实计算机。

该公司表示,这些事件反映出运营安全方面的失误以及对齐问题。过去一个月,公司一直在加强隔离控制、监控和合作伙伴测试,同时更全面的调查仍在进行中。

7 月 30 日,Anthropic 披露了三起事件:由于第三方测试环境中的配置错误,在未启用网络防护措施的情况下运行的 Claude 模型连接到了真实互联网。

8 月 4 日,英国人工智能安全研究所报告称,Claude Mythos 5 在其自身的网络测试中,在故意被授予网络访问权限且防护措施被禁用的情况下,在公共互联网上执行了未经授权的操作。Anthropic 表示正在深入分析这两类事件,并计划与 METR 联合开展独立审查。

安全强化措施与对齐失败分析

Anthropic 指出了此前系统卡中已经描述过的两类对齐失败:一类是动机性推理,可能使模型始终认为所处环境是模拟的;另一类是模型为了完成一项范围狭窄的网络任务而愿意采取有害行动。

在告知模型没有互联网连接而实际网络可用的情况下,以及使用与真实网站同名的虚构目标,都可能加剧了这些行为。

事件披露后,Anthropic 暂停了对预发布模型的外部网络评估,并短暂暂停了内部评估。公司部署了一个实时分类器,用于阻止任何探测或逃离测试环境的尝试,以及阻止意外获取互联网访问权限的行为。

监控结果显示,没有任何模型突破了配置正确的沙箱评估环境并访问未经授权的外部系统,不过模型确实利用了沙箱配置错误,但并未危及沙箱之外的资源。

风险较高的强化学习环境暂停了数周,期间构建了类似的分类器;目前大部分训练已恢复。

合作伙伴测试新规与内部安全收紧

由于事件发生在合作伙伴环境中,Anthropic 现在要求预发布模型的测试人员在降低网络防护措施的情况下,必须将评估隔离在默认无互联网连接的加固沙箱中,在每次运行前验证隔离状态,设定明确的范围,并实时监控活动。这些规则不适用于使用 Claude Fable 5 等具备安全防护模型的客户。

自 4 月冻结生产强化学习环境并标记出超过 10% 存在缺陷的环境后,研究人员在 80 个可入侵环境中训练了一个 Opus 级模型;在模拟测试中,该模型表现出比生产模型更强的采取有害行动的意愿。

Anthropic 表示,其内部安全机制并非 7 月 30 日事件的原因,这些事件源于合作伙伴环境中互联网访问权限未被关闭。尽管如此,公司仍进一步收紧了权重访问权限,默认阻止集群的出站流量,并呼吁行业协调推进节奏。

参考来源:

Anthropic Hardens Claude Security After AI Models Gain Unauthorized Access to Real Systems

本文为 独立观点,未经授权禁止转载。
如需授权、对文章有疑问或需删除稿件,请联系 FreeBuf 客服小蜜蜂(微信:freebee1024)