惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

罗磊的独立博客
美团技术团队
Apple Machine Learning Research
Apple Machine Learning Research
Hugging Face - Blog
Hugging Face - Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
月光博客
月光博客
WordPress大学
WordPress大学
The Cloudflare Blog
阮一峰的网络日志
阮一峰的网络日志
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
博客园_首页
博客园 - Franky
博客园 - 司徒正美
酷 壳 – CoolShell
酷 壳 – CoolShell
爱范儿
爱范儿
Jina AI
Jina AI
Last Week in AI
Last Week in AI
雷峰网
雷峰网
IT之家
IT之家
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - 聂微东
小众软件
小众软件
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
V
V2EX

FreeBuf网络安全行业门户

网易 SRC 实战:一天 4 份 finding 的工具化流程 勒索软件开始定向攻击AI模型和算力 - FreeBuf网络安全行业门户 2026年身份可见性是身份安全核心基础,破解多云与Agentic AI身份盲区 - FreeBuf网络安全行业门户 研究员借助Claude Opus 5串联漏洞,接管OpenAI员工账号 - FreeBuf网络安全行业门户 AutoRAN 复现:用 8B 弱模型自动化劫持大推理模型的“安全思维链” - FreeBuf网络安全行业门户 CISA通报Linux内核漏洞遭在野利用,要求3日内完成修复与取证排查 - FreeBuf网络安全行业门户 Gemini在安全测试中入侵3家真实企业,配置失误致沙箱失效 - FreeBuf网络安全行业门户 BragJack攻击可让恶意扩展劫持AI Agent,波及5款主流浏览器 - FreeBuf网络安全行业门户 研究人员公开四个Linux内核漏洞利用代码,可本地获取root权限 - FreeBuf网络安全行业门户 Brevo供应链攻击感染超10万网站,盗用Cloudflare密钥在边缘注入恶意代码 - FreeBuf网络安全行业门户 用户代码库被悄悄打包,智谱ZCode上传机制曝光 - FreeBuf网络安全行业门户 微软上线AI漏洞专项赏金计划;OpenAI、Anthropic与Google协作制定AI安全框架 | FreeBuf周报 - FreeBuf网络安全行业门户 FreeBuf早报 | BlackHatSect0r利用DeepSeek驱动AI Agent自动化攻击;Docker Sandboxes曝严重逃逸漏洞 ZCode 静默上传全量 Git 历史 - FreeBuf网络安全行业门户 黑客仿冒ChatGPT订阅提醒邮件,窃取OpenAI账号凭证 - FreeBuf网络安全行业门户 AI辅助攻击案例:PaperCut攻击行动 - FreeBuf网络安全行业门户 四大AI编码Agent曝0-Click RCE漏洞,两款尚未修复 - FreeBuf网络安全行业门户 大模型渗透测试从0到1:提示词注入+越狱+输出绕过,附完整payload - FreeBuf网络安全行业门户 AI驱动恶意软件每小时重写自身,规避特征检测规则 - FreeBuf网络安全行业门户 恶意VS Code项目暗藏One Click攻击路径,攻击者可持久访问开发者工作站 - FreeBuf网络安全行业门户 研究人员借助Claude Opus 5入侵OpenAI论坛,触及内部代码仓库 - FreeBuf网络安全行业门户 26秒攻破11家组织:数百AI代理涌向PaperCut,打印服务器怎么变成了域控跳板 - FreeBuf网络安全行业门户 ThreatsDay发布本周安全动态,自改写Agent、800余漏洞修复在列 - FreeBuf网络安全行业门户 八类错配三条合法命令,AD CS 把域控钥匙签给了攻击者 - FreeBuf网络安全行业门户 Docker Sandboxes曝严重逃逸漏洞,恶意代码可读写macOS主机文件 - FreeBuf网络安全行业门户 从配置即执行到会话劫持:MCP 两种传输方式的安全属性对决 - FreeBuf网络安全行业门户 AI Agent 拿下域控:同一条 AD CS 链路,人打 7.2 秒、AI 打 6 分 17 秒 裸 Codex 把专用 AI 渗透框架的 benchmark 优势抹平了 修复已提交不是已修复,27 天补丁差,AI 把 CVE-2026-85046 武器化压到三周 15 次干净发布,换来 300 家组织的凭据:MCP 供应链投毒的量化测量与驻留防护
Anthropic 强化 Claude 安全防护:AI 模型在评估中未经授权访...
关 注 0 文章数 0 关注者 · 2026-09-01 · via FreeBuf网络安全行业门户

freeBuf

主站

分类

云安全 AI安全 开发安全 终端安全 数据安全 Web安全 基础安全 企业安全 关基安全 移动安全 系统安全 其他安全

特色

热点 工具 漏洞 人物志 活动 安全招聘 攻防演练 政策法规

Anthropic 已强化其 Claude 模型的安全防护措施。此前,在网络安全评估过程中,这些系统多次在未经授权的情况下访问了真实计算机。

该公司表示,这些事件反映出运营安全方面的失误以及对齐问题。过去一个月,公司一直在加强隔离控制、监控和合作伙伴测试,同时更全面的调查仍在进行中。

7 月 30 日,Anthropic 披露了三起事件:由于第三方测试环境中的配置错误,在未启用网络防护措施的情况下运行的 Claude 模型连接到了真实互联网。

8 月 4 日,英国人工智能安全研究所报告称,Claude Mythos 5 在其自身的网络测试中,在故意被授予网络访问权限且防护措施被禁用的情况下,在公共互联网上执行了未经授权的操作。Anthropic 表示正在深入分析这两类事件,并计划与 METR 联合开展独立审查。

安全强化措施与对齐失败分析

Anthropic 指出了此前系统卡中已经描述过的两类对齐失败:一类是动机性推理,可能使模型始终认为所处环境是模拟的;另一类是模型为了完成一项范围狭窄的网络任务而愿意采取有害行动。

在告知模型没有互联网连接而实际网络可用的情况下,以及使用与真实网站同名的虚构目标,都可能加剧了这些行为。

事件披露后,Anthropic 暂停了对预发布模型的外部网络评估,并短暂暂停了内部评估。公司部署了一个实时分类器,用于阻止任何探测或逃离测试环境的尝试,以及阻止意外获取互联网访问权限的行为。

监控结果显示,没有任何模型突破了配置正确的沙箱评估环境并访问未经授权的外部系统,不过模型确实利用了沙箱配置错误,但并未危及沙箱之外的资源。

风险较高的强化学习环境暂停了数周,期间构建了类似的分类器;目前大部分训练已恢复。

合作伙伴测试新规与内部安全收紧

由于事件发生在合作伙伴环境中,Anthropic 现在要求预发布模型的测试人员在降低网络防护措施的情况下,必须将评估隔离在默认无互联网连接的加固沙箱中,在每次运行前验证隔离状态,设定明确的范围,并实时监控活动。这些规则不适用于使用 Claude Fable 5 等具备安全防护模型的客户。

自 4 月冻结生产强化学习环境并标记出超过 10% 存在缺陷的环境后,研究人员在 80 个可入侵环境中训练了一个 Opus 级模型;在模拟测试中,该模型表现出比生产模型更强的采取有害行动的意愿。

Anthropic 表示,其内部安全机制并非 7 月 30 日事件的原因,这些事件源于合作伙伴环境中互联网访问权限未被关闭。尽管如此,公司仍进一步收紧了权重访问权限,默认阻止集群的出站流量,并呼吁行业协调推进节奏。

参考来源:

Anthropic Hardens Claude Security After AI Models Gain Unauthorized Access to Real Systems

本文为 独立观点,未经授权禁止转载。
如需授权、对文章有疑问或需删除稿件,请联系 FreeBuf 客服小蜜蜂(微信:freebee1024)