













Google证实,在一次网络安全评估中,因测试环节失误导致Agent暴露在公网,旗下Gemini人工智能模型访问了三家企业的受保护系统。 这一事件表明,一旦管控措施、靶标定义、网络隔离机制失效,即便没有收到攻击企业的指令,自主AI系统也能越出沙箱范围。
本次测试由专门评估AI模型网络安全能力的企业Irregular执行。当时Gemini参与的是夺旗赛(CTF)测试,这类安全测试的规则是,参与方需要在模拟靶场环境中找到预设的隐藏信息。
按照测试要求,Gemini原本只需要调查与一家虚构企业相关的软件。但测试人员意外开启了本应禁用的公网连接,且这家虚构企业的名称恰好与一家真实组织重名。
两个问题叠加直接导致测试范围失效。Gemini误以为所有可通过公网访问的资产都属于授权测试范围,因此越过模拟环境,对企业系统发起访问。
据《华尔街日报》披露,其中一次测试中,该模型反复尝试猜测密码,最终成功登录一项受保护的服务。另外两次测试中,它在公开代码仓库中找到暴露的凭证,用这些凭证通过了另外两家企业系统的身份验证。
Google安全工程副总裁Heather Adkins表示,Gemini利用公开可获取的信息、猜测得到的凭证访问了相关网站,它当时误以为这些网站属于评估范围。Google称,在三起事件中,Gemini一旦意识到自己接触的是真实基础设施而非虚构测试靶标,就立刻停止了操作。Google强调事件未造成任何损失,同时不认为这一行为属于模型对齐失效,因为Gemini的安全防护机制最终中断了相关活动。
5月的测试结束后,Irregular于7月下旬将相关情况告知Google。Google随后通知了三家受影响的企业,并联合测试合作方调整了评估流程。 Heather Adkins表示,这些事件说明,能力强大的模型必须经过负责任行为训练。Irregular称,已修复己方存在的已知问题,调查过程中已联系相关AI实验室和受影响组织。
这类事件并非Google技术独有。Irregular开展的评估中,OpenAI、Anthropic、Meta开发的模型也曾意外获得公网访问权限,只是造成的后果各不相同。
例如Anthropic表示,其核查了141006次相关评估运行记录,共发现3起Claude模型访问真实组织基础设施的事件。Anthropic调查后发现,出现这一问题的原因是配置误解:尽管提示词已告知模型处于模拟环境中,但测试环境仍保留了真实公网连接能力。
对防守方而言,这一事件在新场景下再次印证了一个经典安全教训:提示词不是安全边界。仅仅告诉AI Agent它没有公网访问权限,完全无法替代出口过滤、严格白名单、隔离测试网络、持续监控等管控措施。 评估环境应当仅解析已授权域名,阻断任意出站连接。测试方需使用不会与真实实体重名的虚构组织作为靶标,同时配置仅在沙箱内有效的短期凭证。
OWASP同样给出安全建议:测试环境应采用最小权限工具,敏感操作需经过明确授权,留存完整审计日志,高影响操作必须有人工监督。 凭证防护措施同样关键。其中一家企业的服务因密码被猜解失守,另外两家则因公开代码仓库泄露机密信息被入侵。
企业应当强制启用多因素认证,对登录尝试设置速率限制,禁止密码复用。除此之外,还要持续扫描源代码仓库,排查泄露的令牌和密码。CISA警告,源代码中的硬编码凭证会大幅提升安全风险,建议企业使用密钥管理工具、扫描开发流程中的安全问题、部署可抵御钓鱼攻击的MFA。
Gemini主动停止操作的行为确实降低了事件后果,但不能将其作为主要的遏制管控措施。自主网络Agent的运行速度远超人类监督员,还可能以出人意料的方式快速解读模糊的目标指令。
因此,开展安全测试需要在模型外围设置分层管控措施:划定精准的授权边界,部署实时干预机制,留存不可篡改的审计日志;一旦Agent访问未授权资产,系统要能自动关停。
参考来源:
Google Gemini AI Hacked 3 Real Companies during a Cybersecurity Test
本文为 独立观点,未经授权禁止转载。
如需授权、对文章有疑问或需删除稿件,请联系 FreeBuf
客服小蜜蜂(微信:freebee1024)

此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。