InertiaRSS Track and read blogs, news, and tech you care about
Read Original Open in InertiaRSS

Recommended Feeds

WordPress大学
WordPress大学
博客园 - 司徒正美
小众软件
小众软件
H
Help Net Security
博客园 - 聂微东
宝玉的分享
宝玉的分享
Jina AI
Jina AI
酷 壳 – CoolShell
酷 壳 – CoolShell
阮一峰的网络日志
阮一峰的网络日志
M
MIT News - Artificial intelligence
博客园 - 【当耐特】
U
Unit 42
大猫的无限游戏
大猫的无限游戏
Apple Machine Learning Research
Apple Machine Learning Research
S
SegmentFault 最新的问题
腾讯CDC
MongoDB | Blog
MongoDB | Blog
云风的 BLOG
云风的 BLOG
J
Java Code Geeks
I
InfoQ
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Martin Fowler
Martin Fowler
博客园 - 三生石上(FineUI控件)
Vercel News
Vercel News

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了!
GitHub 利用 eBPF 消除部署风险,防止循环依赖导致故障失控
作者:Craig Ris · 2026-05-10 · via InfoQ - 促进软件开发领域知识与创新的传播

GitHub 近期公布了一种新的部署安全方案,通过利用 eBPF 来检测并阻止隐藏的循环依赖,从而避免系统在故障期间失去恢复能力。根据 GitHub 在最新工程博客中的介绍,这项技术能够在内核层面对部署流程的网络行为进行监控与限制,确保即便平台部分服务不可用,关键系统仍能够完成更新与修复。

这一创新主要解决了大型系统中的一个长期风险:循环依赖。所谓循环依赖,是指部署工具本身直接或间接依赖于它原本需要修复的服务。GitHub 举例称,某些部署脚本可能会尝试下载二进制文件、调用内部服务,或触发依赖 GitHub 自身的后台更新任务。一旦平台进入故障状态,这些依赖关系就可能形成级联问题,阻碍修复流程并延长故障持续时间。通过使用 eBPF 对部署进程进行隔离并控制其出站网络访问,GitHub 能够提前阻断此类调用,并在问题演变为事故之前将其暴露给工程团队。

该方案的核心在于 eBPF 能够在 Linux 内核中运行自定义程序,并挂载到网络请求等底层系统事件上。GitHub 利用这一能力,将部署脚本放入受控环境(cGroups)中,在其中对网络流量进行检查、过滤或按预定义规则阻断。这使平台能够在不影响整体系统或生产流量的情况下,实施细粒度、按进程划分的网络策略。

为了应对动态基础设施环境中的管理挑战,GitHub 还进一步扩展了这一方案,引入了具备 DNS 感知能力的过滤机制。系统通过拦截 DNS 查询并将其路由到代理层,可以基于域名而非静态 IP 地址来评估出站请求,因此在规模庞大且变化频繁的环境中更具适应性。与此同时,系统还能将被阻断的请求映射回具体进程与命令,让团队清楚了解问题由何触发,以及应如何修复。

传统循环依赖的识别往往依赖人工,并且通常只有在事故发生后才会暴露。GitHub 的方案则将这一过程转变为主动检测:只要某次部署引入了存在风险的依赖——无论是直接、隐藏还是短暂依赖——系统都会立即发出警告。这不仅降低了故障期间部署失败的概率,也通过确保修复路径始终可用,提升了平均恢复时间(MTTR)。

该系统经过六个月逐步推广,如今已被用于保护 GitHub 基础设施中的部署流程。此外,它还带来了额外收益,包括在部署期间审计出站请求,以及通过资源限制防止失控脚本影响生产负载。

GitHub 对 eBPF 的应用也反映出行业范围内一个更广泛的趋势:随着系统复杂性不断提高,越来越多组织开始转向内核级可观测性与控制能力。如今,eBPF 不再仅用于监控,还被用于运行时策略执行、安全强化以及实时系统行为管理。这种方式使平台团队能够突破传统应用层控制的限制,更深入地理解系统在真实环境中的运行状态。

这一实践也凸显了部署理念的重要演进:不仅要保证系统正常运行,更要确保系统在故障发生后依然具备恢复能力。随着平台之间的耦合程度不断提高,隐藏依赖可能产生难以预料的故障模式。通过将防护机制直接嵌入操作系统层,GitHub 展示了现代基础设施如何提升韧性,确保用于修复系统的工具本身不依赖于被修复的系统。

其他大型平台同样面临隐藏依赖与部署安全问题,并采用了类似但不完全相同的方法。例如,谷歌长期以来在内部系统(如 Bazel)中强调依赖隔离与“密封式构建(hermetic builds)”,确保构建与部署流程不依赖可能在故障期间失效的外部状态或运行时环境。这种设计天然降低了循环依赖风险,因为部署过程本身是可复现且自包含的。类似地,亚马逊云科技(AWS)则推广基于 Cell 的架构模式,将服务划分为彼此隔离的单元,以限制故障及其依赖关系的传播范围,从而确保即使部分系统退化,部署与恢复路径仍然可用。

在云原生生态中,Kubernetes 以及 Cilium 等网络层项目,也正在向内核与网络层面的运行时策略控制与可观测性演进,与 GitHub 利用 eBPF 的方向相似。与此同时,GitLab 则更关注流水线隔离与依赖控制,倡导在 CI/CD 执行过程中采用制品固定(artifact pinning)、离线 Runner 以及受限网络访问等实践。

在这些不同方案背后,可以看到一个共同趋势:领先平台不再单纯依赖流程规范或文档来避免循环依赖,而是将防护机制直接嵌入基础设施与执行环境之中,从而确保部署系统即使在故障条件下依然保持可靠。

原文链接:

https://www.infoq.com/news/2026/04/github-ebpf-deployment/