惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Martin Fowler
Martin Fowler
D
DataBreaches.Net
F
Fortinet All Blogs
阮一峰的网络日志
阮一峰的网络日志
博客园_首页
Apple Machine Learning Research
Apple Machine Learning Research
H
Help Net Security
M
MIT News - Artificial intelligence
美团技术团队
人人都是产品经理
人人都是产品经理
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
The Cloudflare Blog
有赞技术团队
有赞技术团队
L
LangChain Blog
博客园 - Franky
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 【当耐特】
S
SegmentFault 最新的问题
V
Visual Studio Blog
Blog — PlanetScale
Blog — PlanetScale
Hugging Face - Blog
Hugging Face - Blog
B
Blog
I
InfoQ

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 谷歌开源“Agent Skill 超级工具箱”,云、库、引擎、AI全线打通,开发者狂喜 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来
Dropbox 与 GitHub 合作,将单体库大小从 87GB 缩减至 20GB
作者:Leela Kum · 2026-04-28 · via InfoQ - 促进软件开发领域知识与创新的传播

Dropbox 工程师通过解决 Git 存储和增量压缩模型的低效问题,将后端单体库的大小从 87GB 缩减至 20GB,从而提升了开发人员的工作效率和持续集成性能。该存储库是 Dropbox 各团队后端服务和共享库的中央集成点。这一举措的实施源于该存储库在扩展方面面临的挑战。

随着单体库(monorepo)规模的不断扩大,工程团队开始遇到克隆操作缓慢的问题,有时甚至需要超过一个小时才能完成;此外,由于反复获取和构建带来的开销,持续集成(CI)管道的性能也随之下降。规模的扩大还增加了触及存储库托管限制的风险。根据 Dropbox 工程团队的调查结果,该问题的主要原因不是大型二进制文件或意外提交,而是 Git 内部的压缩算法在处理大量相关文件集时的处理方式。

Git 会识别文件间的相似性并高效地存储差异,利用增量压缩来节省存储空间。在规模化应用中,Dropbox 工程师们发现,由这些启发式算法所生成的打包文件并不理想,存储库的增长规模与实际代码变更相比显得不成比例。预期增长与实际增长之间的偏差促使他们对存储行为进行了更深入的调查,而不仅仅是关注存储库内容本身。

正如 Dropbox 高级软件工程师 Ishan Mishra 所指出的那样:

这种增长速度与我们预期的正常开发活动不符,即便是以 Dropbox 的规模来看也是如此。这表明问题不仅在于我们存储了什么,还在于存储的方式。

该团队将存储库视为生产基础设施,并对存储模式进行了详细分析。他们实施了优化的打包策略,并调整了 Git 构建对象增量的方式,重点优化增量窗口和深度行为。由于在进行克隆和获取操作时,服务器端打包由 GitHub 基础设施管理,Dropbox 工程师与 GitHub 团队合作对这些参数进行了调优。为了降低运营风险,在正式部署前,这些更改已经在镜像环境中做过验证。

在 LinkedIn 上的一篇博文中, Shailesh Mishra 指出:“这是工具层面的假设与大规模代码库结构之间的冲突。”

经过这些优化,存储库大小从 87GB 缩减到了 20GB,降幅约为 77%。克隆时间从一个多小时缩短至 15 分钟以内。而且,由于数据传输和处理开销减少,持续集成(CI)管道的执行速度也得到了提升。这些改进还降低了触及存储库大小限制的可能性,并缩短了开发人员的入职时间。

Dropbox Git 数据大小缩减(图片来源:Dropbox 博文

Dropbox 工程师们强调,此次项目的主要经验在于:必须将版本控制系统视为关键基础设施,因为其存储行为会直接影响工程开发速度。该项目结合了工具层面的优化、与 GitHub 的跨组织协作以及分阶段验证,为的是在不干扰开发人员工作流的前提下确保部署安全。

声明:本文为 InfoQ 翻译,未经许可禁止转载。

原文链接:https://www.infoq.com/news/2026/04/dropbox-reduces-git-optimization/