惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Engineering at Meta
Engineering at Meta
J
Java Code Geeks
I
InfoQ
腾讯CDC
Vercel News
Vercel News
IT之家
IT之家
V
Visual Studio Blog
P
Proofpoint News Feed
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
G
Google Developers Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
博客园 - 叶小钗
有赞技术团队
有赞技术团队
月光博客
月光博客
Martin Fowler
Martin Fowler
量子位
L
LangChain Blog
B
Blog
Last Week in AI
Last Week in AI
博客园 - 司徒正美
Microsoft Security Blog
Microsoft Security Blog
博客园 - 聂微东
Microsoft Azure Blog
Microsoft Azure Blog
A
About on SuperTechFans

暗无天日

读:AI Agent 安全日志——从可见性与隐私的两难说起 - 暗无天日 AI写作的语言指纹——如何让文字不那么像机器 - 暗无天日 读:50 条 Claude Code 技巧——一个工程经理的六个月使用心得 读:AI 辅助开发为什么让 E2E 测试更有价值 - 暗无天日 读:在Emacs中使用Claude Code(Spacemacs适配版) - 暗无天日 Claude Code 背后的工程哲学——读 Agent Harness Engineering 读:Agent Harness Engineering——AI 智能体不只是模型,还有套件 - 暗无天日 browser-harness:让 AI 直接接管你的浏览器 - 暗无天日 读:Security-First CI/CD —— DevSecOps 自动化实践指南 TIL: 数字小键盘的小数点陷阱与行内算术求值 - 暗无天日 读:Immutability 不是万能药,它是一种权衡 - 暗无天日 Conducty:给 Claude Code 加上项目记忆和并行执行能力 - 暗无天日 读 — GitHub Trending 里的 Claude Code 技能包 读 — Prompt Caching 省钱指南 TIL: Emacs 中那些跟鼠标配合的冷门快捷键 - 暗无天日 读:Anvil——把 Emacs 变成 AI 的工具服务器 读:Emacs 代码折叠终极指南 - 暗无天日 读:Clojure 搭车客指南 - 暗无天日 git推送失败后恢复仓库损坏的完整记录 - 暗无天日 多智能体系统的两个有效模式——以及对 Claude Code 用户的启示 - 暗无天日 用 Org Babel 写 Literate 博文:扩展执行 + 定制导出 proced:Emacs 内置的进程查看器 - 暗无天日 从 proced 定制中学到的 Elisp 模式 读:让 Emacs proced 在 macOS 上显示 CPU 和内存 异步编程的函数着色税 - 暗无天日 链式调用的代价:JavaScript 和 Clojure 的共同教训 - 暗无天日 hyperfine:命令行基准测试工具 - 暗无天日 管道中的变量去哪了?——子 shell 作用域陷阱 - 暗无天日 开源包装器的信任陷阱:四个危险信号 - 暗无天日 程序员愿意为 AI 写文档,却不愿为同事写 - 暗无天日
TIL: 用 parallel 加速 rsync 迁移海量小文件
2026-05-14 · via 暗无天日

存储迁移时,真正头疼的不是几个大文件,而是目录树里塞满的几万、几十万个小文件。 rsync 可以用来进行文件迁移,但它是单线程的,也就是说一个文件处理完才处理下一个。小文件的问题在于每个文件都要 stat 、比较、传输,这套固定开销跟文件大小无关。文件越小,传输本身越快,但 stat 和校验的时间一点没少,结果就是大部分时间花在排队上,磁盘反而闲着。TecMint 的一篇文章给出了用 GNU parallel 把 rsync 并行化的方案。

是什么

核心思路:把源目录的顶层子目录分给多个 rsync 同时跑,让磁盘 I/O 队列不空等。

本地拷贝:

find /source/directory -mindepth 1 -maxdepth 1 -type d | \
  parallel -j 4 rsync -a {} /destination/directory/

跨网络同步(存储迁移更常见的场景):

find /source/directory -mindepth 1 -maxdepth 1 -type d | \
  parallel -j 4 rsync -az {} user@remote:/destination/directory/

pipeline 分三步:

  1. find -mindepth 1 -maxdepth 1 -type d 列出源目录的顶层子目录
  2. parallel -j 4 同时启动 4 个 rsync 进程, {} 被替换为每个子目录路径
  3. rsync -a 以归档模式同步每个子目录到目标( -z 额外启用压缩,远程传输时有用)

为什么有效

rsync 单线程处理大文件时,瓶颈在磁盘 I/O 读写速度,大部分时间花在实际传输数据上。但处理小文件时,大部分时间花在文件系统的元数据操作(stat、open、close)和 rsync 自己的校验逻辑上,真正传数据的时间反而少。并行化让多个 rsync 同时处理不同子目录,stat 等一个文件的时候另一个 rsync 已经在传数据了,磁盘闲不下来。

注意事项

  1. -j 的值没有万能公式,从 4 开始试,跑的时候看 iostat%utilawait ,磁盘利用率没满就往上加,满了就减。机械盘(HDD)通常扛不住太多并发,SSD 和网络存储可以高一些
  2. 这个方案按顶层子目录分片。如果文件全平铺在一个目录里(没有子目录), find 只会返回一条结果,等于没有并行。这种情况按文件名分片:

    find /source -type f | split -l 1000 - /tmp/chunk.
    parallel -j 4 'rsync -a --files-from={} / /destination/' ::: /tmp/chunk.*
    
  3. 迁移完成后跑一次 rsync -avnc (dry-run + checksum 模式),它会逐文件校验但不动数据,只报差异。比 sha256sum 快得多,几十万文件也不怕。如果想更省时间,抽检关键目录也行