IT技术博客大学习 共学习 共进步
全部 移动开发 后端 数据库 AI 算法 安全 DevOps 前端 设计 开发者

高效的大文件拷贝

将之典藏 2011-09-19 23:25:21 累计浏览 4,346 次
本机暂存

    译自:Efficiently copying files to multiple destinations

    当你要两台机器之间拷贝一些大文件的时候,把nc(netcat)和pigz(parallel gzip)组合起来会是一个简单高效的选择。不过,如果要把这些文件同时分发到多台机器,有什么好法子吗?在Tumblr,这还算蛮常见的需求,比如我们要快速的同时增加几台MySQL Slave的时候。

    你可以从源机器逐个拷贝到逐台目标机器,但是往往时间也是成倍的。或者你也可以同时从源机器同时拷贝到多个目标机器,但是受制于源机器的带宽等因素,速度并不见得真的很快。

    还好,借助一些UNIX工具可以做的更好。把tee和FIFO组合起来,可以形成一个文件快速分发链:处于分发链中的每台机器会保存文件,同时还分发给它的下一环。

    首先,选定一台目标机器做为分发链的最后一环,在这台机器上只需要用nc监听(假定端口是1234),再通过管道由pigz解压缩,继续通过管道把数据交由tar来分解。

nc -l 1234 | pigz -d | tar xvf -

    然后,再从分发链的末端往上走,设置其它目标机器,同样要经过监听、解压、分解,不过在解压之前我们通过tee命令将数据输出到命名管道(FIFO),另外的一条shell管道会将这些未解压的数据同时分发到分发链的下一环:

mkfifo myfifo
nc hostname_of_next_box 1234 nc -l 1234 | tee myfifo | pigz -d | tar xvf -

    最后,在源机器上启动分发链,让数据传输到分发链的第一环:

tar cv some_files | pigz | nc hostname_of_first_box 1234

    在我的测试中,分发链中的每台机器大概损失了3%-10%的性能(相对于1对1的拷贝而言),但是相对逐个逐个的拷贝或者单台机器向多台机器同时分发,效率提升是很明显的。

    ―

    延伸阅读:

  • 网络版瑞士军刀nc作弊条
  • Linux cloning over the network using netcat
  • 同分类推荐文章

    1. 从零重建 macOS 开发机:可复现的环境初始化流程 (2026-06-14 20:36:00)
    2. 百度物理网络监控工具开源第二弹:毫秒级监控工具 baize,让你的网络问题无处遁形 (2026-06-11 08:10:28)
    3. How to Set Up Homebrew Tap for Private CLI Tools: A Complete Guide (2026-05-27 02:13:03)

    查看更多 DevOps 文章 →

    建议继续学习

    1. 工作的技术含量和程序员的个人价值 (累计阅读 4,207)
    2. 使用scp命令在两台linux上对拷文件或者文件夹 (累计阅读 3,882)
    3. 在Linux下使用ftp命令 (累计阅读 3,812)
    4. 用pigz代替gzip (累计阅读 3,736)
    5. php的ftp函数简单应用 (累计阅读 3,346)
    6. 使用tar+lz4/pigz+ssh更快的数据传输 (累计阅读 3,288)
    7. Memcached的管理 (累计阅读 3,257)
    8. nc 传送文件 (累计阅读 2,683)
    9. shell 遍历mc (累计阅读 2,456)
    10. Nc 的妙用 (累计阅读 2,324)