高效的大文件拷贝

当你要两台机器之间拷贝一些大文件的时候，把nc(netcat)和pigz(parallel gzip)组合起来会是一个简单和高效的选择。不过，如果要把这些文件同时分发到多台机器，有什么好法子吗？在Tumblr，这还算蛮常见的需求，比如我们要快速的同时增加几台MySQL Slave的时候。

你可以从源机器逐个拷贝到逐台目标机器，但是往往时间也是成倍的。或者你也可以同时从源机器同时拷贝到多个目标机器，但是受制于源机器的带宽等因素，速度并不见得真的很快。

还好，借助一些UNIX工具可以做的更好。把tee和FIFO组合起来，可以形成一个文件快速分发链：处于分发链中的每台机器会保存文件，同时还分发给它的下一环。

首先，选定一台目标机器做为分发链的最后一环，在这台机器上只需要用nc监听(假定端口是1234)，再通过管道由pigz解压缩，继续通过管道把数据交由tar来分解。

然后，再从分发链的末端往上走，设置其它目标机器，同样要经过监听、解压、分解，不过在解压之前我们通过tee命令将数据输出到命名管道(FIFO)，另外的一条shell管道会将这些未解压的数据同时分发到分发链的下一环：

最后，在源机器上启动分发链，让数据传输到分发链的第一环：

在我的测试中，分发链中的每台机器大概损失了3%-10%的性能(相对于1对1的拷贝而言)，但是相对逐个逐个的拷贝或者单台机器向多台机器同时分发，效率提升是很明显的。

时间： 2024-10-05 23:23:08

C# IO操作（四）大文件拷贝（文件流的使用）、文件编码