Map-Reduce的工作机制

Mapper

“Map-Reduce”的思想就是“分而治之”

Mapper负责“分”，即把复杂的任务分解为若干个“简单的任务”而执行

“简单的任务”有几个意思：1、数据或计算规模相对于原任务要大大缩小；

2、就近计算，即会被分配到存放了所需数据的节点进行计算。

3、这些小任务可以并行计算，彼此间没有相互依赖的关系

Reduce

? 对map阶段的结果进行汇总
? Reducer的数目由mapred-site.xml配置文件里的项目mapred.reduce.tasks决定。缺
省值为1，用户可以覆盖之

Shuffler

? 在mapper和reducer中间的一个步骤（可以没有）
? 可以把mapper的输出按照某种key值重新切分和组合成n份，把key值符合某种范围的
输出送到特定的reducer那里去处理
? 可以简化reducer过程

时间： 2024-12-24 23:20:17

Map-Reduce的工作机制的相关文章

Map/Reduce 工作机制分析 --- 数据的流向分析

前言在MapReduce程序中,待处理的数据最开始是放在HDFS上的,这点无异议. 接下来,数据被会被送往一个个Map节点中去,这也无异议. 下面问题来了:数据在被Map节点处理完后,再何去何从呢? 这就是本文探讨的话题. Shuffle 在Map进行完计算后,将会让数据经过一个名为Shuffle的过程交给Reduce节点: 然后Reduce节点在收到了数据并完成了自己的计算后,会将结果输出到Hdfs. 那么,什么是Shuffle阶段,它具体做什么事情? 需要知道,这可是Hadoop最为核心的

Map/Reduce 工作机制分析 --- 作业的执行流程

前言从运行我们的 Map/Reduce 程序,到结果的提交,Hadoop 平台其实做了很多事情. 那么 Hadoop 平台到底做了什么事情,让 Map/Reduce 程序可以如此 "轻易" 地实现分布式运行? Map/Reduce 任务执行总流程经过之前的学习,我们已经知道一个 Map/Reduce 作业的总流程为: 代码编写 --> 作业配置 --> 作业提交 --> Map任务的分配和执行 --> 处理中间结果(Shuffle) --&

第九篇：Map/Reduce 工作机制分析 - 数据的流向分析

第九篇：Map/Reduce 工作机制分析 - 作业的执行流程

Map/Reduce工作原理

上图是论文里给出的流程图.一切都是从最上方的user program开始的,user program链接了MapReduce库,实现了最基本的Map函数和Reduce函数.图中执行的顺序都用数字标记了. 1.MapReduce库先把user program的输入文件划分为M份(M为用户定义),每一份通常有16MB到64MB,如图左方所示分成了split0~4:然后使用fork将用户进程拷贝到集群内其它机器上. 2.user program的副本中有一个称为master,其余称为worker,ma

MapReduce 工作机制剖析

MapReduce工作机制剖析: 1. 在集群中的任意一个节点提交MapReduce程序: 2. JobClient收到作业后,JobClient向JobTracker请求获取一个Job ID: 3. 将运行作业所需要的资源文件复制到HDFS上(包括MapReduce程序打包的JAR文件.配置文件和客户端计算所得的输入划分信息),这些文件都存放在JobTracker专门为该作业创建的文件夹中,文件夹名为该作业的Job ID: 4. 获得作业ID后,提交作业: 5.

分布式基础学习（2）分布式计算系统（Map/Reduce）

二. 分布式计算(Map/Reduce) 分布式式计算,同样是一个宽泛的概念,在这里,它狭义的指代,按Google Map/Reduce框架所设计的分布式框架.在Hadoop中,分布式文件系统,很大程度上,是为各种分布式计算需求所服务的.我们说分布式文件系统就是加了分布式的文件系统,类似的定义推广到分布式计算上,我们可以将其视为增加了分布式支持的计算函数.从计算的角度上看,Map/Reduce框架接受各种格式的键值对文件作为输入,读取计算后,最终生成自定义格式的输出文件. 而从分布式的角度

Map/Reduce个人实战--生成数据测试集

背景: 在大数据领域, 由于各方面的原因. 有时需要自己来生成测试数据集, 由于测试数据集较大, 因此采用Map/Reduce的方式去生成. 在这小编(mumuxinfei)结合自身的一些实战经历, 具体阐述下生成测试数据集的Map/Reduce程序该如何写? 场景构造: 假设某移动电信行业的某具体业务, 其记录了通话信息(包括拨打方/接听方/通话时间点/基站等要素). 产商是不可能提供真实的用户数据用于测试的, 但提供了基本的数据规格. 具体针对该业务场景, 我们简单规划如下: num1 v

一步一步跟我学习hadoop(5)----hadoop Map/Reduce教程（2）

Map/Reduce用户界面本节为用户採用框架要面对的各个环节提供了具体的描写叙述,旨在与帮助用户对实现.配置和调优进行具体的设置.然而,开发时候还是要相应着API进行相关操作. 首先我们须要了解Mapper和Reducer接口,应用通常须要提供map和reduce方法以实现他们. 接着我们须要对JobConf, JobClient,Partitioner,OutputCollector,Reporter,InputFormat,OutputFormat,OutputCommitter等进行讨

MapReduce工作机制

1 剖析MapReduce作业运行机制 1.1 作业的提交客户端通过JobClient.runJob()来提交一个作业到jobtracker,JobClient程序逻辑如下: a) 向Jobtracker请求一个新的job id (JobTracker.getNewJobId()): b) 检查作业的输出说明,如已存在抛错误给客户端:计算作业的输入分片: c) 将运行作业所需要的资源(包括作业jar文件,配置文件和计算所得的输入分片)复制到jobtracker的文件系统中以job id命名的目