MapReduce的原理及执行过程

MapReduce简介

MapReduce是一种分布式计算模型，是Google提出的，主要用于搜索领域，解决海量数据的计算问题。
MR有两个阶段组成：Map和Reduce，用户只需实现map()和reduce()两个函数，即可实现分布式计算。

MapReduce执行流程

MapReduce原理

MapReduce的执行步骤：

1、Map任务处理

　　1.1 读取HDFS中的文件。每一行解析成一个<k,v>。每一个键值对调用一次map函数。 <0,hello you> <10,hello me>

　　1.2 覆盖map()，接收1.1产生的<k,v>，进行处理，转换为新的<k,v>输出。　　　　　　　　　　<hello,1> <you,1> <hello,1> <me,1>

　　1.3 对1.2输出的<k,v>进行分区。默认分为一个区。详见《Partitioner》

　　1.4 对不同分区中的数据进行排序（按照k）、分组。分组指的是相同key的value放到一个集合中。　排序后：<hello,{1,1}><me,{1}><you,{1}>

　　1.5 （可选）对分组后的数据进行归约。详见《Combiner》

2、Reduce任务处理

　　2.1 多个map任务的输出，按照不同的分区，通过网络copy到不同的reduce节点上。（shuffle）详见《shuffle过程分析》

　　2.2 对多个map的输出进行合并、排序。覆盖reduce函数，接收的是分组后的数据，实现自己的业务逻辑，　<hello,2> <me,1> <you,1>

　　　　处理后，产生新的<k,v>输出。

　　2.3 对reduce输出的<k,v>写到HDFS中。

Java代码实现

注：要导入org.apache.hadoop.fs.FileUtil.java。

1、先创建一个hello文件，上传到HDFS中

2、然后再编写代码，实现文件中的单词个数统计（代码中被注释掉的代码，是可以省略的，不省略也行）

  1 package mapreduce;
  2
  3 import java.net.URI;
  4 import org.apache.hadoop.conf.Configuration;
  5 import org.apache.hadoop.fs.FileSystem;
  6 import org.apache.hadoop.fs.Path;
  7 import org.apache.hadoop.io.LongWritable;
  8 import org.apache.hadoop.io.Text;
  9 import org.apache.hadoop.mapreduce.Job;
 10 import org.apache.hadoop.mapreduce.Mapper;
 11 import org.apache.hadoop.mapreduce.Reducer;
 12 import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
 13 import org.apache.hadoop.mapreduce.lib.input.TextInputFormat;
 14 import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;
 15 import org.apache.hadoop.mapreduce.lib.output.TextOutputFormat;
 16
 17 public class WordCountApp {
 18     static final String INPUT_PATH = "hdfs://chaoren:9000/hello";
 19     static final String OUT_PATH = "hdfs://chaoren:9000/out";
 20
 21     public static void main(String[] args) throws Exception {
 22         Configuration conf = new Configuration();
 23         FileSystem fileSystem = FileSystem.get(new URI(INPUT_PATH), conf);
 24         Path outPath = new Path(OUT_PATH);
 25         if (fileSystem.exists(outPath)) {
 26             fileSystem.delete(outPath, true);
 27         }
 28
 29         Job job = new Job(conf, WordCountApp.class.getSimpleName());
 30
 31         // 1.1指定读取的文件位于哪里
 32         FileInputFormat.setInputPaths(job, INPUT_PATH);
 33         // 指定如何对输入的文件进行格式化，把输入文件每一行解析成键值对
 34         //job.setInputFormatClass(TextInputFormat.class);
 35
 36         // 1.2指定自定义的map类
 37         job.setMapperClass(MyMapper.class);
 38         // map输出的<k,v>类型。如果<k3,v3>的类型与<k2,v2>类型一致，则可以省略
 39         //job.setOutputKeyClass(Text.class);
 40         //job.setOutputValueClass(LongWritable.class);
 41
 42         // 1.3分区
 43         //job.setPartitionerClass(org.apache.hadoop.mapreduce.lib.partition.HashPartitioner.class);
 44         // 有一个reduce任务运行
 45         //job.setNumReduceTasks(1);
 46
 47         // 1.4排序、分组
 48
 49         // 1.5归约
 50
 51         // 2.2指定自定义reduce类
 52         job.setReducerClass(MyReducer.class);
 53         // 指定reduce的输出类型
 54         job.setOutputKeyClass(Text.class);
 55         job.setOutputValueClass(LongWritable.class);
 56
 57         // 2.3指定写出到哪里
 58         FileOutputFormat.setOutputPath(job, outPath);
 59         // 指定输出文件的格式化类
 60         //job.setOutputFormatClass(TextOutputFormat.class);
 61
 62         // 把job提交给jobtracker运行
 63         job.waitForCompletion(true);
 64     }
 65
 66     /**
 67      *
 68      * KEYIN     即K1     表示行的偏移量
 69      * VALUEIN     即V1     表示行文本内容
 70      * KEYOUT     即K2     表示行中出现的单词
 71      * VALUEOUT 即V2        表示行中出现的单词的次数，固定值1
 72      *
 73      */
 74     static class MyMapper extends
 75             Mapper<LongWritable, Text, Text, LongWritable> {
 76         protected void map(LongWritable k1, Text v1, Context context)
 77                 throws java.io.IOException, InterruptedException {
 78             String[] splited = v1.toString().split("\t");
 79             for (String word : splited) {
 80                 context.write(new Text(word), new LongWritable(1));
 81             }
 82         };
 83     }
 84
 85     /**
 86      * KEYIN     即K2     表示行中出现的单词
 87      * VALUEIN     即V2     表示出现的单词的次数
 88      * KEYOUT     即K3     表示行中出现的不同单词
 89      * VALUEOUT 即V3     表示行中出现的不同单词的总次数
 90      */
 91     static class MyReducer extends
 92             Reducer<Text, LongWritable, Text, LongWritable> {
 93         protected void reduce(Text k2, java.lang.Iterable<LongWritable> v2s,
 94                 Context ctx) throws java.io.IOException,
 95                 InterruptedException {
 96             long times = 0L;
 97             for (LongWritable count : v2s) {
 98                 times += count.get();
 99             }
100             ctx.write(k2, new LongWritable(times));
101         };
102     }
103 }

3、运行成功后，可以在Linux中查看操作的结果

原文地址：https://www.cnblogs.com/xiaotime/p/9458708.html

时间： 2024-10-10 08:49:24

MapReduce的原理及执行过程的相关文章

通过源码了解ASP.NET MVC 几种Filter的执行过程

一.前言之前也阅读过MVC的源码,并了解过各个模块的运行原理和执行过程,但都没有形成文章(所以也忘得特别快),总感觉分析源码是大神的工作,而且很多人觉得平时根本不需要知道这些,会用就行了.其实阅读源码是个很好的习惯,它不只停留在知道怎么用的阶段,而是让我们知道一系列的为什么,为什么这样设计,为什么这样使用....很多朋友应该看过<asp.net x 框架揭秘>这本书,确实不错,特别是边看源码边看书,可以有不小的收获.Ok,我不是大神,我只是心血来潮想看一下源码! 二.几种常见的Filter

MapReduce概述,原理,执行过程

MapReduce概述 MapReduce是一种分布式计算模型,运行时不会在一台机器上运行.hadoop是分布式的,它是运行在很多的TaskTracker之上的. 在我们的TaskTracker上面跑的是Map或者是Reduce Task任务. 通常我们在部署hadoop taskTracker 的时候,我们的TaskTracker同时还是我们的Datanode节点.datanode和tasktracker总是部署在一起的. MapReduce执行流程: 为什么要有多个datanode: 因为我

MapReduce执行过程

一.基本执行过程 MapReduce过程分为两个阶段:map函数阶段和reduce函数阶段 (1)map函数是用来筛选掉非需要的数据,以键值对的形式输出,键为文件位置偏移量,值为待分析的数据,map函数核心目的是形成对数据的索引,以供reduce函数方便对数据进行分析. (2)reduce函数以Map函数的输出数据为数据源,对数据进行相应的分析,输出结果为最终的目标数据. 二.实际应用中的分布式执行过程 (1)一个map.一个reduce (2)多个map节点.一个reduce (3)多个map

Hadoop MapReduce执行过程详解（带hadoop例子）

https://my.oschina.net/itblog/blog/275294 摘要: 本文通过一个例子,详细介绍Hadoop 的 MapReduce过程. 分析MapReduce执行过程 MapReduce运行的时候,会通过Mapper运行的任务读取HDFS中的数据文件,然后调用自己的方法,处理数据,最后输出.Reducer任务会接收Mapper任务输出的数据,作为自己的输入数据,调用自己的方法,最后输出到HDFS的文件中.整个流程如图: Mapper任务的执行过程详解每个Mapper任

分析MapReduce执行过程

MapReduce运行的时候,会通过Mapper运行的任务读取HDFS中的数据文件,然后调用自己的方法,处理数据,最后输出. Reducer任务会接收Mapper任务输出的数据,作为自己的输入数据,调用自己的方法,最后输出到HDFS的文件中. Mapper任务的执行过程每个Mapper任务是一个java进程,它会读取HDFS中的文件,解析成很多的键值对,经过我们覆盖的map方法处理后,转换为很多的键值对再输出.整个Mapper任务的处理过程又可以分为以下几个阶段. 把Mapper任务的运行过程

Web API之过滤器执行过程原理解析【二】（十一）

前言上一节我们详细讲解了过滤器的创建过程以及粗略的介绍了五种过滤器,用此五种过滤器对实现对执行Action方法各个时期的拦截非常重要.这一节我们简单将讲述在Action方法上.控制器上.全局上以及授权上的自定义特性的执行过程. APiController 之前有讲到该APiController,也就稍微介绍了,这节我们来详细此Web API控制器的基类: 1 public abstract class ApiController : IHttpController, IDisposable 2

Hadoop学习之MapReduce执行过程详解

转自:http://my.oschina.net/itblog/blog/275294 分析MapReduce执行过程 MapReduce运行的时候,会通过Mapper运行的任务读取HDFS中的数据文件,然后调用自己的方法,处理数据,最后输出.Reducer任务会接收Mapper任务输出的数据,作为自己的输入数据,调用自己的方法,最后输出到HDFS的文件中.整个流程如图: Mapper任务的执行过程详解每个Mapper任务是一个java进程,它会读取HDFS中的文件,解析成很多的键值对,经过我

MapReduce执行过程简要总结

宏观上MapReduce可以分为以下三个阶段,如下图1所示.阶段1:input/map/partition/sort/spill阶段2:mapper端merge阶段3:reducer端merge/reduce/output 图1 MapReduce执行过程以下分别对上述三个阶段详解.首先是Mapper端的执行逻辑,主要包含以下三点,如图2所示:1. 将key/value/Partition写入到内存缓冲区中2. 当缓冲区使用量达到一定阀值,将其spill到disk上,spill前,需要进行排序

【计算机原理】程序执行过程

本章主要介绍程序执行过程中操作系统.CPU都干了什么运行前程序在运行前,只是在硬盘上待着,此时就是一堆二进制代码而已,没有任何作用. 程序只有进入了内存才能运行,但是要进入内存,则需要服从操作系统的调度. 一个程序在运行的时候可能需要很大的空间,比如3G,但是操作系统不可能为每个程序都分配那么大,因为同时加载入内存的程序可能很多. 所以操作系统想了个办法,它和CPU一起"欺骗"了程序,它可以把硬盘的部分空间当作内存展示给程序,这就是虚拟内存技术,这种欺骗手段能实现的原因在于,程序的