[hadoop]MapReduce簡介和安裝（三）

阿新 • • 發佈：2019-02-04

一、MapReduce概述

MapReduce，簡稱MR，分散式計算框架，Hadoop核心元件。分散式計算框架還有storm, spark等，它們不是誰替換誰關係，而是哪一個更適合的問題。

MapReduce是離線計算框架，Storm是流式計算框架，Spark是記憶體計算框架，適合快速得到結果的專案。

二、MapReduce設計理念

何為分散式計算
移動計算，而不是移動資料

三、MapReduce工作原理 摘自：http://weixiaolu.iteye.com/blog/1474172

流程分析 Map端 1．每個輸入分片會讓一個map任務來處理，預設情況下，以HDFS的一個塊的大小（預設為64M）為一個分片，當然我們也可以設定塊的大小。map輸出的結果會暫且放在一個環形記憶體緩衝區中（該緩衝區的大小預設為100M，由io.sort.mb屬性控制），當該緩衝區快要溢位時（預設為緩衝區大小的80%，由io.sort.spill.percent屬性控制），會在本地檔案系統中建立一個溢位檔案，將該緩衝區中的資料寫入這個檔案。

2．在寫入磁碟之前，執行緒首先根據reduce任務的數目將資料劃分為相同數目的分割槽，也就是一個reduce任務對應一個分割槽的資料。這樣做是為了避免有些reduce任務分配到大量資料，而有些reduce任務卻分到很少資料，甚至沒有分到資料的尷尬局面。其實分割槽就是對資料進行hash的過程。然後對每個分割槽中的資料進行排序，如果此時設定了Combiner，將排序後的結果進行Combia操作，這樣做的目的是讓儘可能少的資料寫入到磁碟。

3．當map任務輸出最後一個記錄時，可能會有很多的溢位檔案，這時需要將這些檔案合併。合併的過程中會不斷地進行排序和combia操作，目的有兩個：1.儘量減少每次寫入磁碟的資料量；2.儘量減少下一複製階段網路傳輸的資料量。最後合併成了一個已分割槽且已排序的檔案。為了減少網路傳輸的資料量，這裡可以將資料壓縮，只要將mapred.compress.map.out設定為true就可以了。

4．將分割槽中的資料拷貝給相對應的reduce任務。有人可能會問：分割槽中的資料怎麼知道它對應的reduce是哪個呢？其實map任務一直和其父TaskTracker保持聯絡，而TaskTracker又一直和JobTracker保持心跳。所以JobTracker中儲存了整個叢集中的巨集觀資訊。只要reduce任務向JobTracker獲取對應的map輸出位置就ok了哦。

到這裡，map端就分析完了。那到底什麼是Shuffle呢？Shuffle的中文意思是“洗牌”，如果我們這樣看：一個map產生的資料，結果通過hash過程分割槽卻分配給了不同的reduce任務，是不是一個對資料洗牌的過程呢？ Reduce端

1．Reduce會接收到不同map任務傳來的資料，並且每個map傳來的資料都是有序的。如果reduce端接受的資料量相當小，則直接儲存在記憶體中（緩衝區大小由mapred.job.shuffle.input.buffer.percent屬性控制，表示用作此用途的堆空間的百分比），如果資料量超過了該緩衝區大小的一定比例（由mapred.job.shuffle.merge.percent決定），則對資料合併後溢寫到磁碟中。

2．隨著溢寫檔案的增多，後臺執行緒會將它們合併成一個更大的有序的檔案，這樣做是為了給後面的合併節省時間。其實不管在map端還是reduce端，MapReduce都是反覆地執行排序，合併操作，現在終於明白了有些人為什麼會說：排序是hadoop的靈魂。

3．合併的過程中會產生許多的中間檔案（寫入磁碟了），但MapReduce會讓寫入磁碟的資料儘可能地少，並且最後一次合併的結果並沒有寫入磁碟，而是直接輸入到reduce函式。 四、安裝MapReduce 現在有node1,node2,node3三個伺服器，其中node1是NameNode，node2,node3是DataNode，node2也是SecondaryNameNode，把MapReduce安裝到node1伺服器 1、關閉node1防火牆

systemctl stop iptables.service

2、node1上配置MapReduce主伺服器 conf/mapred_site.xml，從伺服器是DataNode伺服器

<configuration>
        <property>
                <name>mapred.job.tracker</name>
                <value>node1:9001</value>
        </property>
</configuration>

3、拷貝node1的mapred_site.xml到node2,node3

scp ./mapred-site.xml [email protected]:~/hadoop-1.2.1/conf/

scp ./mapred-site.xml [email protected]:~/hadoop-1.2.1/conf/

4、啟動 node1，進入hadoop-1.2.1/bin 執行 ./hadoop namenode -format ./start-all.sh
結果 node1
node2
node3

[hadoop]MapReduce簡介和安裝（三）

[hadoop]MapReduce簡介和安裝（三）

Zookeeper簡介和安裝（二）

muleESB簡介和安裝（一）

SVN的使用和安裝（三）--客服端的安裝和連線服務端

Cloudera Manager安裝之Cloudera Manager 5.3.X安裝（三）（tar方式、rpm方式和yum方式）

SVN服務器搭建和使用（三）

多線程編程學習筆記——async和await（三）

System Center 2016 - Operations Manager 部署安裝（三）

linux系統程序安裝（三）源碼包安裝程序

System Center 2016 - Configuration Manager 部署安裝（三）

CentOS7安裝（三）- 配置阿裏雲yum源

Saltstack數據系統Grains和Pillar（三）

Docker簡介與安裝（一）

HTML常用元素和屬性（三）

Android實戰——第三方服務之Bmob後端雲的推送服務的集成和使用（三）

詳解C#特性和反射（三）

『中級篇』k8s的Service簡介和演示（67）

Android 基於Netty的訊息推送方案之字串的接收和傳送（三）

javaEE學習筆記：maven下載和安裝（1）

CLR VIA C# 閱讀筆記和感悟（三）

[hadoop]MapReduce簡介和安裝（三）

相關推薦