日韩无码专区无码一级三级片|91人人爱网站中日韩无码电影|厨房大战丰满熟妇|AV高清无码在线免费观看|另类AV日韩少妇熟女|中文日本大黄一级黄色片|色情在线视频免费|亚洲成人特黄a片|黄片wwwav色图欧美|欧亚乱色一区二区三区

RELATEED CONSULTING
相關(guān)咨詢
選擇下列產(chǎn)品馬上在線溝通
服務(wù)時(shí)間:8:30-17:00
你可能遇到了下面的問題
關(guān)閉右側(cè)工具欄

新聞中心

這里有您想知道的互聯(lián)網(wǎng)營銷解決方案
Hadoop開發(fā)中常用工具用法解析

本節(jié)和大家學(xué)習(xí)一下Hadoop開發(fā)中常用的工具InputFormat和OutputFormat使用,相信通過本節(jié)的學(xué)習(xí)大家能夠掌握更多關(guān)于Hadoop開發(fā)方面的知識(shí),讓我們一起來學(xué)習(xí)吧。首先我們來看一下Hadoop的概念。

Hadoop概念

一個(gè)分布式系統(tǒng)基礎(chǔ)架構(gòu),由Apache基金會(huì)開發(fā)。用戶可以在不了解分布式底層細(xì)節(jié)的情況下,開發(fā)分布式程序。充分利用集群的威力高速運(yùn)算和存儲(chǔ)。簡單地說來,Hadoop是一個(gè)可以更

容易開發(fā)和運(yùn)行處理大規(guī)模數(shù)據(jù)的軟件平臺(tái)。Hadoop實(shí)現(xiàn)了一個(gè)分布式文件系統(tǒng)(HadoopDistributedFileSystem),簡稱HDFS。HDFS有著高容錯(cuò)性(fault-tolerent)的特點(diǎn),并且設(shè)計(jì)用

來部署在低廉的(low-cost)硬件上。而且它提供高傳輸率(highthroughput)來訪問應(yīng)用程序的數(shù)據(jù),適合那些有著超大數(shù)據(jù)集(largedataset)的應(yīng)用程序。HDFS放寬了(relax)POSIX

的要求(requirements)這樣可以流的形式訪問(streamingaccess)文件系統(tǒng)中的數(shù)據(jù)。下面我們開始介紹Hadoop開發(fā)中常用的工具InputFormat和OutputFormat。

InputFormat和OutputFormat

Hadoop中的MapReduce框架依賴InputFormat提供數(shù)據(jù),依賴OutputFormat輸出數(shù)據(jù);每一個(gè)MapReduce程序都離不開他們。

Hadoop提供了一系列InputFormat和OutputFormat方便開發(fā),本文介紹幾種常用的。TextInputFormat用于讀取純文本文件,文件被分為一系列以LF或者CR結(jié)束的行,key是每一行的位置

(偏移量,LongWritable類型),value是每一行的內(nèi)容,Text類型。KeyValueTextInputFormat同樣用于讀取文件,如果行被分隔符(缺省是tab)分割為兩部分,***部分為key,剩下的部分為

value;如果沒有分隔符,整行作為key,value為空SequenceFileInputFormat用于讀取sequencefile。sequencefile是Hadoop用于存儲(chǔ)數(shù)據(jù)自定義格式的binary文件。它有兩個(gè)子類:

SequenceFileAsBinaryInputFormat,將key和value以BytesWritable的類型讀出;SequenceFileAsTextInputFormat,將key和value以Text的類型讀出。SequenceFileInputFilter根據(jù)filter從

sequence文件中取得部分滿足條件的數(shù)據(jù),通過setFilterClass指定Filter,內(nèi)置了三種Filter,RegexFilter取key值滿足指定的正則表達(dá)式的記錄;PercentFilter通過指定參數(shù)f,取記錄行數(shù)%

f==0的記錄;MD5Filter通過指定參數(shù)f,取MD5(key)%f==0的記錄。NLineInputFormat0.18.x新加入,可以將文件以行為單位進(jìn)行split,比如文件的每一行對應(yīng)一個(gè)map。得到的key是每一行

的位置(偏移量,LongWritable類型),value是每一行的內(nèi)容,Text類型。CompositeInputFormat,用于多個(gè)數(shù)據(jù)源的join。TextOutputFormat,輸出到純文本文件,格式為key+""+value。

NullOutputFormat,hadoop中的/dev/null,將輸出送進(jìn)黑洞。

SequenceFileOutputFormat,輸出到sequencefile格式文件。MultipleSequenceFileOutputFormat,MultipleTextOutputFormat,根據(jù)key將記錄輸出到不同的文件。DBInputFormat和

DBOutputFormat,從DB讀取,輸出到DB,預(yù)計(jì)將在0.19版本加入。本節(jié)關(guān)于Hadoop開發(fā)中常用InputFormat和OutputFormat相關(guān)內(nèi)容介紹到這里。
 

【編輯推薦】

  1. 兩種模式運(yùn)行Hadoop分布式并行程序
  2. Hadoop命令手冊使用指南
  3. 專家講解 Hadoop:HBASE松散數(shù)據(jù)存儲(chǔ)設(shè)計(jì)
  4. 兩種模式運(yùn)行Hadoop分布式并行程序
  5. Hadoop概念及其用法專家講解

文章題目:Hadoop開發(fā)中常用工具用法解析
新聞來源:http://m.5511xx.com/article/dhdepee.html