




版權(quán)說(shuō)明:本文檔由用戶(hù)提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請(qǐng)進(jìn)行舉報(bào)或認(rèn)領(lǐng)
文檔簡(jiǎn)介
1、云計(jì)算大數(shù)據(jù)處理分析六大最好工具2016年12月一、概述來(lái)自傳感器、購(gòu)買(mǎi)交易記錄、網(wǎng)絡(luò)日志等的大量數(shù)據(jù),通常是萬(wàn)億或EB的大小,如此龐大的數(shù)據(jù),尋找一個(gè)合適處理工具非常必要,今天我們?yōu)榇蠹曳窒碓诖髷?shù)據(jù)處理分析過(guò)程中六大最好用的工具。我們的數(shù)據(jù)來(lái)自各個(gè)方面,在面對(duì)龐大而復(fù)雜的大數(shù)據(jù),選擇一個(gè)合適的處理工具顯得很有必要,工欲善其事,必須利其器,一個(gè)好的工具不僅可以使我們的工作事半功倍,也可以讓我們?cè)诟?jìng)爭(zhēng)日益激烈的云計(jì)算時(shí)代,挖掘大數(shù)據(jù)價(jià)值,及時(shí)調(diào)整戰(zhàn)略方向。大數(shù)據(jù)是一個(gè)含義廣泛的術(shù)語(yǔ),是指數(shù)據(jù)集,如此龐大而復(fù)雜的,他們需要專(zhuān)門(mén)設(shè)計(jì)的硬件和軟件工具進(jìn)行處理。該數(shù)據(jù)集通常是萬(wàn)億或EB的大小。這些數(shù)據(jù)集
2、收集自各種各樣的來(lái)源:傳感器、氣候信息、公開(kāi)的信息、如雜志、報(bào)紙、文章。大數(shù)據(jù)產(chǎn)生的其他例子包括購(gòu)買(mǎi)交易記錄、網(wǎng)絡(luò)日志、病歷、事監(jiān)控、視頻和圖像檔案、及大型電子商務(wù)。大數(shù)據(jù)分析是在研究大量的數(shù)據(jù)的過(guò)程中尋找模式,相關(guān)性和其他有用的信息,可以幫助企業(yè)更好地適應(yīng)變化,并做出更明智的決策。二、第一種工具:HadoopHadoop是一個(gè)能夠?qū)Υ罅繑?shù)據(jù)進(jìn)行分布式處理的軟件框架。但是Hadoop是以一種可靠、高效、可伸縮的方式進(jìn)行處理的。Hadoop是可靠的,因?yàn)樗僭O(shè)計(jì)算元素和存儲(chǔ)會(huì)失敗,因此它維護(hù)多個(gè)工作數(shù)據(jù)副本,確保能夠針對(duì)失敗的節(jié)點(diǎn)重新分布處理。Hadoop是高效的,因?yàn)樗圆⑿械姆绞焦ぷ鳎ㄟ^(guò)并
3、行處理加快處理速度。Hadoop還是可伸縮的,能夠處理PB級(jí)數(shù)據(jù)。此外,Hadoop依賴(lài)于社區(qū)服務(wù)器,因此它的成本比較低,任何人都可以使用。Hadoop是一個(gè)能夠讓用戶(hù)輕松架構(gòu)和使用的分布式計(jì)算平臺(tái)。用戶(hù)可以輕松地在Hadoop上開(kāi)發(fā)和運(yùn)行處理海量數(shù)據(jù)的應(yīng)用程序。它主要有以下幾個(gè)優(yōu)點(diǎn):高可靠性。Hadoop按位存儲(chǔ)和處理數(shù)據(jù)的能力值得人們信賴(lài)。高擴(kuò)展性。Hadoop是在可用的計(jì)算機(jī)集簇間分配數(shù)據(jù)并完成計(jì)算任務(wù)的,這些集簇可以方便地?cái)U(kuò)展到數(shù)以千計(jì)的節(jié)點(diǎn)中。高效性。Hadoop能夠在節(jié)點(diǎn)之間動(dòng)態(tài)地移動(dòng)數(shù)據(jù),并保證各個(gè)節(jié)點(diǎn)的動(dòng)態(tài)平衡,因此處理速度非???。高容錯(cuò)性。Hadoop能夠自動(dòng)保存數(shù)據(jù)的多個(gè)副
4、本,并且能夠自動(dòng)將失敗的任務(wù)重新分配。Hadoop帶有用Java語(yǔ)言編寫(xiě)的框架,因此運(yùn)行在Linux生產(chǎn)平臺(tái)上是非常理想的。Hadoop上的應(yīng)用程序也可以使用其他語(yǔ)言編寫(xiě),比如C+。三、第二種工具:HPCCHPCC,HighPerformanceComputingandCommunications(高性能計(jì)算與通信)的縮寫(xiě)。1993年,由美國(guó)科學(xué)、工程、技術(shù)聯(lián)邦協(xié)調(diào)理事會(huì)向國(guó)會(huì)提交了“重大挑戰(zhàn)項(xiàng)目:高性能計(jì)算與通信”的報(bào)告,也就是被稱(chēng)為HPCC計(jì)劃的報(bào)告,即美國(guó)總統(tǒng)科學(xué)戰(zhàn)略項(xiàng)目,其目的是通過(guò)加強(qiáng)研究與開(kāi)發(fā)解決一批重要的科學(xué)與技術(shù)挑戰(zhàn)問(wèn)題。HPCC是美國(guó)實(shí)施信息高速公路而上實(shí)施的計(jì)劃,該計(jì)劃的實(shí)
5、施將耗資百億美元,其主要目標(biāo)要達(dá)到:開(kāi)發(fā)可擴(kuò)展的計(jì)算系統(tǒng)及相關(guān)軟件,以支持太位級(jí)網(wǎng)絡(luò)傳輸性能,開(kāi)發(fā)千兆比特網(wǎng)絡(luò)技術(shù),擴(kuò)展研究和教育機(jī)構(gòu)及網(wǎng)絡(luò)連接能力。HighPerformanceCampulingCluster(HPCC)SlTudUlVdBMM-SmiCtuFeCuralrijclLjfHdIIrinawrnfllicinEGlDiviloparU他ECLWEHaFedcraiancaI“r該項(xiàng)目主要由五部分組成:高性能計(jì)算機(jī)系統(tǒng)(HPCS),內(nèi)容包括今后幾代計(jì)算機(jī)系統(tǒng)的研究、系統(tǒng)設(shè)計(jì)工具、先進(jìn)的典型系統(tǒng)及原有系統(tǒng)的評(píng)價(jià)等;先進(jìn)軟件技術(shù)與算法(ASTA),內(nèi)容有巨大挑戰(zhàn)問(wèn)題的軟件支撐、新算
6、法設(shè)計(jì)、軟件分支與工具、計(jì)算計(jì)算及高性能計(jì)算研究中心等;國(guó)家科研與教育網(wǎng)格(NREN),內(nèi)容有中接站及10億位級(jí)傳輸?shù)难芯颗c開(kāi)發(fā);基本研究與人類(lèi)資源(BRHR),內(nèi)容有基礎(chǔ)研究、培訓(xùn)、教育及課程教材,被設(shè)計(jì)通過(guò)獎(jiǎng)勵(lì)調(diào)查者-開(kāi)始的,長(zhǎng)期的調(diào)查在可升級(jí)的高性能計(jì)算中來(lái)增加創(chuàng)新意識(shí)流,通過(guò)提高教育和高性能的計(jì)算訓(xùn)練和通信來(lái)加大熟練的和訓(xùn)練有素的人員的聯(lián)營(yíng),和來(lái)提供必需的基礎(chǔ)架構(gòu)來(lái)支持這些調(diào)查和研究活動(dòng);信息基礎(chǔ)結(jié)構(gòu)技術(shù)和應(yīng)用(IITA),目的在于保證美國(guó)在先進(jìn)信息技術(shù)開(kāi)發(fā)方面的領(lǐng)先地位。四、第三種工具:sStormStorm是自由的開(kāi)源軟件,一個(gè)分布式的、容錯(cuò)的實(shí)時(shí)計(jì)算系統(tǒng)。Storm可以非常可靠的
7、處理龐大的數(shù)據(jù)流,用于處理Hadoop的批量數(shù)據(jù)。Storm很簡(jiǎn)單,支持許多種編程語(yǔ)言,使用起來(lái)非常有趣。Storm由Twitter開(kāi)源而來(lái),其它知名的應(yīng)用企業(yè)包括Groupon、淘寶、支付寶、阿里巴巴、樂(lè)元素、Admaster等等。Storm有許多應(yīng)用領(lǐng)域:實(shí)時(shí)分析、在線(xiàn)機(jī)器學(xué)習(xí)、不停頓的計(jì)算、分布式RPC(遠(yuǎn)過(guò)程調(diào)用協(xié)議,一種通過(guò)網(wǎng)絡(luò)從遠(yuǎn)程計(jì)算機(jī)程序上請(qǐng)求服務(wù))、ETL(Extraction-Transformation-Loading的縮寫(xiě),即數(shù)據(jù)抽取、轉(zhuǎn)換和加載)等等。Storm的處理速度驚人:經(jīng)測(cè)試,每個(gè)節(jié)點(diǎn)每秒鐘可以處理100萬(wàn)個(gè)數(shù)據(jù)元組。Storm是可擴(kuò)展、容錯(cuò),很容易設(shè)置和操作
8、。五、第四種工具:ApacheDrin為了幫助企業(yè)用戶(hù)尋找更為有效、加快Hadoop數(shù)據(jù)查詢(xún)的方法,Apache軟件基金會(huì)近日發(fā)起了一項(xiàng)名為“Drill”的開(kāi)源項(xiàng)目。ApacheDrill實(shí)現(xiàn)了GooglesDremel.據(jù)Hadoop廠(chǎng)商MapRTechnologies公司產(chǎn)品經(jīng)理TomerShiran介紹,“Drill”已經(jīng)作為Apache孵化器項(xiàng)目來(lái)運(yùn)作,將面向全球軟件工程師持續(xù)推廣。該項(xiàng)目將會(huì)創(chuàng)建出開(kāi)源版本的谷歌DremelHadoop工具(谷歌使用該工具來(lái)為Hadoop數(shù)據(jù)分析工具的互聯(lián)網(wǎng)應(yīng)用提速)。而“Drill”將有助于Hadoop用戶(hù)實(shí)現(xiàn)更快查詢(xún)海量數(shù)據(jù)集的目的?!癉rill”
9、項(xiàng)目其實(shí)也是從谷歌的Dremel項(xiàng)目中獲得靈感:該項(xiàng)目幫助谷歌實(shí)現(xiàn)海量數(shù)據(jù)集的分析處理,包括分析抓取Web文檔、跟蹤安裝在A(yíng)ndroidMarket上的應(yīng)用程序數(shù)據(jù)、分析垃圾郵件、分析谷歌分布式構(gòu)建系統(tǒng)上的測(cè)試通過(guò)開(kāi)發(fā)DrillApache開(kāi)源項(xiàng)目,組織機(jī)構(gòu)將有望建立Drill所屬的API接口和靈活強(qiáng)大的體系架構(gòu),從而幫助支持廣泛的數(shù)據(jù)源、數(shù)據(jù)格式和查詢(xún)語(yǔ)言。六、第五種工具:RRapidMinerRapidMiner是世界領(lǐng)先的數(shù)據(jù)挖掘解決方案,在一個(gè)非常大的程度上有著先進(jìn)技術(shù)。它數(shù)據(jù)挖掘任務(wù)涉及范圍廣泛,包括各種數(shù)據(jù)藝術(shù),能簡(jiǎn)化數(shù)據(jù)挖掘過(guò)程的設(shè)計(jì)和評(píng)價(jià)。功能和特點(diǎn):免費(fèi)提供數(shù)據(jù)挖掘技術(shù)和庫(kù)1
10、00%用Java代碼(可運(yùn)行在操作系統(tǒng))數(shù)據(jù)挖掘過(guò)程簡(jiǎn)單,強(qiáng)大和直觀(guān)內(nèi)部XML保證了標(biāo)準(zhǔn)化的格式來(lái)表示交換數(shù)據(jù)挖掘過(guò)程可以用簡(jiǎn)單腳本語(yǔ)言自動(dòng)進(jìn)行大規(guī)模進(jìn)程多層次的數(shù)據(jù)視圖,確保有效和透明的數(shù)據(jù)圖形用戶(hù)界面的互動(dòng)原型命令行(批處理模式)自動(dòng)大規(guī)模應(yīng)用JavaAPI(應(yīng)用編程接口)簡(jiǎn)單的插件和推廣機(jī)制強(qiáng)大的可視化引擎,許多尖端的高維數(shù)據(jù)的可視化建模400多個(gè)數(shù)據(jù)挖掘運(yùn)營(yíng)商支持耶魯大學(xué)已成功地應(yīng)用在許多不同的應(yīng)用領(lǐng)域,包括文本挖掘,多媒體挖掘,功能設(shè)計(jì),數(shù)據(jù)流挖掘,集成開(kāi)發(fā)的方法和分布式數(shù)據(jù)挖掘。七、第六種工具:hPentahoBIPentahoBI平臺(tái)不同于傳統(tǒng)的BI產(chǎn)品,它是一個(gè)以流程為中心的,
11、面向解決方案(Solution)的框架。其目的在于將一系列企業(yè)級(jí)BI產(chǎn)品、開(kāi)源軟件、API等等組件集成起來(lái),方便商務(wù)智能應(yīng)用的開(kāi)發(fā)。它的出現(xiàn),使得一系列的面向商務(wù)智能的獨(dú)立產(chǎn)品如Jfree、Quartz等等,能夠集成在一起,構(gòu)成一項(xiàng)項(xiàng)復(fù)雜的、完整的商務(wù)智能解決方案。PentahoBI平臺(tái),PentahoOpenBI套件的核心架構(gòu)和基礎(chǔ),是以流程為中心的,因?yàn)槠渲袠锌刂破魇且粋€(gè)工作流引擎。工作流引擎使用流程定義來(lái)定義在BI平臺(tái)上執(zhí)行的商業(yè)智能流程。流程可以很容易的被定制,也可以添加新的流程。BI平臺(tái)包含組件和報(bào)表,用以分析這些流程的性能。目前,Pentaho的主要組成元素包括報(bào)表生成、分析、數(shù)據(jù)
12、挖掘和工作流管理等等。這些組件通過(guò)J2EE、WebService、S0AP、HTTP、Java、JavaScript、Portals等技術(shù)集成到Pentaho平臺(tái)中來(lái)。Pentaho的發(fā)行,主要以PentahoSDK的形式進(jìn)行。PentahoSDK共包含五個(gè)部分:Pentaho平臺(tái)、Pentaho示例數(shù)據(jù)庫(kù)、可獨(dú)立運(yùn)行的Pentaho平臺(tái)、Pentaho解決方案示例和一個(gè)預(yù)先配制好的Pentaho網(wǎng)絡(luò)服務(wù)器。其中Pentaho平臺(tái)是Pentaho平臺(tái)最主要的部分,囊括了Pentaho平臺(tái)源代碼的主體;Pentaho數(shù)據(jù)庫(kù)為Pentaho平臺(tái)的正常運(yùn)行提供的數(shù)據(jù)服務(wù),包括配置信息、Solution相關(guān)的信息等等,對(duì)于Pentaho平臺(tái)來(lái)說(shuō)它不是必須的,通過(guò)配置是可以用其它數(shù)據(jù)庫(kù)服務(wù)取代的可獨(dú)立運(yùn)行的Pentaho平臺(tái)是Pentaho平臺(tái)的獨(dú)立運(yùn)行模式的示例,它演示了如何使Pen
溫馨提示
- 1. 本站所有資源如無(wú)特殊說(shuō)明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請(qǐng)下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請(qǐng)聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶(hù)所有。
- 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁(yè)內(nèi)容里面會(huì)有圖紙預(yù)覽,若沒(méi)有圖紙預(yù)覽就沒(méi)有圖紙。
- 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
- 5. 人人文庫(kù)網(wǎng)僅提供信息存儲(chǔ)空間,僅對(duì)用戶(hù)上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對(duì)用戶(hù)上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對(duì)任何下載內(nèi)容負(fù)責(zé)。
- 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請(qǐng)與我們聯(lián)系,我們立即糾正。
- 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶(hù)因使用這些下載資源對(duì)自己和他人造成任何形式的傷害或損失。
最新文檔
- 新疆阿克蘇地區(qū)沙雅縣二中2025年高三下學(xué)期1月期末考試英語(yǔ)試題含解析
- 懷化市重點(diǎn)中學(xué)2024-2025學(xué)年高三下第二次大考英語(yǔ)試題含解析
- 吉林職業(yè)技術(shù)學(xué)院《水資源利用程》2023-2024學(xué)年第一學(xué)期期末試卷
- 廊坊衛(wèi)生職業(yè)學(xué)院《生物產(chǎn)業(yè)概論》2023-2024學(xué)年第二學(xué)期期末試卷
- 北京市人民大附屬中學(xué)2024-2025學(xué)年初三下學(xué)期模擬考試化學(xué)試題含解析
- 造紙廠(chǎng)化驗(yàn)知識(shí)培訓(xùn)課件
- 廈門(mén)軟件職業(yè)技術(shù)學(xué)院《電視節(jié)目包裝》2023-2024學(xué)年第二學(xué)期期末試卷
- 石家莊鐵道大學(xué)四方學(xué)院《先進(jìn)材料表征技術(shù)》2023-2024學(xué)年第二學(xué)期期末試卷
- 企業(yè)管理中的溝通
- 輸血法律法規(guī)知識(shí)培訓(xùn)課件
- 2025年上海浦東新區(qū)高三二模高考語(yǔ)文試卷試題(含答案)
- 廣東省清遠(yuǎn)市清新區(qū)2025年中考一模語(yǔ)文試題(含答案)
- 2024年廣州市天河區(qū)總工會(huì)招聘工會(huì)社會(huì)工作者考試真題
- 工業(yè)級(jí)無(wú)人機(jī)適航認(rèn)證顧問(wèn)合同2025年?duì)幾h
- 2025餐飲服務(wù)承包經(jīng)營(yíng)合同書(shū)
- 湖北省漢陽(yáng)一中、江夏一中、洪山高中2024-2025學(xué)年高一下學(xué)期3月聯(lián)考化學(xué)試卷 含解析
- 護(hù)理安全與護(hù)理質(zhì)量管理課件
- 行政事業(yè)差旅費(fèi)報(bào)銷(xiāo)培訓(xùn)
- 光榮院建設(shè)可行性研究報(bào)告
- DB32T 5061.1-2025中小學(xué)生健康管理技術(shù)規(guī)范 第1部分:心理健康
- 2025年河南經(jīng)貿(mào)職業(yè)學(xué)院?jiǎn)握新殬I(yè)技能測(cè)試題庫(kù)完整版
評(píng)論
0/150
提交評(píng)論