Mahout驾驭hadoop之详解

2021-11-06 22:13:37

众所周知,mahout是基于hadoop分布式系统的,要想看懂mahout的源码,首先得明白mahout是如何使用hadoop的!

首先,在我的<<hadoop运行原理详解>>一篇中,详细介绍了hadoop的运行机制,这里就不多说了!下面我就以kmeans聚类算法为例,讲讲mahout如何利用hadoop实现数据挖掘算法并行化.如以下类图所示,

该图描述了整个mahout实现kmeans算法的架构图,首先kmeanscluster继承cluster,在kmeanscluster中有几个比较重要的方法,首先clusterpoints()是实现kmeans聚类算法的方法,而其中调用了runkmeansiteration()方法,该方法是单次聚类迭代方法.

尤其可见,这块算法实现和普通kmeans算法没有太大差别!在mahout针对每个算法都有一个driver,这个东西是干什么的啊?

我们先看看kmeansdriver源码,kmeansdriver继承了abstractjob.我们知道hadoop上的任务都是以job的形式启动的!我们要使用某个算法进行一项数据挖掘工作,因此就要启动一个job.因此,kmeansdriver就是创建一个job,然后对job的属性进行配置,然后运行该job.

上图反映了kmeansdriver工作原理.

Mahout驾驭hadoop之详解

继续阅读

Command Network(POJ 3164)---定根最小树形图模板题题目描述输入格式输出格式输入样例输出样例分析源程序

开源低带宽语音编解码器

241 Different Ways to Add Parentheses（C代码版）

【趋高机器视觉】机器视觉技术原理解析及解决方案

CSMA/CD1． CSMA/CD的概述2． CSMA 的工作原理3． CSMA/CD控制规程及特点4． CSMA/CD协议5． CSMA/CD的优点6．结束语

极大似然法(ML)与最大期望法(EM)

MapReduce的几个企业级经典面试案例MapReduce的几个企业级经典面试案例

C++ 第十五周报告1--《冒泡法排序》

ubuntu14.04下安装hbse1.0.1.1

笔试面试题目：滑动窗口(二)

User Defined Hadoop DataType

数据结构与算法（27）——排序（二）

Dijkstra--简易版（最短路径）

Ambari介绍和架构原理

GitHub连夜封杀！这份阿里 10W 字内部 Java 字面试手册到底有多强？

hdu7108哈希