Apache Hadoop与第三方Hadoop(CDH、HDP等)的比较

一、Hadoop版本综述

Apache Hadoop的开源协议决定了任何人可以对其进行修改,并作为开源或者商业版发布/销售。故而目前Hadoop发行版非常的多,有华为发行版(收费)、Intel发行版(收费)、Cloudera发行版CDH(免费)、Hortonworks版本HDP(免费),这些发行版都是基于Apache Hadoop衍生出来的。

二、社区版与第三方发行版的比较

1.Apache社区版


Apache Hadoop

优点:

    完全开源免费

    社区活跃

    文档、资料详实

缺点:

    版本管理比较混乱,各种版本层出不穷,很难选择,选择生态组件时需要大量考虑兼容性问题、版本匹配问题、组件冲突问题、编译问题等。

    集群的部署安装配置复杂,需要编写大量配置文件,分发到每台节点,容易出错,效率低。

    集群运维复杂,需要安装第三方软件辅助。

2.第三方发行版(CDH/HDP/MapR)

优点:

    基于Apache协议,100%开源。

    版本管理清晰,相比于Apache Hadoop在兼容性、安全性、稳定性上有增强。第三方发行版通常都经过了大量的测试验证,有众多部署实例,大量的运行到各种生产环境。

    版本更新快。通常情况,比如CDH每个季度会有一个update,每一年会有一个release。

    基于稳定版本Apache Hadoop,并应用了最新Bug修复或Feature的patch。

    提供了部署、安装、配置工具,大大提高了集群部署的效率

    运维简单。提供了管理、监控、诊断、配置修改的工具,管理配置方便,定位问题快速、准确,使运维工作简单,有效。

缺点:

涉及到厂商锁定的问题。

三、第三方发行版的比较

Cloudera:最成型的发行版本,拥有最多的部署案例。提供强大的部署、管理和监控工具。

Hortonworks:不拥有任何私有(非开源)修改地使用了100%开源Apache Hadoop的唯一提供商。Hortonworks是第一家使用了Apache HCatalog的元数据服务特性的提供商。并且,它们的Stinger开创性地极大地优化了Hive项目。Hortonworks为入门提供了一个非常好的,易于使用的沙盒。Hortonworks开发了很多增强特性并提交至核心主干,这使得Apache Hadoop能够在包括Windows Server和Windows Azure在内的Microsft Windows平台上本地运行。

Apache Hadoop与第三方Hadoop(CDH、HDP等)的比较_第1张图片

四、版本选择

当我们选择是否采用某个软件用于开源环境时,通常需要考虑:

(1)是否为开源软件,即是否免费。

(2) 是否有稳定版,这个一般软件官方网站会给出说明。

(3) 是否经实践验证,这个可通过检查是否有一些大点的公司已经在生产环境中使用知道。

(4) 是否有强大的社区支持,当出现一个问题时,能够通过社区、论坛等网络资源快速获取解决方法。

你可能感兴趣的:(Apache Hadoop与第三方Hadoop(CDH、HDP等)的比较)