Hadoop学习之以伪分布模式部署Hadoop及常见问题

        Hadoop既可以以单机模式运行,也可以以伪分布模式运行,这两种模式都是为了使用者方便学习和调试Hadoop,要想发挥Hadoop分布式、并行处理的优势,还须以分布式模式来部署运行Hadoop。单机模式是指Hadoop在单个节点上以单个进程的方式运行,伪分布模式是指在单个节点上运行NameNode、DataNode、JobTracker、TaskTracker、SeconderyNameNode5个进程,而分布式模式是指在不同节点上分别运行上述5个进程中的某几个,比如在某个节点上运行DataNode和TaskTracker。

        伪分布模式和分布式模式除了上述的不同之处外,在配置上伪分布模式要简单的多,只需要修改core-site.xml、hdfs-site.xml、mapred-site.xml即可,而分布式模式则还需要配置masters和slaves等文件。在管理上,显然伪分布模式也要简单很多,毕竟只有一个节点,而分布式模式则至少存在两个节点,当节点数量很多时,Hadoop的复杂性也会相应的提高。

        这篇文章主要介绍了以为分布式模式部署和运行Hadoop的一些细节及出现的问题,部署单节点的Hadoop相对容易些,但总是会出现这样那样的问题。首先按照官方文档的说明对core-site.xml、hdfs-site.xml、mapred-site.xml做相应的修改,具体的url为http://hadoop.apache.org/docs/r1.2.1/single_node_setup.html#PseudoDistributed。因为之前曾经学过Hadoop,所以在修改配置文件时不是完全按照官方文档的说明进行的,比如在hdfs-site.xm增加了dfs.name.dir和dfs.data.dir属性的配置,这两个属性的默认值为${hadoop.tmp.dir}/dfs/name和${hadoop.tmp.dir}/dfs/data,具体的就是/tmp/hado

你可能感兴趣的:(Hadoop-1.x,Hadoop)