Linux学习--Hadoop快速入门

Hadoop安装

1. 安装前提

  • JavaTM1.5.x,必须安装,建议选择Sun公司发行的Java版本。
  • ssh 必须安装并且保证 sshd一直运行,以便用Hadoop 脚本管理远端Hadoop守护进程。

2. 运行Hadoop集群的准备工作

  • 解压所下载的Hadoop发行版。
  • 编辑 conf/hadoop-env.sh文件,至少需要将JAVA_HOME设置为Java安装根路径。
  • 尝试如下命令: $ bin/hadoop 将会显示hadoop 脚本的使用文档。

现在你可以用以下三种支持的模式中的一种启动Hadoop集群:

  • 单机模式
  • 伪分布式模式
  • 完全分布式模式

3. 单机模式的操作方法:

默认情况下,Hadoop被配置成以非分布式模式运行的一个独立Java进程。这对调试非常有帮助。
下面的实例将已解压的 conf 目录拷贝作为输入,查找并显示匹配给定正则表达式的条目。输出写入到指定的output目录。

$ mkdir input 
$ cp conf/*.xml input 
$ bin/hadoop jar hadoop-*-examples.jar grep input output 'dfs[a-z.]+' 
$ cat output/*

4. 伪分布式模式的操作方法:

Hadoop可以在单节点上以所谓的伪分布式模式运行,此时每一个Hadoop守护进程都作为一个独立的Java进程运行。
4.1 配置
使用如下的 conf/hadoop-site.xml:

<configuration>
  <property>
    <name>fs.default.namename>
    <value>localhost:9000value>
  property>
  <property>
    <name>mapred.job.trackername>
    <value>localhost:9001value>
  property>
  <property>
    <name>dfs.replicationname>
    <value>1value>
  property>
configuration>

4.2 免密码ssh设置
现在确认能否不输入口令就用ssh登录localhost:

$ ssh localhost

如果不输入口令就无法用ssh登陆localhost,执行下面的命令:

$ ssh-keygen -t dsa -P '' -f ~/.ssh/id_dsa 
$ cat ~/.ssh/id_dsa.pub >> ~/.ssh/authorized_keys

4.3 执行
格式化一个新的分布式文件系统:

$ bin/hadoop namenode -format

启动Hadoop守护进程:

$ bin/start-all.sh

浏览NameNode和JobTracker的网络接口,它们的地址默认为:

NameNode - http://localhost:50070/
JobTracker - http://localhost:50030/
将输入文件拷贝到分布式文件系统:

$ bin/hadoop fs -put conf input

运行发行版提供的示例程序:

$ bin/hadoop jar hadoop-*-examples.jar grep input output 'dfs[a-z.]+'

查看输出文件:
将输出文件从分布式文件系统拷贝到本地文件系统查看:

$ bin/hadoop fs -get output output 
$ cat output/*

或者在分布式文件系统上查看输出文件:

$ bin/hadoop fs -cat output/*

完成全部操作后,停止守护进程:

$ bin/stop-all.sh

5.完全分布式模式的操作方法

详见以下链接:
:http://hadoop.apache.org/docs/r1.0.4/cn/quickstart.html

你可能感兴趣的:(Linux)