[置顶] Hadoop 实战之Streaming(二)

环境:Vmware 8.0 和ubuntu11.04

Hadoop 实战之Streaming(三)---通过Unix命令使用Streaming

第一步: 首先在/home/tanglg1987目录下新建一个start.sh脚本文件,每次启动虚拟机都要删除/tmp目录下的全部文件,重新格式化namenode,代码如下:

sudo rm -rf /tmp/*
rm -rf /home/tanglg1987/hadoop-0.20.2/logs
hadoop namenode -format
hadoop datanode -format
start-all.sh
hadoop fs -mkdir input 
hadoop dfsadmin -safemode leave

第二步:给start.sh增加执行权限并启动hadoop伪分布式集群,代码如下:

chmod 777 /home/tanglg1987/start.sh
./start.sh 

执行过程如下:

[置顶] Hadoop 实战之Streaming(二)_第1张图片

第三步:编写一个名为:list-4-2.sh的shell脚本

$HADOOP_HOME/bin/hadoop  jar $HADOOP_HOME/hadoop-0.20.2-streaming.jar -input output -output output_a -mapper 'wc -l'  D mapred.reduce.tasks=0

第四步:给list-4-2.sh增加执行权限并启动脚本,代码如下:

chmod 777 /home/tanglg1987/list-4-2.sh
./list-4-2.sh

第五步:Run On Hadoop,运行过程如下:

[置顶] Hadoop 实战之Streaming(二)_第2张图片

第六步:查看结果集,运行结果如下:

[置顶] Hadoop 实战之Streaming(二)_第3张图片

你可能感兴趣的:([置顶] Hadoop 实战之Streaming(二))