docker搭建单机hadoop

学习hadoop知识时,常常用伪分布式的架构来学习,即单机单节点.
但生产环境都是多节点架构,在学习时,受机器资源所限,很难实现单机集群.
好在可以利用docker搭建单机集群,虽然与真正的集群还是有所区别.
最后,生产环境别这么干,docker的特性如此.

准备镜像

使用最新版本的centOS.

docker pull centos:latest

下载软件包

1.下载hadoop,此处使用的是3.3.0版本下载地址

2.下载jdk,推荐使用oracle jdk, 下载地址

启动容器

由于镜像中不包含wget,也没有预先安装sshd,传统的scp与http方式均无法传输,需要通过bind mount的方式启动镜像,来完成文件传输.

此处使用本机的/Users/zhangsheng/share目录

docker run -it --name hadoop -v /Users/zhangsheng/share:/usr/local/software centos:latest

注:macOS X用户出现Mounts denied错误,请检查指定目录是否在file sharing路径中,如果不在,新增或在对应路径中创建共享文件夹.如图:

file_sharing.png

安装jdk与hadoop

配置好bind mount以后,将软件包放置到/Users/zhangsheng/share,可以在容器/usr/local/software看到对应安装包

先做一个目录规划.

/usr/local/bigdata/jdk              作为jdk目录
/usr/local/bigdata/hadoop           hadoop的目录 包含jar包 启动脚本 hadoop配置等
/usr/local/bigdata/logs             存放日志,方便查阅 这个后边用hadoop用户创建

解压软件包

## 创建目录并拷贝软件包
mkdir /usr/local/bigdata
cp /usr/local/software /usr/local/bigdata
cd /usr/local/bigdata
## 解压后重命名
tar -zxvf hadoop-3.3.0.tar.gz
tar -zxvf jdk-8u281-linux-x64.tar.gz
mv hadoop-3.3.0 hadoop
mv jdk1.8.0_281/ jdk
## 清理安装包 减小容器大小
rm -f hadoop-3.3.0.tar.gz 
rm -f jdk-8u281-linux-x64.tar.gz

安装sshd

hadoop节点间通过ssh操作,默认镜像中并不包含sshd服务,因为需要安装.

yum update

一路Y回车.更新完yum后安装sshd

yum install -y openssl openssh-server
yum install openssh*

一路回车,创建密钥并启动ssh服务

ssh-keygen -t rsa
ssh-keygen -t dsa
ssh-keygen -t ecdsa
ssh-keygen -t ed25519
cp ~/.ssh/id_rsa.pub ~/.ssh/authorized_keys

修改sshd的配置文件

vi /etc/ssh/sshd_config

修改部分为

### 原内容
HostKey /etc/ssh/ssh_host_rsa_key
HostKey /etc/ssh/ssh_host_ecdsa_key
HostKey /etc/ssh/ssh_host_ed25519_key
### 修改为
HostKey /root/.ssh/id_rsa
HostKey /root/.ssh/id_ecdsa
HostKey /root/.ssh/id_ed25519
HostKey /root/.ssh/id_dsa

允许远程登陆

vi /etc/pam.d/sshd
# 使用#注释掉此行
# account    required     pam_nologin.so

启动sshd服务并查看状态

/usr/sbin/sshd
ps -ef | grep sshd

启动成功

root       311     1  0 06:43 ?        00:00:00 /usr/sbin/sshd
root       332     1  0 06:44 pts/0    00:00:00 grep --color=auto sshd

创建用户

创建bigdata用户与用户组,默认登陆容器是root用户,hadoop需要用非root用户启动.

useradd bigdata

配置用户的ssh

su bigdata
ssh-keygen -t rsa
touch ~/.ssh/authorized_keys
chmod 600 ~/.ssh/authorized_keys
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys

执行命令尝试远程登陆

ssh localhost

登陆成功即可证明ssh配置成功

配置环境变量

接上步,输入exit回车,切回root用户,修改hadoop目录权限与用户组

cd /usr/local
chown bigdata.bigdata bigdata
chmod -R 777 bigdata/hadoop/etc

切换到bigdata用户,修改环境变量与配置hadoop配置文件

su bigdata
vi ~/.bashrc

替换内容如下

# .bashrc

# Source global definitions
if [ -f /etc/bashrc ]; then
        . /etc/bashrc
fi

# User specific environment
if ! [[ "$PATH" =~ "$HOME/.local/bin:$HOME/bin:" ]]
then
    PATH="$HOME/.local/bin:$HOME/bin:$PATH"
fi

export JAVA_HOME=/usr/local/bigdata/jdk
export CLASSPATH=$JAVA_HOME/lib
export PATH=$PATH:$JAVA_HOME/bin

# hadoop env
export HADOOP_HOME=/usr/local/bigdata/hadoop
export HADOOP_COMMON_HOME=$HADOOP_HOME
export PATH=$PATH:$HADOOP_HOME/bin

PATH=$PATH:$HOME/bin
export PATH

# Uncomment the following line if you don't like systemctl's auto-paging feature:
# export SYSTEMD_PAGER=

# User specific aliases and functions

:wq保存,更新环境变量

source ~/.bash_profile

接下来更新hadoop配置,首先修改core-site.xml.

cd /usr/local/bigdata/hadoop/etc/hadoop
vi core-site.xml

替换内容如下:





    
        fs.defaultFS
        hdfs://localhost:9000

:wq保存,创建日志目录

mkdir /usr/local/bigdata/logs

接下来修改hadoop-env.sh,

rm -f hadoop-env.sh
vi hadoop-env.sh

替换内容如下:

export JAVA_HOME=${JAVA_HOME}
export HADOOP_CONF_DIR=${HADOOP_CONF_DIR:-"/etc/hadoop"}
for f in $HADOOP_HOME/contrib/capacity-scheduler/*.jar; do
  if [ "$HADOOP_CLASSPATH" ]; then
    export HADOOP_CLASSPATH=$HADOOP_CLASSPATH:$f
  else
    export HADOOP_CLASSPATH=$f
  fi
done
export HADOOP_HEAPSIZE=1024
export HADOOP_NAMENODE_INIT_HEAPSIZE=1024
export HADOOP_OPTS="$HADOOP_OPTS -Djava.net.preferIPv4Stack=true"
export HDFS_NAMENODE_OPTS="-Dhadoop.security.logger=${HADOOP_SECURITY_LOGGER:-INFO,RFAS} -Dhdfs.audit.logger=${HDFS_AUDIT_LOGGER:-INFO,NullAppender} $HADOOP_NAMENODE_OPTS"
export HDFS_DATANODE_OPTS="-Dhadoop.security.logger=ERROR,RFAS $HADOOP_DATANODE_OPTS"
export HDFS_SECONDARYNAMENODE_OPTS="-Dhadoop.security.logger=${HADOOP_SECURITY_LOGGER:-INFO,RFAS} -Dhdfs.audit.logger=${HDFS_AUDIT_LOGGER:-INFO,NullAppender} $HADOOP_SECONDARYNAMENODE_OPTS"
export HADOOP_NFS3_OPTS="$HADOOP_NFS3_OPTS"
export HADOOP_PORTMAP_OPTS="-Xmx1024m $HADOOP_PORTMAP_OPTS"
export HADOOP_CLIENT_OPTS="-Xmx1024m $HADOOP_CLIENT_OPTS"
export HADOOP_SECURE_DN_USER=${HADOOP_SECURE_DN_USER}
export HADOOP_SECURE_LOG_DIR=${HADOOP_LOG_DIR}/${HADOOP_HDFS_USER}
export HADOOP_PID_DIR=${HADOOP_PID_DIR}
export HADOOP_SECURE_DN_PID_DIR=${HADOOP_PID_DIR}
export HADOOP_IDENT_STRING=hadoop
export HADOOP_LOG_DIR=/usr/local/bigdata/logs

:wq保存,最后修改hdfs-site.xml

vi hdfs-site.xml

替换内容如下




    
        dfs.replication
        1
    
    
        dfs.permissions.enabled
        false

初始化namenode

执行下列命令初始化namenode

hdfs namenode  -format

启动hadoop

cd /usr/local/bigdata/hadoop/sbin
./start-dfs.sh 
./start-yarn.sh

jps命令查看,启动成功

1122 SecondaryNameNode
900 DataNode
1399 ResourceManager
1849 Jps
779 NameNode
1517 NodeManager

容器导出为镜像

到目前位置hadoop的安装配置启动就完成了,后面需要将这个容器导出为镜像,然后从这个镜像启动多个容器实例来搭建单机集群

docker export hadoop > hadoop.tar

导入成镜像

docker import hadoop.tar hadoop:3.3