学习hadoop知识时,常常用伪分布式的架构来学习,即单机单节点.
但生产环境都是多节点架构,在学习时,受机器资源所限,很难实现单机集群.
好在可以利用docker搭建单机集群,虽然与真正的集群还是有所区别.
最后,生产环境别这么干,docker的特性如此.
准备镜像
使用最新版本的centOS
.
docker pull centos:latest
下载软件包
1.下载hadoop
,此处使用的是3.3.0
版本 下载地址
2.下载jdk
,推荐使用oracle jdk
, 下载地址
启动容器
由于镜像中不包含wget
,也没有预先安装sshd
,传统的scp
与http
方式均无法传输,需要通过bind mount
的方式启动镜像,来完成文件传输.
此处使用本机的/Users/zhangsheng/share
目录
docker run -it --name hadoop -v /Users/zhangsheng/share:/usr/local/software centos:latest
注:macOS X
用户出现Mounts denied
错误,请检查指定目录是否在file sharing路径中
,如果不在,新增或在对应路径中创建共享文件夹.如图:
安装jdk与hadoop
配置好bind mount
以后,将软件包放置到/Users/zhangsheng/share
,可以在容器/usr/local/software
看到对应安装包
先做一个目录规划.
/usr/local/bigdata/jdk 作为jdk目录
/usr/local/bigdata/hadoop hadoop的目录 包含jar包 启动脚本 hadoop配置等
/usr/local/bigdata/logs 存放日志,方便查阅 这个后边用hadoop用户创建
解压软件包
## 创建目录并拷贝软件包
mkdir /usr/local/bigdata
cp /usr/local/software /usr/local/bigdata
cd /usr/local/bigdata
## 解压后重命名
tar -zxvf hadoop-3.3.0.tar.gz
tar -zxvf jdk-8u281-linux-x64.tar.gz
mv hadoop-3.3.0 hadoop
mv jdk1.8.0_281/ jdk
## 清理安装包 减小容器大小
rm -f hadoop-3.3.0.tar.gz
rm -f jdk-8u281-linux-x64.tar.gz
安装sshd
hadoop节点间通过ssh操作,默认镜像中并不包含sshd
服务,因为需要安装.
yum update
一路Y回车.更新完yum后安装sshd
yum install -y openssl openssh-server
yum install openssh*
一路回车,创建密钥并启动ssh服务
ssh-keygen -t rsa
ssh-keygen -t dsa
ssh-keygen -t ecdsa
ssh-keygen -t ed25519
cp ~/.ssh/id_rsa.pub ~/.ssh/authorized_keys
修改sshd的配置文件
vi /etc/ssh/sshd_config
修改部分为
### 原内容
HostKey /etc/ssh/ssh_host_rsa_key
HostKey /etc/ssh/ssh_host_ecdsa_key
HostKey /etc/ssh/ssh_host_ed25519_key
### 修改为
HostKey /root/.ssh/id_rsa
HostKey /root/.ssh/id_ecdsa
HostKey /root/.ssh/id_ed25519
HostKey /root/.ssh/id_dsa
允许远程登陆
vi /etc/pam.d/sshd
# 使用#注释掉此行
# account required pam_nologin.so
启动sshd服务并查看状态
/usr/sbin/sshd
ps -ef | grep sshd
启动成功
root 311 1 0 06:43 ? 00:00:00 /usr/sbin/sshd
root 332 1 0 06:44 pts/0 00:00:00 grep --color=auto sshd
创建用户
创建bigdata
用户与用户组,默认登陆容器是root
用户,hadoop
需要用非root
用户启动.
useradd bigdata
配置用户的ssh
su bigdata
ssh-keygen -t rsa
touch ~/.ssh/authorized_keys
chmod 600 ~/.ssh/authorized_keys
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
执行命令尝试远程登陆
ssh localhost
登陆成功即可证明ssh配置成功
配置环境变量
接上步,输入exit
回车,切回root
用户,修改hadoop
目录权限与用户组
cd /usr/local
chown bigdata.bigdata bigdata
chmod -R 777 bigdata/hadoop/etc
切换到bigdata
用户,修改环境变量与配置hadoop
配置文件
su bigdata
vi ~/.bashrc
替换内容如下
# .bashrc
# Source global definitions
if [ -f /etc/bashrc ]; then
. /etc/bashrc
fi
# User specific environment
if ! [[ "$PATH" =~ "$HOME/.local/bin:$HOME/bin:" ]]
then
PATH="$HOME/.local/bin:$HOME/bin:$PATH"
fi
export JAVA_HOME=/usr/local/bigdata/jdk
export CLASSPATH=$JAVA_HOME/lib
export PATH=$PATH:$JAVA_HOME/bin
# hadoop env
export HADOOP_HOME=/usr/local/bigdata/hadoop
export HADOOP_COMMON_HOME=$HADOOP_HOME
export PATH=$PATH:$HADOOP_HOME/bin
PATH=$PATH:$HOME/bin
export PATH
# Uncomment the following line if you don't like systemctl's auto-paging feature:
# export SYSTEMD_PAGER=
# User specific aliases and functions
:wq
保存,更新环境变量
source ~/.bash_profile
接下来更新hadoop
配置,首先修改core-site.xml
.
cd /usr/local/bigdata/hadoop/etc/hadoop
vi core-site.xml
替换内容如下:
fs.defaultFS
hdfs://localhost:9000
:wq
保存,创建日志目录
mkdir /usr/local/bigdata/logs
接下来修改hadoop-env.sh
,
rm -f hadoop-env.sh
vi hadoop-env.sh
替换内容如下:
export JAVA_HOME=${JAVA_HOME}
export HADOOP_CONF_DIR=${HADOOP_CONF_DIR:-"/etc/hadoop"}
for f in $HADOOP_HOME/contrib/capacity-scheduler/*.jar; do
if [ "$HADOOP_CLASSPATH" ]; then
export HADOOP_CLASSPATH=$HADOOP_CLASSPATH:$f
else
export HADOOP_CLASSPATH=$f
fi
done
export HADOOP_HEAPSIZE=1024
export HADOOP_NAMENODE_INIT_HEAPSIZE=1024
export HADOOP_OPTS="$HADOOP_OPTS -Djava.net.preferIPv4Stack=true"
export HDFS_NAMENODE_OPTS="-Dhadoop.security.logger=${HADOOP_SECURITY_LOGGER:-INFO,RFAS} -Dhdfs.audit.logger=${HDFS_AUDIT_LOGGER:-INFO,NullAppender} $HADOOP_NAMENODE_OPTS"
export HDFS_DATANODE_OPTS="-Dhadoop.security.logger=ERROR,RFAS $HADOOP_DATANODE_OPTS"
export HDFS_SECONDARYNAMENODE_OPTS="-Dhadoop.security.logger=${HADOOP_SECURITY_LOGGER:-INFO,RFAS} -Dhdfs.audit.logger=${HDFS_AUDIT_LOGGER:-INFO,NullAppender} $HADOOP_SECONDARYNAMENODE_OPTS"
export HADOOP_NFS3_OPTS="$HADOOP_NFS3_OPTS"
export HADOOP_PORTMAP_OPTS="-Xmx1024m $HADOOP_PORTMAP_OPTS"
export HADOOP_CLIENT_OPTS="-Xmx1024m $HADOOP_CLIENT_OPTS"
export HADOOP_SECURE_DN_USER=${HADOOP_SECURE_DN_USER}
export HADOOP_SECURE_LOG_DIR=${HADOOP_LOG_DIR}/${HADOOP_HDFS_USER}
export HADOOP_PID_DIR=${HADOOP_PID_DIR}
export HADOOP_SECURE_DN_PID_DIR=${HADOOP_PID_DIR}
export HADOOP_IDENT_STRING=hadoop
export HADOOP_LOG_DIR=/usr/local/bigdata/logs
:wq
保存,最后修改hdfs-site.xml
vi hdfs-site.xml
替换内容如下
dfs.replication
1
dfs.permissions.enabled
false
初始化namenode
执行下列命令初始化namenode
hdfs namenode -format
启动hadoop
cd /usr/local/bigdata/hadoop/sbin
./start-dfs.sh
./start-yarn.sh
jps
命令查看,启动成功
1122 SecondaryNameNode
900 DataNode
1399 ResourceManager
1849 Jps
779 NameNode
1517 NodeManager
容器导出为镜像
到目前位置hadoop的安装配置启动就完成了,后面需要将这个容器导出为镜像,然后从这个镜像启动多个容器实例来搭建单机集群
docker export hadoop > hadoop.tar
导入成镜像
docker import hadoop.tar hadoop:3.3