.Azkaban工作流引擎和Flume数据采集

Azkaban介绍

一、Azkaban简介

   Azkaban是由Linkedin开源的一个**批量工作流任务调度器**。用于在一个工作流内以一个特定的顺序运行一组工作和流程。Azkaban定义了一种KV文件格式来建立任务之间的依赖关系，并提供一个易于使用的web用户界面维护和跟踪你的工作流。简而言之就是一个工作流调度系统。

为什么需要工作流调度系统？

因为一个完整的数据分析系统通常都是由大量任务单元组成：shell脚本程序，java程序，mapreduce程序、hive脚本等

而各任务单元之间存在时间先后及前后依赖关系

为了很好地组织起这样的复杂执行计划，需要一个工作流调度系统来调度执行；

常见工作流调度系统

在hadoop领域，常见工作流调度系统有：Oozie, Azkaban,Cascading,Hamake

下面的表格对上述四种hadoop工作流调度器的关键特性进行了比较，尽管这些工作流调度器能够解决的需求场景基本一致，但在设计理念，目标用户，应用场景等方面还是存在显著的区别，在做技术选型的时候，可以提供参考

特性

Hamake

Oozie

Azkaban

Cascading

|
|

工作流描述语言

XML

XML (xPDL based)

text file with key/value pairs

Java API

|
|

依赖机制

data-driven

explicit

|
|

是否要web容器

Yes

|
|

进度跟踪

console/log messages

web page

Java API

|
|

Hadoop job调度支持

yes

|
|

运行模式

command line utility

daemon

API

|
|

Pig支持

yes

|
|

事件通知

yes

|
|

需要安装

yes

|
|

支持的hadoop版本

0.18+

0.20+

currently unknown

0.18+

|
|

重试支持

workflownode evel

yes

|
|

运行任意命令

yes

|
|

Amazon EMR支持

yes

currently unknown

yes

其中比较常用的为Azkaban和Oozie。

Azkaban功能特点

1 Web用户界面

2 方便上传工作流

3 方便设置任务之间的关系

4 调度工作流

5 认证/授权(权限的工作)

6 能够杀死并重新启动工作流

7 模块化和可插拔的插件机制

8 项目工作区

9 工作流和任务的日志记录和审计

二、Azkaban使用

  Azkaban有web界面，输入[https://localhost:8443](https://localhost:8443/) （注意是https）可以访问Azkaban的用户界面。如图：

[图片上传失败...(image-b8de71-1535698211232)]

首页有四个菜单

projects：最重要的部分，创建一个工程，所有flows将在工程中运行。
scheduling:显示定时任务
executing:显示当前运行的任务
history:显示历史运行任务

2.1 创建工程

     一个工程包含一个或多个flows，一个flow包含多个job。job是你想在azkaban中运行的一个进程，可以是简单的linux命令，可是java程序，也可以是复杂的shell脚本，当然，如果你安装相关插件，也可以运行插件。一个job可以依赖于另一个job，这种多个job和它们的依赖组成的图表叫做flow。点击右上角的create project，在弹出的窗口中填写工程名和描述即可创建工程。

image.png

2.2 创建job

创建job很简单，只要创建一个以.job结尾的文本文件就行了。比如：

# foo.jobtype=commandcommand=echo foo

如果是多个job并且有依赖关系，可以使用dependencies参数指定依赖关系。如：

# bar.jobtype=commanddependencies=foocommand=echo bar

这样job就创建好了。

2.3 将工作流打包上传

  将上面两个job打成zip包，在页面上点击update上传。上传之后如图：

image.png

2.4 运行

   之后点击绿色的Execute Flow，弹出窗口：

image.png

左边的选项卡依次为：

Flow view：流程视图。可以禁用，启用某些job
Notification:定义任务成功或者失败是否发送邮件
Failure Options:定义一个job失败，剩下的job怎么执行
Concurrent：并行任务执行设置
Flow Parametters：参数设置。

左下角的Schedule是设置调度时间，右下角的Execute为直接运行，点击Execute。运行之后在Graph可以看到：

image.png

在job List中可以看到个job运行的起始终止时间。

image.png

这样工作流的调度就执行完了，Azkaban的使用还是挺简单的吧。

Azkaban安装部署

Azkaban安装

1、准备工作
Azkaban Web服务器
azkaban-web-server-2.5.0.tar.gz
Azkaban执行服务器
azkaban-executor-server-2.5.0.tar.gz

MySQL
目前azkaban只支持 mysql,需安装mysql服务器,本文档中默认已安装好mysql服务器,并建立了 root用户,密码 root.

azkaban下载地址:http://azkaban.github.io/downloads.html

2、安装
将安装文件上传到集群,最好上传到安装 hive、sqoop的机器上,方便命令的执行
在合适的位置新建azkaban目录,用于存放azkaban运行程序
azkaban web服务器安装
解压azkaban-web-server-2.5.0.tar.gz
命令: tar –zxvf azkaban-web-server-2.5.0.tar.gz
将解压后的azkaban-web-server-2.5.0 移动到 azkaban目录中,并重新命名 webserver
命令: mv azkaban-web-server-2.5.0 ../azkaban
cd ../azkaban
mv azkaban-web-server-2.5.0 server

azkaban 执行服器安装
解压azkaban-executor-server-2.5.0.tar.gz
命令:tar –zxvf azkaban-executor-server-2.5.0.tar.gz
将解压后的azkaban-executor-server-2.5.0 移动到 azkaban目录中,并重新命名 executor
命令:mv azkaban-executor-server-2.5.0 ../azkaban
cd ../azkaban
mv azkaban-executor-server-2.5.0 executor

azkaban数据库脚本导入
解压: azkaban-sql-script-2.5.0.tar.gz
命令:tar –zxvf azkaban-sql-script-2.5.0.tar.gz
将解压后的mysql 脚本,导入到mysql中:
进入mysql
mysql> create database azkaban;
mysql> use azkaban;
Database changed
mysql> source /home/hadoop/azkaban-2.5.0/create-all-sql-2.5.0.sql;

创建SSL配置
命令: keytool -keystore keystore -alias jetty -genkey -keyalg RSA
运行此命令后,会提示输入当前生成 keystor的密码及相应信息,输入的密码请劳记,信息如下:

输入keystore密码：
再次输入新密码:
您的名字与姓氏是什么？
[Unknown]：
您的组织单位名称是什么？
[Unknown]：
您的组织名称是什么？
[Unknown]：
您所在的城市或区域名称是什么？
[Unknown]：
您所在的州或省份名称是什么？
[Unknown]：
该单位的两字母国家代码是什么
[Unknown]： CN
CN=Unknown, OU=Unknown, O=Unknown, L=Unknown, ST=Unknown, C=CN 正确吗？
[否]： y

输入的主密码
（如果和 keystore 密码相同，按回车）：
再次输入新密码:
完成上述工作后,将在当前目录生成 keystore 证书文件,将keystore 考贝到 azkaban web服务器根目录中的bin目录下.如:cp keystore azkaban/webserver/bin

配置文件
注：先配置好服务器节点上的时区
1、先生成时区配置文件Asia/Shanghai，用交互式命令 tzselect 即可
2、拷贝该时区文件，覆盖系统本地时区配置
cp /usr/share/zoneinfo/Asia/Shanghai /etc/localtime

3.配置文件的修改
azkaban web服务器配置
进入azkaban web服务器安装目录 conf目录

修改azkaban.properties文件
命令vi azkaban.properties
内容说明如下:

#Azkaban Personalization Settings
azkaban.name=Test                           #服务器UI名称,用于服务器上方显示的名字
azkaban.label=My Local Azkaban                               #描述
azkaban.color=#FF3601                                                 #UI颜色
azkaban.default.servlet.path=/index                         #
web.resource.dir=web/                                                 #默认根web目录
default.timezone.id=Asia/Shanghai                           #默认时区,已改为亚洲/上海 默认为美国

#Azkaban UserManager class
user.manager.class=azkaban.user.XmlUserManager   #用户权限管理默认类
user.manager.xml.file=conf/azkaban-users.xml              #用户配置,具体配置参加下文

#Loader for projects
executor.global.properties=conf/global.properties    # global配置文件所在位置
azkaban.project.dir=projects                                                #

database.type=mysql                                                              #数据库类型
mysql.port=3306                                                                       #端口号
mysql.host=hadoop03                                                      #数据库连接IP
mysql.database=azkaban                                                       #数据库实例名
mysql.user=root                                                                 #数据库用户名
mysql.password=root                                                          #数据库密码
mysql.numconnections=100                                                  #最大连接数

# Velocity dev mode
velocity.dev.mode=false
# Jetty服务器属性.
jetty.maxThreads=25                                                               #最大线程数
jetty.ssl.port=8443                                                                   #Jetty SSL端口
jetty.port=8081                                                                         #Jetty端口
jetty.keystore=keystore                                                          #SSL文件名
jetty.password=123456                                                             #SSL文件密码
jetty.keypassword=123456                                                      #Jetty主密码 与 keystore文件相同
jetty.truststore=keystore                                                                #SSL文件名
jetty.trustpassword=123456                                                   # SSL文件密码

# 执行服务器属性
executor.port=12321                                                               #执行服务器端口

# 邮件设置
[email protected]                                       #发送邮箱
mail.host=smtp.163.com                                                       #发送邮箱smtp地址
mail.user=xxxxxxxx                                       #发送邮件时显示的名称
mail.password=**********                                                 #邮箱密码
[email protected]                              #任务失败时发送邮件的地址
[email protected]                            #任务成功时发送邮件的地址
lockdown.create.projects=false                                           #
cache.directory=cache                                                            #缓存目录

azkaban 执行服务器配置
进入执行服务器安装目录conf,修改azkaban.properties
vi azkaban.properties

#Azkaban
default.timezone.id=Asia/Shanghai                                              #时区

# Azkaban JobTypes 插件配置
azkaban.jobtype.plugin.dir=plugins/jobtypes                   #jobtype 插件所在位置

#Loader for projects
executor.global.properties=conf/global.properties
azkaban.project.dir=projects

#数据库设置
database.type=mysql                                                                       #数据库类型(目前只支持mysql)
mysql.port=3306                                                                                #数据库端口号
mysql.host=192.168.20.200                                                           #数据库IP地址
mysql.database=azkaban                                                                #数据库实例名
mysql.user=azkaban                                                                         #数据库用户名
mysql.password=oracle                                                                   #数据库密码
mysql.numconnections=100                                                           #最大连接数

# 执行服务器配置
executor.maxThreads=50                                                                #最大线程数
executor.port=12321                                                               #端口号(如修改,请与web服务中一致)
executor.flow.threads=30                                                                #线程数

用户配置
进入azkaban web服务器conf目录,修改azkaban-users.xml
vi azkaban-users.xml 增加管理员用户


        
        
        #添加下面这行

4、启动
web服务器
在azkaban web服务器目录下执行启动命令
bin/azkaban-web-start.sh
注:在web服务器根目录运行

执行服务器
在执行服务器目录下执行启动命令
bin/azkaban-executor-start.sh ./
注:只能要执行服务器根目录运行

启动完成后,在浏览器(建议使用谷歌浏览器)中输入https://服务器IP地址:8443 ,即可访问azkaban服务了.在登录中输入刚才新的户用名及密码,点击 login.

启动可能出现的问题：
启动azkaban时出现User xml file conf/azkaban-users.xml doesn’t exist问题或登录页没有样式：修改配置文件里面的内容为绝对路径；
启动azkaban时报错mysql无法连接，但配置文件都填的无误：mysql没有开放外网访问权限。

使用实例

一、command类型单一job
1 创建job描述文件

#command.job
type=command
command=echo 'hello'

2 将job打包成zip文件

zip command.job

3 通过azkaban网页创建project并将job压缩包上传

image.png

image.png

4 启动job

image.png

二、command类型多job工作流flow
1 创建有依赖关系的多个job描述
第一个job

#foo.job
type=command
command=echo foo

第二个job：bar.job依赖foo.job

type=command
dependencies=foo
command=echo bar

2 将所有的job资源文件打包到一个zip文件中

image.png

3 在azkaban的web管理界面创建工程并上传zip包
4 启动工作流flow

三、HDFS操作任务
1 创建job描述文件

# fs.job
type=command
command=/home/hadoop/apps/hadoop-2.6.1/bin/hadoop fs -mkdir /azaz

2 将job资源文件打包成zip文件

image.png

3、通过azkaban的web管理平台创建project并上传job压缩包
4、启动执行该job

四、MAPREDUCE任务
Mr任务依然可以使用command的job类型来执行
1 创建job描述文件，及mr程序jar包（示例中直接使用hadoop自带的example jar）

# mrwc.job
type=command
command=/home/hadoop/apps/hadoop-2.6.1/bin/hadoop  jar hadoop-mapreduce-examples-2.6.1.jar wordcount /wordcount/input /wordcount/azout

2 将所有job资源文件打到一个zip包中

image.png

3 在azkaban的web管理界面创建工程并上传zip包
4 启动job

五、HIVE脚本任务
1 创建job描述文件和hive脚本
Hive脚本： test.sql

use default;
drop table aztest;
create table aztest(id int,name string) row format delimited fields terminated by ',';
load data inpath '/aztest/hiveinput' into table aztest;
create table azres as select * from aztest;
insert overwrite directory '/aztest/hiveoutput' select count(1) from aztest;

Job描述文件：hivef.job

# hivef.job
type=command
command=/home/hadoop/apps/hive/bin/hive -f 'test.sql'

2 将所有job资源文件打到一个zip包中
3 在azkaban的web管理界面创建工程并上传zip包
4 启动job

Azkaban工作流引擎和Flume数据采集

.Azkaban工作流引擎和Flume数据采集

Azkaban介绍

一、Azkaban简介

为什么需要工作流调度系统？

常见工作流调度系统

Azkaban功能特点

二、Azkaban使用

2.1 创建工程

2.2 创建job

2.3 将工作流打包上传

2.4 运行

Azkaban安装部署

Azkaban安装

使用实例

Azkaban应用

一、业务场景

二、处理思路

三、具体job编写

四、打包运行

Flume介绍

Flume安装

Flume安装

Flume内部原理

Source、Channel、Sink

Flume应用案例

时间参数一定要带上 true

你可能感兴趣的:(Azkaban工作流引擎和Flume数据采集)