GitChat的博客

Flink 快速实战开发

Flink 可谓是开启了流式计算技术的新时代，现在无论大中小公司基本上都对 Flink 技术有不同程度的尝试，或是已经进行了大量实时计算的改造。伴随着阿里对 Flink 的极力推崇，Flink 无论从自身优势还是外部言论都必将成为主流。

在本场 Chat 中，不光有从零开始的基础，更有理论讲解及实战使用，会讲到如下内容：

初识 Flink 及重要特点
快速上手 Flink：流处理/批处理
Flink 部署模式：Standalone/Yarn
Flink 运行架构及调度原理
Flink 流处理 API 细致讲解
Time 与 Window 的使用、Watermark 水印的引入
Table API 与 SQL
Flink CEP 介绍及使用

第一章 Flink 简介

1.1 初识 Flink

Flink 起源于 Stratosphere 项目，Stratosphere 是在 2010~2014 年由 3 所地处柏林的大学和欧洲的一些其他的大学共同进行的研究项目，2014 年 4 月 Stratosphere 的代码被复制并捐赠给了 Apache 软件基金会，参加这个孵化项目的初始成员是 Stratosphere 系统的核心开发人员，2014 年 12 月，Flink 一跃成为 Apache 软件基金会的顶级项目。

在德语中，Flink 一词表示快速和灵巧，项目采用一只松鼠的彩色图案作为 logo，这不仅是因为松鼠具有快速和灵巧的特点，还因为柏林的松鼠有一种迷人的红棕色，而 Flink 的松鼠 logo 拥有可爱的尾巴，尾巴的颜色与 Apache 软件基金会的 logo 颜色相呼应，也就是说，这是一只 Apache 风格的松鼠。Flink Logo

Flink 项目的理念是：“Apache Flink 是为分布式、高性能、随时可用以及准确的流处理应用程序打造的开源流处理框架”。

Apache Flink 是一个框架和分布式处理引擎，用于对无界和有界数据流进行有状态计算。Flink 被设计在所有常见的集群环境中运行，以内存执行速度和任意规模来执行计算。

1.2 Flink 的重要特点

1.2.1 事件驱动型 (Event-driven)

事件驱动型应用是一类具有状态的应用，它从一个或多个事件流提取数据，并根据到来的事件触发计算、状态更新或其他外部动作。比较典型的就是以 kafka 为代表的消息队列几乎都是事件驱动型应用。

与之不同的就是 SparkStreaming 微批次，如图：事件驱动型：

1.2.2 流与批的世界观

批处理的特点是有界、持久、大量，非常适合需要访问全套记录才能完成的计算工作，一般用于离线统计。

流处理的特点是无界、实时, 无需针对整个数据集执行操作，而是对通过系统传输的每个数据项执行操作，一般用于实时统计。

在 spark 的世界观中，一切都是由批次组成的，离线数据是一个大批次，而实时数据是由一个一个无限的小批次组成的。

而在 flink 的世界观中，一切都是由流组成的，离线数据是有界限的流，实时数据是一个没有界限的流，这就是所谓的有界流和无界流。

无界数据流：无界数据流有一个开始但是没有结束，它们不会在生成时终止并提供数据，必须连续处理无界流，也就是说必须在获取后立即处理 event。对于无界数据流我们无法等待所有数据都到达，因为输入是无界的，并且在任何时间点都不会完成。处理无界数据通常要求以特定顺序（例如事件发生的顺序）获取 event，以便能够推断结果完整性。

有界数据流：有界数据流有明确定义的开始和结束，可以在执行任何计算之前通过获取所有数据来处理有界流，处理有界流不需要有序获取，因为可以始终对有界数据集进行排序，有界流的处理也称为批处理。这种以流为世界观的架构，获得的最大好处就是具有极低的延迟。

1.2.3 分层 API

最底层级的抽象仅仅提供了有状态流，它将通过过程函数（Process Function）被嵌入到 DataStream API 中。底层过程函数（Process Function）与 DataStream API 相集成，使其可以对某些特定的操作进行底层的抽象，它允许用户可以自由地处理来自一个或多个数据流的事件，并使用一致的容错的状态。除此之外，用户可以注册事件时间并处理时间回调，从而使程序可以处理复杂的计算。

实际上，大多数应用并不需要上述的底层抽象，而是针对核心 API（Core APIs）进行编程，比如 DataStream API（有界或无界流数据）以及 DataSet API（有界数据集）。这些 API 为数据处理提供了通用的构建模块，比如由用户定义的多种形式的转换（transformations），连接（joins），聚合（aggregations），窗口操作（windows）等等。DataSet API 为有界数据集提供了额外的支持，例如循环与迭代。这些 API 处理的数据类型以类（classes）的形式由各自的编程语言所表示。

Table API 是以表为中心的声明式编程，其中表可能会动态变化（在表达流数据时）。Table API 遵循（扩展的）关系模型：表有二维数据结构（schema）（类似于关系数据库中的表），同时 API 提供可比较的操作，例如 select、project、join、group-by、aggregate 等。Table API 程序声明式地定义了什么逻辑操作应该执行，而不是准确地确定这些操作代码的看上去如何。

尽管 Table API 可以通过多种类型的用户自定义函数（UDF）进行扩展，其仍不如核心 API 更具表达能力，但是使用起来却更加简洁（代码量更少）。除此之外，Table API 程序在执行之前会经过内置优化器进行优化。

你可以在表与 DataStream/DataSet 之间无缝切换，以允许程序将 Table API 与 DataStream 以及 DataSet 混合使用。

Flink 提供的最高层级的抽象是 SQL 。这一层抽象在语法与表达能力上与 Table API 类似，但是是以 SQL 查询表达式的形式表现程序。SQL 抽象与 Table API 交互密切，同时 SQL 查询可以直接在 Table API 定义的表上执行。

目前 Flink 作为批处理还不是主流，不如 Spark 成熟，所以 DataSet 使用的并不是很多。Flink Table API 和 Flink SQL 也并不完善，大多都由各大厂商自己定制。所以我们主要说 DataStream API 的使用。实际上 Flink 作为最接近 Google DataFlow 模型的实现，是流批统一的观点，所以基本上使用 DataStream 就可以了。

第二章快速上手

2.1 搭建 maven 工程 FlinkTutorial

2.1.1 pom 文件

    4.0.0    com.test.flink    FlinkTutorial    1.0-SNAPSHOT                        org.apache.flink            flink-scala_2.11            1.7.2                                    org.apache.flink            flink-streaming-scala_2.11            1.7.2                                net.alchim31.maven        scala-maven-plugin        3.4.6                                                                        testCompile                                                            org.apache.maven.plugins            maven-assembly-plugin            3.0.0                                                jar-with-dependencies                                                                            make-assembly                    package                                            single

2.1.2 添加 scala 框架和 scala 文件夹

2.2 批处理 wordcount

src/main/scala/com.test.wc/WordCount.scala

object WordCount {  def main(args: Array[String]): Unit = {    // 创建执行环境    val env = ExecutionEnvironment.getExecutionEnvironment    // 从文件中读取数据    val inputPath = "D:\\Projects\\BigData\\TestWC1\\src\\main\\resources\\hello.txt"    val inputDS: DataSet[String] = env.readTextFile(inputPath)    // 分词之后，对单词进行 groupby 分组，然后用 sum 进行聚合    val wordCountDS: AggregateDataSet[(String, Int)] = inputDS.flatMap(_.split(" ")).map((_, 1)).groupBy(0).sum(1)    // 打印输出    wordCountDS.print()  }}

注意：Flink 程序支持 java 和 scala 两种语言，本文中以 scala 语言为主。在引入包中，有 java 和 scala 两种包时注意要使用 scala 的包。

2.3 流处理 wordcount

src/main/scala/com.test.wc/StreamWordCount.scala

object StreamWordCount {  def main(args: Array[String]): Unit = {    // 从外部命令中获取参数    val params: ParameterTool =  ParameterTool.fromArgs(args)    val host: String = params.get("host")    val port: Int = params.getInt("port")    // 创建流处理环境    val env = StreamExecutionEnvironment.getExecutionEnvironment    // 接收 socket 文本流    val textDstream: DataStream[String] = env.socketTextStream(host, port)    // flatMap 和 Map 需要引用的隐式转换    import org.apache.flink.api.scala._    val dataStream: DataStream[(String, Int)] = textDstream.flatMap(_.split("\\s")).filter(_.nonEmpty).map((_, 1)).keyBy(0).sum(1)    dataStream.print().setParallelism(1)    // 启动 executor，执行任务    env.execute("Socket stream word count")  }}

测试——在 linux 系统中用 netcat 命令进行发送测试。

第三章 Flink 部署

3.1 Standalone 模式

3.1.1 安装

解压缩 flink-1.7.2-bin-hadoop27-scala_2.11.tgz，进入 conf 目录中。

修改 flink/conf/flink-conf.yaml 文件：
修改 /conf/slave 文件：
分发给另外两台机子：（分发脚本 xsync 自行编写）
启动：访问 http://localhost:8081 可以对 flink 集群和任务进行监控管理。

3.1.2 提交任务

准备数据文件
把含数据文件的文件夹，分发到 taskmanage 机器中由于读取数据是从本地磁盘读取，实际任务会被分发到 taskmanage 的机器中，所以要把目标文件分发。

执行程序

./flink run -c  com.test.flink.app.BatchWcApp   /ext/flink0503-1.0-SNAPSHOT.jar   --input /applog/flink/input.txt --output /applog/flink/output.csv

到目标文件夹中查看计算结果

注意：计算结果根据会保存到 taskmanage 的机器下，不会在 jobmanage 下。

在 webui 控制台查看计算过程

3.2 Yarn 模式

启动 hadoop 集群
启动 yarn-session

其中：-n(--container)：TaskManager 的数量。-s(--slots)：每个 TaskManager 的 slot 数量，默认一个 slot 一个 core，默认每个 taskmanager 的 slot 的个数为 1，有时可以多一些 taskmanager，做冗余。-jm：JobManager 的内存（单位 MB)。-tm：每个 taskmanager 的内存（单位 MB)。-nm：yarn 的 appName (现在 yarn 的 ui 上的名字)。 -d：后台执行。

执行任务
去 yarn 控制台查看任务状态

第四章 Flink 运行架构

4.1 任务提交流程（yarn 模式）

图 Yarn 模式任务提交流程

Flink 任务提交后，Client 向 HDFS 上传 Flink 的 Jar 包和配置，之后向 Yarn ResourceManager 提交任务，ResourceManager 分配 Container 资源并通知对应的 NodeManager 启动 ApplicationMaster，ApplicationMaster 启动后加载 Flink 的 Jar 包和配置构建环境，然后启动 JobManager，之后 ApplicationMaster 向 ResourceManager 申请资源启动 TaskManager，ResourceManager 分配 Container 资源后，由 ApplicationMaster 通知资源所在节点的 NodeManager 启动 TaskManager，NodeManager 加载 Flink 的 Jar 包和配置构建环境并启动 TaskManager，TaskManager 启动后向 JobManager 发送心跳包，并等待 JobManager 向其分配任务。

4.2 任务调度原理

图任务调度原理

客户端不是运行时和程序执行的一部分，但它用于准备并发送 dataflow(JobGraph)给 Master(JobManager)，然后，客户端断开连接或者维持连接以等待接收计算结果。

当 Flink 集群启动后，首先会启动一个 JobManger 和一个或多个的 TaskManager。由 Client 提交任务给 JobManager，JobManager 再调度任务到各个 TaskManager 去执行，然后 TaskManager 将心跳和统计信息汇报给 JobManager。TaskManager 之间以流的形式进行数据的传输。上述三者均为独立的 JVM 进程。

Client 为提交 Job 的客户端，可以是运行在任何机器上（与 JobManager 环境连通即可）。提交 Job 后，Client 可以结束进程（Streaming 的任务），也可以不结束并等待结果返回。

JobManager 主要负责调度 Job 并协调 Task 做 checkpoint，职责上很像 Storm 的 Nimbus。从 Client 处接收到 Job 和 JAR 包等资源后，会生成优化后的执行计划，并以 Task 的单元调度到各个 TaskManager 去执行。

TaskManager 在启动的时候就设置好了槽位数（Slot），每个 slot 能启动一个 Task，Task 为线程。从 JobManager 处接收需要部署的 Task，部署启动后，与自己的上游建立 Netty 连接，接收数据并处理。

关于执行图

Flink 中的执行图可以分成四层：StreamGraph -> JobGraph -> ExecutionGraph -> 物理执行图。

StreamGraph：是根据用户通过 Stream API 编写的代码生成的最初的图。用来表示程序的拓扑结构。

JobGraph：StreamGraph 经过优化后生成了 JobGraph，提交给 JobManager 的数据结构。主要的优化为，将多个符合条件的节点 chain 在一起作为一个节点，这样可以减少数据在节点之间流动所需要的序列化/反序列化/传输消耗。

ExecutionGraph：JobManager 根据 JobGraph 生成 ExecutionGraph。ExecutionGraph 是 JobGraph 的并行化版本，是调度层最核心的数据结构。

物理执行图：JobManager 根据 ExecutionGraph 对 Job 进行调度后，在各个 TaskManager 上部署 Task 后形成的“图”，并不是一个具体的数据结构。

4.3 Worker 与 Slots

每一个 worker(TaskManager) 都是一个 JVM 进程，它可能会在独立的线程上执行一个或多个 subtask。为了控制一个 worker 能接收多少个 task，worker 通过 task slot 来进行控制（一个 worker 至少有一个 task slot）。

每个 task slot 表示 TaskManager 拥有资源的一个固定大小的子集。假如一个 TaskManager 有三个 slot，那么它会将其管理的内存分成三份给各个 slot。资源 slot 化意味着一个 subtask 将不需要跟来自其他 job 的 subtask 竞争被管理的内存，取而代之的是它将拥有一定数量的内存储备。需要注意的是，这里不会涉及到 CPU 的隔离，slot 目前仅仅用来隔离 task 的受管理的内存。

通过调整 task slot 的数量，允许用户定义 subtask 之间如何互相隔离。如果一个 TaskManager 一个 slot，那将意味着每个 task group 运行在独立的 JVM 中（该 JVM 可能是通过一个特定的容器启动的），而一个 TaskManager 多个 slot 意味着更多的 subtask 可以共享同一个 JVM。而在同一个 JVM 进程中的 task 将共享 TCP 连接（基于多路复用）和心跳消息。它们也可能共享数据集和数据结构，因此这减少了每个 task 的负载。图 TaskManager 与 Slot

Task Slot 是静态的概念，是指 TaskManager 具有的并发执行能力，可以通过参数 taskmanager.numberOfTaskSlots 进行配置；而并行度 parallelism 是动态概念，即 TaskManager 运行程序时实际使用的并发能力，可以通过参数 parallelism.default 进行配置。

也就是说，假设一共有 3 个 TaskManager，每一个 TaskManager 中的分配 3 个 TaskSlot，也就是每个 TaskManager 可以接收 3 个 task，一共 9 个 TaskSlot，如果我们设置 parallelism.default=1，即运行程序默认的并行度为 1，9 个 TaskSlot 只用了 1 个，有 8 个空闲，因此，设置合适的并行度才能提高效率。

4.4 程序与数据流

所有的 Flink 程序都是由三部分组成的： Source 、Transformation和Sink。

Source 负责读取数据源，Transformation 利用各种算子进行处理加工，Sink 负责输出。

在运行时，Flink 上运行的程序会被映射成 streaming dataflows，它包含了这三部分。每一个 dataflow 以一个或多个 sources 开始以一个或多个 sinks 结束。dataflow 类似于任意的有向无环图（DAG），当然特定形式的环可以通过 iteration 构建。在大部分情况下，程序中的 transformations 跟 dataflow 中的 operator 是一一对应的关系，但有时候，一个 transformation 可能对应多个 operator。图程序与数据流

4.5 并行数据流

Flink 程序的执行具有并行、分布式的特性。在执行过程中，一个 stream 包含一个或多个 stream partition ，而每一个 operator 包含一个或多个 operator subtask，这些 operator subtasks 在不同的线程、不同的物理机或不同的容器中彼此互不依赖得执行。

一个特定 operator 的 subtask 的个数被称之为其 parallelism(并行度)。一个 stream 的并行度总是等同于其 producing operator 的并行度。一个程序中，不同的 operator 可能具有不同的并行度。图并行数据流

Stream 在 operator 之间传输数据的形式可以是 one-to-one(forwarding)的模式也可以是 redistributing 的模式，具体是哪一种形式，取决于 operator 的种类。

One-to-one：stream(比如在 source 和 map operator 之间)维护着分区以及元素的顺序。那意味着 map operator 的 subtask 看到的元素的个数以及顺序跟 source operator 的 subtask 生产的元素的个数、顺序相同，map、fliter、flatMap 等算子都是 one-to-one 的对应关系。

Ø 类似于 spark 中的窄依赖

Redistributing：stream(map()跟 keyBy/window 之间或者 keyBy/window 跟 sink 之间)的分区会发生改变。每一个 operator subtask 依据所选择的 transformation 发送数据到不同的目标 subtask。例如，keyBy() 基于 hashCode 重分区、broadcast 和 rebalance 会随机重新分区，这些算子都会引起 redistribute 过程，而 redistribute 过程就类似于 Spark 中的 shuffle 过程。

Ø 类似于 spark 中的宽依赖

4.6 task 与 operator chains

相同并行度的 one to one 操作，Flink 这样相连的 operator 链接在一起形成一个 task，原来的 operator 成为里面的 subtask。将 operators 链接成 task 是非常有效的优化：它能减少线程之间的切换和基于缓存区的数据交换，在减少时延的同时提升吞吐量。链接的行为可以在编程 API 中进行指定。图 task 与 operator chains

第五章 Flink 流处理 Api

5.1 Environment

5.1.1 getExecutionEnvironment

创建一个执行环境，表示当前执行程序的上下文。如果程序是独立调用的，则此方法返回本地执行环境；如果从命令行客户端调用程序以提交到集群，则此方法返回此集群的执行环境，也就是说，getExecutionEnvironment 会根据查询运行的方式决定返回什么样的运行环境，是最常用的一种创建执行环境的方式。

val env: ExecutionEnvironment = ExecutionEnvironment.getExecutionEnvironmentval env = StreamExecutionEnvironment.getExecutionEnvironment

如果没有设置并行度，会以 flink-conf.yaml 中的配置为准，默认是 1。

5.1.2 createLocalEnvironment

返回本地执行环境，需要在调用时指定默认的并行度。

5.1.3 createRemoteEnvironment

返回集群执行环境，将 Jar 提交到远程服务器。需要在调用时指定 JobManager 的 IP 和端口号，并指定要在集群中运行的 Jar 包。

5.2 Source

5.2.1 从集合读取数据

// 定义样例类，传感器 id，时间戳，温度case class SensorReading(id: String, timestamp: Long, temperature: Double)object Sensor {  def main(args: Array[String]): Unit = {    val env = StreamExecutionEnvironment.getExecutionEnvironment    val stream1 = env      .fromCollection(List(        SensorReading("sensor_1", 1547718199, 35.80018327300259),        SensorReading("sensor_6", 1547718201, 15.402984393403084),        SensorReading("sensor_7", 1547718202, 6.720945201171228),        SensorReading("sensor_10", 1547718205, 38.101067604893444)      ))    stream1.print("stream1:").setParallelism(1)    env.execute()  }}

5.2.2 从文件读取数据

val stream2 = env.readTextFile("YOUR_FILE_PATH")

5.2.3 以 kafka 消息队列的数据作为来源

val properties = new Properties()properties.setProperty("bootstrap.servers", "localhost:9092")properties.setProperty("group.id", "consumer-group")properties.setProperty("key.deserializer", "org.apache.kafka.common.serialization.StringDeserializer")properties.setProperty("value.deserializer", "org.apache.kafka.common.serialization.StringDeserializer")properties.setProperty("auto.offset.reset", "latest")val stream3 = env.addSource(new FlinkKafkaConsumer011[String]("sensor", new SimpleStringSchema(), properties))

Flink+kafka是如何实现exactly-once语义的？

Flink 通过 checkpoint 来保存数据是否处理完成的状态。

由 JobManager 协调各个 TaskManager 进行 checkpoint 存储，checkpoint 保存在 StateBackend 中，默认 StateBackend 是内存级的，也可以改为文件级的进行持久化保存。

执行过程实际上是一个两段式提交，每个算子执行完成，会进行“预提交”，直到执行完 sink 操作，会发起“确认提交”，如果执行失败，预提交会放弃掉。

如果宕机需要通过 StateBackend 进行恢复，只能恢复所有确认提交的操作。

5.3 Transform

转换算子

5.3.1 map

5.3.2 flatMap

flatMap 的函数签名：def flatMapA,B(f: A ⇒ List[B]): List[B]

例如：flatMap(List(1,2,3))(i ⇒ List(i,i))

结果是 List(1,1,2,2,3,3),

而 List("a b", "c d").flatMap(line ⇒ line.split(" "))

结果是 List(a, b, c, d)。

5.3.3 Filter

5.3.4 KeyBy

DataStream → KeyedStream：逻辑地将一个流拆分成不相交的分区，每个分区包含具有相同 key 的元素，在内部以 hash 的形式实现的。

5.3.5 滚动聚合算子（Rolling Aggregation）

这些算子可以针对 KeyedStream 的每一个支流做聚合。

sum()、min()、max()、minBy()、maxBy()

5.3.6 Reduce

KeyedStream → DataStream：一个分组数据流的聚合操作，合并当前的元素和上次聚合的结果，产生一个新的值，返回的流中包含每一次聚合的结果，而不是只返回最后一次聚合的最终结果。

val stream2 = env.readTextFile("YOUR_PATH\\sensor.txt")  .map( data => {    val dataArray = data.split(",")    SensorReading(dataArray(0).trim, dataArray(1).trim.toLong, dataArray(2).trim.toDouble)  })  .keyBy("id")  .reduce( (x, y) => SensorReading(x.id, x.timestamp + 1, y.temperature) )

5.3.7 Split 和 Select

Split图 Split

DataStream → SplitStream：根据某些特征把一个 DataStream 拆分成两个或者多个 DataStream。

Select图 Select

SplitStream→DataStream：从一个 SplitStream 中获取一个或者多个 DataStream。

需求：传感器数据按照温度高低（以 30 度为界），拆分成两个流。

val splitStream = stream2  .split( sensorData => {    if (sensorData.temperature > 30) Seq("high") else Seq("low")  } )val high = splitStream.select("high")val low = splitStream.select("low")val all = splitStream.select("high", "low")

5.3.8 Connect 和 CoMap

图 Connect 算子

DataStream,DataStream → ConnectedStreams：连接两个保持他们类型的数据流，两个数据流被 Connect 之后，只是被放在了一个同一个流中，内部依然保持各自的数据和形式不发生任何变化，两个流相互独立。

CoMap,CoFlatMap图 CoMap/CoFlatMap

ConnectedStreams → DataStream：作用于 ConnectedStreams 上，功能与 map 和 flatMap 一样，对 ConnectedStreams 中的每一个 Stream 分别进行 map 和 flatMap 处理。

val warning = high.map( sensorData => (sensorData.id, sensorData.temperature) )val connected = warning.connect(low)val coMap = connected.map(    warningData => (warningData._1, warningData._2, "warning"),    lowData => (lowData.id, "healthy"))

5.3.9 Union

图 Union

DataStream → DataStream：对两个或者两个以上的 DataStream 进行 union 操作，产生一个包含所有 DataStream 元素的新 DataStream。注意:如果你将一个 DataStream 跟它自己做 union 操作，在新的 DataStream 中，你将看到每一个元素都出现两次。

//合并以后打印val unionStream: DataStream[StartUpLog] = appStoreStream.union(otherStream)unionStream.print("union:::")

Connect 与 Union 区别：

Union 之前两个流的类型必须是一样，Connect 可以不一样，在之后的 coMap 中再去调整成为一样的。
Connect 只能操作两个流，Union 可以操作多个。

5.4 Sink

Flink 没有类似于 spark 中 foreach 方法，让用户进行迭代的操作。虽有对外的输出操作都要利用 Sink 完成。最后通过类似如下方式完成整个任务最终输出操作。

  stream.addSink(new MySink(xxxx))

官方提供了一部分的框架的 sink。除此以外，需要用户自定义实现 sink。

5.4.1 Kafka

pom.xml

    org.apache.flink    flink-connector-kafka-0.11_2.11    1.7.2

主函数中添加 sink：

val union = high.union(low).map(_.temperature.toString)union.addSink(new FlinkKafkaProducer011[String]("localhost:9092", "test", new SimpleStringSchema()))

5.4.2 Redis

pom.xml

    org.apache.bahir    flink-connector-redis_2.11    1.0

定义一个 redis 的 mapper 类，用于定义保存到 redis 时调用的命令：

class MyRedisMapper extends RedisMapper[SensorReading]{  override def getCommandDescription: RedisCommandDescription = {    new RedisCommandDescription(RedisCommand.HSET, "sensor_temperature")  }  override def getValueFromData(t: SensorReading): String = t.temperature.toString  override def getKeyFromData(t: SensorReading): String = t.id}

在主函数中调用：

val conf = new FlinkJedisPoolConfig.Builder().setHost("localhost").setPort(6379).build()dataStream.addSink( new RedisSink[SensorReading](conf, new MyRedisMapper) )

5.4.3 Elasticsearch

pom.xml

    org.apache.flink    flink-connector-elasticsearch6_2.11    1.7.2

在主函数中调用：

val httpHosts = new util.ArrayList[HttpHost]()httpHosts.add(new HttpHost("localhost", 9200))val esSinkBuilder = new ElasticsearchSink.Builder[SensorReading]( httpHosts, new ElasticsearchSinkFunction[SensorReading] {  override def process(t: SensorReading, runtimeContext: RuntimeContext, requestIndexer: RequestIndexer): Unit = {    println("saving data: " + t)    val json = new util.HashMap[String, String]()    json.put("data", t.toString)    val indexRequest = Requests.indexRequest().index("sensor").`type`("readingData").source(json)    requestIndexer.add(indexRequest)    println("saved successfully")  }} )dataStream.addSink( esSinkBuilder.build() )

5.4.4 JDBC 自定义 sink

    mysql    mysql-connector-java    5.1.44    com.alibaba    druid    1.1.10

添加 MyJdbcSink

class MyJdbcSink(sql:String ) extends  RichSinkFunction[Array[Any]] {  val driver="com.mysql.jdbc.Driver"  val url="jdbc:mysql://localhost:3306/sensor?useSSL=false"  val username="root"  val password="123456"  val maxActive="20"  var connection:Connection=null;  //创建连接  override def open(parameters: Configuration): Unit = {    val properties = new Properties()    properties.put("driverClassName",driver)    properties.put("url",url)    properties.put("username",username)    properties.put("password",password)    properties.put("maxActive",maxActive)    val dataSource: DataSource = DruidDataSourceFactory.createDataSource(properties)    connection = dataSource.getConnection()  }  //反复调用连接，执行 sql  override def invoke(values: Array[Any]): Unit = {    // 预编译器    val ps: PreparedStatement = connection.prepareStatement(sql )    println(values.mkString(","))    for (i <- 0 until values.length) {    // 坐标从 1 开始      ps.setObject(i + 1, values(i))    }    // 执行操作    ps.executeUpdate()  }  override def close(): Unit = {    if(connection!=null){      connection.close()    }  }}

在 main 方法中增加，把明细保存到 mysql 中

val jdbcSink = new MyJdbcSink("insert into sensorReading values(?,?,?)")dataDstream.map(data=>Array(data.id,data.timestamp,data.temperature)).addSink(jdbcSink)

第六章 Time 与 Window

6.1 Time

在 Flink 的流式处理中，会涉及到时间的不同概念，如下图所示：图 Flink 时间概念

Event Time：是事件创建的时间。它通常由事件中的时间戳描述，例如采集的日志数据中，每一条日志都会记录自己的生成时间，Flink 通过时间戳分配器访问事件时间戳。

Ingestion Time：是数据进入 Flink 的时间。

Processing Time：是每一个执行基于时间操作的算子的本地系统时间，与机器相关，默认的时间属性就是 Processing Time。

一个例子——电影《星球大战》：例如，一条日志进入 Flink 的时间为 2017-11-12 10:00:00.123，到达 Window 的系统时间为 2017-11-12 10:00:01.234，日志的内容如下：

2017-11-02 18:37:15.624 INFO Fail over to rm2

对于业务来说，要统计 1min 内的故障日志个数，哪个时间是最有意义的？—— eventTime，因为我们要根据日志的生成时间进行统计。

6.2 Window

6.2.1 Window 概述

streaming 流式计算是一种被设计用于处理无限数据集的数据处理引擎，而无限数据集是指一种不断增长的本质上无限的数据集，而 window 是一种切割无限数据为有限块进行处理的手段。

Window 是无限数据流处理的核心，Window 将一个无限的 stream 拆分成有限大小的”buckets”桶，我们可以在这些桶上做计算操作。

6.2.2 Window 类型

Window 可以分成两类：

CountWindow：按照指定的数据条数生成一个 Window，与时间无关。
TimeWindow：按照时间生成 Window。

对于 TimeWindow，可以根据窗口实现原理的不同分成三类：滚动窗口（Tumbling Window）、滑动窗口（Sliding Window）和会话窗口（Session Window）。

滚动窗口（Tumbling Windows）

将数据依据固定的窗口长度对数据进行切片。

特点：时间对齐，窗口长度固定，没有重叠。

滚动窗口分配器将每个元素分配到一个指定窗口大小的窗口中，滚动窗口有一个固定的大小，并且不会出现重叠。例如：如果你指定了一个 5 分钟大小的滚动窗口，窗口的创建如下图所示：图滚动窗口

适用场景：适合做 BI 统计等（做每个时间段的聚合计算）。

滑动窗口（Sliding Windows）

滑动窗口是固定窗口的更广义的一种形式，滑动窗口由固定的窗口长度和滑动间隔组成。

特点：时间对齐，窗口长度固定，有重叠。

滑动窗口分配器将元素分配到固定长度的窗口中，与滚动窗口类似，窗口的大小由窗口大小参数来配置，另一个窗口滑动参数控制滑动窗口开始的频率。因此，滑动窗口如果滑动参数小于窗口大小的话，窗口是可以重叠的，在这种情况下元素会被分配到多个窗口中。

例如，你有 10 分钟的窗口和 5 分钟的滑动，那么每个窗口中 5 分钟的窗口里包含着上个 10 分钟产生的数据，如下图所示：图滑动窗口

适用场景：对最近一个时间段内的统计（求某接口最近 5min 的失败率来决定是否要报警）。

会话窗口（Session Windows）

由一系列事件组合一个指定时间长度的 timeout 间隙组成，类似于 web 应用的 session，也就是一段时间没有接收到新数据就会生成新的窗口。

特点：时间无对齐。

session 窗口分配器通过 session 活动来对元素进行分组，session 窗口跟滚动窗口和滑动窗口相比，不会有重叠和固定的开始时间和结束时间的情况，相反，当它在一个固定的时间周期内不再收到元素，即非活动间隔产生，那个这个窗口就会关闭。一个 session 窗口通过一个 session 间隔来配置，这个 session 间隔定义了非活跃周期的长度，当这个非活跃周期产生，那么当前的 session 将关闭并且后续的元素将被分配到新的 session 窗口中去。图会话窗口

6.3 Window API

6.3.1 TimeWindow

TimeWindow 是将指定时间范围内的所有数据组成一个 window，一次对一个 window 里面的所有数据进行计算。

滚动窗口

Flink 默认的时间窗口根据 Processing Time 进行窗口的划分，将 Flink 获取到的数据根据进入 Flink 的时间划分到不同的窗口中。

val minTempPerWindow = dataStream  .map(r => (r.id, r.temperature))  .keyBy(_._1)  .timeWindow(Time.seconds(15))  .reduce((r1, r2) => (r1._1, r1._2.min(r2._2)))

时间间隔可以通过 Time.milliseconds(x)，Time.seconds(x)，Time.minutes(x)等其中的一个来指定。

滑动窗口（SlidingEventTimeWindows）

滑动窗口和滚动窗口的函数名是完全一致的，只是在传参数时需要传入两个参数，一个是 windowsize，一个是 slidingsize。

下面代码中的 sliding_size 设置为了 5s，也就是说，窗口每 5s 就计算一次，每一次计算的 window 范围是 15s 内的所有元素。

val minTempPerWindow: DataStream[(String, Double)] = dataStream  .map(r => (r.id, r.temperature))  .keyBy(_._1)  .timeWindow(Time.seconds(15), Time.seconds(5))  .reduce((r1, r2) => (r1._1, r1._2.min(r2._2)))

时间间隔可以通过 Time.milliseconds(x)，Time.seconds(x)，Time.minutes(x)等其中的一个来指定。

6.3.2 CountWindow

CountWindow 根据窗口中相同 key 元素的数量来触发执行，执行时只计算元素数量达到窗口大小的 key 对应的结果。

注意：CountWindow 的 window_size 指的是相同 Key 的元素的个数，不是输入的所有元素的总数。

滚动窗口

默认的 CountWindow 是一个滚动窗口，只需要指定窗口大小即可，当元素数量达到窗口大小时，就会触发窗口的执行。

val minTempPerWindow: DataStream[(String, Double)] = dataStream  .map(r => (r.id, r.temperature))  .keyBy(_._1)  .countWindow(5)  .reduce((r1, r2) => (r1._1, r1._2.max(r2._2)))

滑动窗口

滑动窗口和滚动窗口的函数名是完全一致的，只是在传参数时需要传入两个参数，一个是 windowsize，一个是 slidingsize。

下面代码中的 sliding_size 设置为了 2，也就是说，每收到两个相同 key 的数据就计算一次，每一次计算的 window 范围是 5 个元素。

val keyedStream: KeyedStream[(String, Int), Tuple] = startUplogDstream.map(startuplog=>(startuplog.ch,1)).keyBy(0)//每当某一个 key 的个数达到 2 的时候,触发计算，计算最近该 key 最近 10 个元素的内容val windowedStream: WindowedStream[(String, Int), Tuple, GlobalWindow] = keyedStream.countWindow(10,2)val sumDstream: DataStream[(String, Int)] = windowedStream.sum(1)

第七章 EventTime 与 Window

7.1 EventTime 的引入

在 Flink 的流式处理中，绝大部分的业务都会使用 eventTime，一般只在 eventTime 无法使用时，才会被迫使用 ProcessingTime 或者 IngestionTime。

如果要使用 EventTime，那么需要引入 EventTime 的时间属性，引入方式如下所示：

val env = StreamExecutionEnvironment.getExecutionEnvironment// 从调用时刻开始给 env 创建的每一个 stream 追加时间特征env.setStreamTimeCharacteristic(TimeCharacteristic.EventTime)

7.2 Watermark

7.2.1 基本概念

我们知道，流处理从事件产生，到流经 source，再到 operator，中间是有一个过程和时间的，虽然大部分情况下，流到 operator 的数据都是按照事件产生的时间顺序来的，但是也不排除由于网络、分布式等原因，导致乱序的产生，所谓乱序，就是指 Flink 接收到的事件的先后顺序不是严格按照事件的 Event Time 顺序排列的。图数据的乱序

那么此时出现一个问题，一旦出现乱序，如果只根据 eventTime 决定 window 的运行，我们不能明确数据是否全部到位，但又不能无限期的等下去，此时必须要有个机制来保证一个特定的时间后，必须触发 window 去进行计算了，这个特别的机制，就是 Watermark。

Watermark 是一种衡量 Event Time 进展的机制，它是数据本身的一个隐藏属性，数据本身携带着对应的 Watermark。
Watermark 是用于处理乱序事件的，而正确的处理乱序事件，通常用 Watermark 机制结合 window 来实现。
数据流中的 Watermark 用于表示 timestamp 小于 Watermark 的数据，都已经到达了，因此，window 的执行也是由 Watermark 触发的。
Watermark 可以理解成一个延迟触发机制，我们可以设置 Watermark 的延时时长 t，每次系统会校验已经到达的数据中最大的 maxEventTime，然后认定 eventTime 小于 maxEventTime - t 的所有数据都已经到达，如果有窗口的停止时间等于 maxEventTime – t，那么这个窗口被触发执行。

有序流的 Watermarker 如下图所示：（Watermark 设置为 0）图有序数据的 Watermark

乱序流的 Watermarker 如下图所示：（Watermark 设置为 2）图无序数据的 Watermark

当 Flink 接收到每一条数据时，都会产生一条 Watermark，这条 Watermark 就等于当前所有到达数据中的 maxEventTime - 延迟时长，也就是说，Watermark 是由数据携带的，一旦数据携带的 Watermark 比当前未触发的窗口的停止时间要晚，那么就会触发相应窗口的执行。由于 Watermark 是由数据携带的，因此，如果运行过程中无法获取新的数据，那么没有被触发的窗口将永远都不被触发。

上图中，我们设置的允许最大延迟到达时间为 2s，所以时间戳为 7s 的事件对应的 Watermark 是 5s，时间戳为 12s 的事件的 Watermark 是 10s，如果我们的窗口 1 是 1s~5s，窗口 2 是 6s~10s，那么时间戳为 7s 的事件到达时的 Watermarker 恰好触发窗口 1，时间戳为 12s 的事件到达时的 Watermark 恰好触发窗口 2。

Watermark 就是触发前一窗口的“关窗时间”，一旦触发关门那么以当前时刻为准在窗口范围内的所有所有数据都会收入窗中。

只要没有达到水位那么不管现实中的时间推进了多久都不会触发关窗。

7.2.2 Watermark 的引入

dataStream.assignTimestampsAndWatermarks( new BoundedOutOfOrdernessTimestampExtractor[SensorReading](Time.milliseconds(1000)) {  override def extractTimestamp(element: SensorReading): Long = {    element.timestamp * 1000  }} )

7.3 EvnetTimeWindow API

7.3.1 滚动窗口（TumblingEventTimeWindows）

def main(args: Array[String]): Unit = {    //  环境    val env: StreamExecutionEnvironment = StreamExecutionEnvironment.getExecutionEnvironment    env.setStreamTimeCharacteristic(TimeCharacteristic.EventTime)    env.setParallelism(1)    val dstream: DataStream[String] = env.socketTextStream("localhost",7777)    val textWithTsDstream: DataStream[(String, Long, Int)] = dstream.map { text =>      val arr: Array[String] = text.split(" ")      (arr(0), arr(1).toLong, 1)    }    val textWithEventTimeDstream: DataStream[(String, Long, Int)] = textWithTsDstream.assignTimestampsAndWatermarks(new BoundedOutOfOrdernessTimestampExtractor[(String, Long, Int)](Time.milliseconds(1000)) {      override def extractTimestamp(element: (String, Long, Int)): Long = {       return  element._2      }    })    val textKeyStream: KeyedStream[(String, Long, Int), Tuple] = textWithEventTimeDstream.keyBy(0)    textKeyStream.print("textkey:")    val windowStream: WindowedStream[(String, Long, Int), Tuple, TimeWindow] = textKeyStream.window(TumblingEventTimeWindows.of(Time.seconds(2)))    val groupDstream: DataStream[mutable.HashSet[Long]] = windowStream.fold(new mutable.HashSet[Long]()) { case (set, (key, ts, count)) =>      set += ts    }    groupDstream.print("window::::").setParallelism(1)    env.execute()  }}

结果是按照 Event Time 的时间窗口计算得出的，而无关系统的时间（包括输入的快慢）。

7.3.2 滑动窗口（SlidingEventTimeWindows）

def main(args: Array[String]): Unit = {  //  环境  val env: StreamExecutionEnvironment = StreamExecutionEnvironment.getExecutionEnvironment  env.setStreamTimeCharacteristic(TimeCharacteristic.EventTime)  env.setParallelism(1)  val dstream: DataStream[String] = env.socketTextStream("localhost",7777)  val textWithTsDstream: DataStream[(String, Long, Int)] = dstream.map { text =>    val arr: Array[String] = text.split(" ")    (arr(0), arr(1).toLong, 1)  }  val textWithEventTimeDstream: DataStream[(String, Long, Int)] = textWithTsDstream.assignTimestampsAndWatermarks(new BoundedOutOfOrdernessTimestampExtractor[(String, Long, Int)](Time.milliseconds(1000)) {    override def extractTimestamp(element: (String, Long, Int)): Long = {     return  element._2    }  })  val textKeyStream: KeyedStream[(String, Long, Int), Tuple] = textWithEventTimeDstream.keyBy(0)  textKeyStream.print("textkey:")  val windowStream: WindowedStream[(String, Long, Int), Tuple, TimeWindow] = textKeyStream.window(SlidingEventTimeWindows.of(Time.seconds(2),Time.milliseconds(500)))  val groupDstream: DataStream[mutable.HashSet[Long]] = windowStream.fold(new mutable.HashSet[Long]()) { case (set, (key, ts, count)) =>    set += ts  }  groupDstream.print("window::::").setParallelism(1)  env.execute()}

7.3.3 会话窗口（EventTimeSessionWindows）

相邻两次数据的 EventTime 的时间差超过指定的时间间隔就会触发执行。如果加入 Watermark，会在符合窗口触发的情况下进行延迟。到达延迟水位再进行窗口触发。

def main(args: Array[String]): Unit = {    //  环境    val env: StreamExecutionEnvironment = StreamExecutionEnvironment.getExecutionEnvironment    env.setStreamTimeCharacteristic(TimeCharacteristic.EventTime)    env.setParallelism(1)    val dstream: DataStream[String] = env.socketTextStream("localhost",7777)    val textWithTsDstream: DataStream[(String, Long, Int)] = dstream.map { text =>      val arr: Array[String] = text.split(" ")      (arr(0), arr(1).toLong, 1)    }    val textWithEventTimeDstream: DataStream[(String, Long, Int)] = textWithTsDstream.assignTimestampsAndWatermarks(new BoundedOutOfOrdernessTimestampExtractor[(String, Long, Int)](Time.milliseconds(1000)) {      override def extractTimestamp(element: (String, Long, Int)): Long = {       return  element._2      }    })    val textKeyStream: KeyedStream[(String, Long, Int), Tuple] = textWithEventTimeDstream.keyBy(0)    textKeyStream.print("textkey:")    val windowStream: WindowedStream[(String, Long, Int), Tuple, TimeWindow] = textKeyStream.window(EventTimeSessionWindows.withGap(Time.milliseconds(500)) )     windowStream.reduce((text1,text2)=>      (  text1._1,0L,text1._3+text2._3)    )  .map(_._3).print("windows:::").setParallelism(1)    env.execute()  }

第八章 Table API 与 SQL

Table API 是流处理和批处理通用的关系型 API，Table API 可以基于流输入或者批输入来运行而不需要进行任何修改。Table API 是 SQL 语言的超集并专门为 Apache Flink 设计的，Table API 是 Scala 和 Java 语言集成式的 API。与常规 SQL 语言中将查询指定为字符串不同，Table API 查询是以 Java 或 Scala 中的语言嵌入样式来定义的，具有 IDE 支持如:自动完成和语法检测。

8.1 需要引入的 pom 依赖

    org.apache.flink    flink-table_2.11    1.7.0

8.2 构造表环境

def main(args: Array[String]): Unit = {  val env: StreamExecutionEnvironment = StreamExecutionEnvironment.getExecutionEnvironment  val myKafkaConsumer: FlinkKafkaConsumer011[String] = MyKafkaUtil.getConsumer("GMALL_STARTUP")  val dstream: DataStream[String] = env.addSource(myKafkaConsumer)  val tableEnv: StreamTableEnvironment = TableEnvironment.getTableEnvironment(env)  val startupLogDstream: DataStream[StartupLog] = dstream.map{ jsonString =>JSON.parseObject(jsonString,classOf[StartupLog]) }  val startupLogTable: Table = tableEnv.fromDataStream(startupLogDstream)   val table: Table = startupLogTable.select("mid,ch").filter("ch ='appstore'")  val midchDataStream: DataStream[(String, String)] = table.toAppendStream[(String,String)]  midchDataStream.print()  env.execute()}

8.2.1 动态表

如果流中的数据类型是 case class 可以直接根据 case class 的结构生成 table

tableEnv.fromDataStream(startupLogDstream)

或者根据字段顺序单独命名

tableEnv.fromDataStream(startupLogDstream,’mid,’uid  .......)

最后的动态表可以转换为流进行输出

table.toAppendStream[(String,String)]

8.2.2 字段

用一个单引放到字段前面来标识字段名, 如 ‘name , ‘mid ,’amount 等

8.3 TableAPI

8.3.1 通过一个例子了解 TableAPI

//每 10 秒中渠道为 appstore 的个数def main(args: Array[String]): Unit = {  //sparkcontext  val env: StreamExecutionEnvironment = StreamExecutionEnvironment.getExecutionEnvironment  //时间特性改为 eventTime  env.setStreamTimeCharacteristic(TimeCharacteristic.EventTime)  val myKafkaConsumer: FlinkKafkaConsumer011[String] = MyKafkaUtil.getConsumer("GMALL_STARTUP")  val dstream: DataStream[String] = env.addSource(myKafkaConsumer)  val startupLogDstream: DataStream[StartupLog] = dstream.map{ jsonString =>JSON.parseObject(jsonString,classOf[StartupLog]) }  //告知 watermark 和 eventTime 如何提取  val startupLogWithEventTimeDStream: DataStream[StartupLog] = startupLogDstream.assignTimestampsAndWatermarks(new BoundedOutOfOrdernessTimestampExtractor[StartupLog](Time.seconds(0L)) {    override def extractTimestamp(element: StartupLog): Long = {      element.ts    }  }).setParallelism(1)  //SparkSession  val tableEnv: StreamTableEnvironment = TableEnvironment.getTableEnvironment(env)  //把数据流转化成 Table  val startupTable: Table = tableEnv.fromDataStream(startupLogWithEventTimeDStream , 'mid,'uid,'appid,'area,'os,'ch,'logType,'vs,'logDate,'logHour,'logHourMinute,'ts.rowtime)  //通过 table api 进行操作  // 每 10 秒 统计一次各个渠道的个数 table api 解决  //1 groupby  2 要用 window   3 用 eventtime 来确定开窗时间  val resultTable: Table = startupTable.window(Tumble over 10000.millis on 'ts as 'tt).groupBy('ch,'tt ).select( 'ch, 'ch.count)   //把 Table 转化成数据流  //val appstoreDStream: DataStream[(String, String, Long)] = appstoreTable.toAppendStream[(String,String,Long)]  val resultDstream: DataStream[(Boolean, (String, Long))] = resultSQLTable.toRetractStream[(String,Long)]  resultDstream.filter(_._1).print()  env.execute()}

8.3.2 关于 group by

如果使用 groupby table 转换为流的时候只能用 toRetractDstream

  val rDstream: DataStream[(Boolean, (String, Long))] = table.toRetractStream[(String,Long)]

toRetractDstream 得到的第一个 boolean 型字段标识 true 就是最新的数据，false 表示过期老数据

  val rDstream: DataStream[(Boolean, (String, Long))] = table.toRetractStream[(String,Long)]  rDstream.filter(_._1).print()

如果使用的 api 包括时间窗口，那么时间的字段必须，包含在 group by 中。

  val table: Table = startupLogTable.filter("ch ='appstore'").window(Tumble over 10000.millis on 'ts as 'tt).groupBy('ch ,'tt).select("ch,ch.count ")

8.3.3 关于时间窗口

用到时间窗口，必须提前声明时间字段，如果是 processTime 直接在创建动态表时进行追加就可以。

val startupLogTable: Table = tableEnv.fromDataStream(startupLogWithEtDstream,'mid,'uid,'appid,'area,'os,'ch,'logType,'vs,'logDate,'logHour,'logHourMinute,'ts.rowtime)

如果是 EventTime 要在创建动态表时声明

val startupLogTable: Table = tableEnv.fromDataStream(startupLogWithEtDstream,'mid,'uid,'appid,'area,'os,'ch,'logType,'vs,'logDate,'logHour,'logHourMinute,'ps.processtime)

滚动窗口可以使用 Tumble over 10000.millis on

  val table: Table = startupLogTable.filter("ch ='appstore'").window(Tumble over 10000.millis on 'ts as 'tt).groupBy('ch ,'tt).select("ch,ch.count ")

8.4 SQL 如何编写

def main(args: Array[String]): Unit = {  //sparkcontext  val env: StreamExecutionEnvironment = StreamExecutionEnvironment.getExecutionEnvironment  //时间特性改为 eventTime  env.setStreamTimeCharacteristic(TimeCharacteristic.EventTime)  val myKafkaConsumer: FlinkKafkaConsumer011[String] = MyKafkaUtil.getConsumer("GMALL_STARTUP")  val dstream: DataStream[String] = env.addSource(myKafkaConsumer)  val startupLogDstream: DataStream[StartupLog] = dstream.map{ jsonString =>JSON.parseObject(jsonString,classOf[StartupLog]) }  //告知 watermark 和 eventTime 如何提取  val startupLogWithEventTimeDStream: DataStream[StartupLog] = startupLogDstream.assignTimestampsAndWatermarks(new BoundedOutOfOrdernessTimestampExtractor[StartupLog](Time.seconds(0L)) {    override def extractTimestamp(element: StartupLog): Long = {      element.ts    }  }).setParallelism(1)  //SparkSession  val tableEnv: StreamTableEnvironment = TableEnvironment.getTableEnvironment(env)  //把数据流转化成 Table  val startupTable: Table = tableEnv.fromDataStream(startupLogWithEventTimeDStream , 'mid,'uid,'appid,'area,'os,'ch,'logType,'vs,'logDate,'logHour,'logHourMinute,'ts.rowtime)  //通过 table api 进行操作  // 每 10 秒 统计一次各个渠道的个数 table api 解决  //1 groupby  2 要用 window   3 用 eventtime 来确定开窗时间  val resultTable: Table = startupTable.window(Tumble over 10000.millis on 'ts as 'tt).groupBy('ch,'tt ).select( 'ch, 'ch.count) // 通过 sql 进行操作  val resultSQLTable : Table = tableEnv.sqlQuery( "select ch ,count(ch)   from "+startupTable+"  group by ch   ,Tumble(ts,interval '10' SECOND )")  //把 Table 转化成数据流  //val appstoreDStream: DataStream[(String, String, Long)] = appstoreTable.toAppendStream[(String,String,Long)]  val resultDstream: DataStream[(Boolean, (String, Long))] = resultSQLTable.toRetractStream[(String,Long)]  resultDstream.filter(_._1).print()  env.execute()}

第九章 Flink CEP 简介

9.1 什么是复杂事件 CEP

一个或多个由简单事件构成的事件流通过一定的规则匹配，然后输出用户想得到的数据，满足规则的复杂事件。

特征：

目标：从有序的简单事件流中发现一些高阶特征
输入：一个或多个由简单事件构成的事件流
处理：识别简单事件之间的内在联系，多个符合一定规则的简单事件构成复杂事件
输出：满足规则的复杂事件CEP 用于分析低延迟、频繁产生的不同来源的事件流。CEP 可以帮助在复杂的、不相关的事件流中找出有意义的模式和复杂的关系，以接近实时或准实时的获得通知并阻止一些行为。

CEP 支持在流上进行模式匹配，根据模式的条件不同，分为连续的条件或不连续的条件；模式的条件允许有时间的限制，当在条件范围内没有达到满足的条件时，会导致模式匹配超时。

看起来很简单，但是它有很多不同的功能：

输入的流数据，尽快产生结果
在 2 个 event 流上，基于时间进行聚合类的计算
提供实时/准实时的警告和通知
在多样的数据源中产生关联并分析模式
高吞吐、低延迟的处理

市场上有多种 CEP 的解决方案，例如 Spark、Samza、Beam 等，但他们都没有提供专门的 library 支持。但是 Flink 提供了专门的 CEP library。

9.2 Flink CEP

Flink 为 CEP 提供了专门的 Flink CEP library，它包含如下组件：

Event Stream
pattern 定义
pattern 检测
生成 Alert首先，开发人员要在 DataStream 流上定义出模式条件，之后 Flink CEP 引擎进行模式检测，必要时生成告警。

为了使用 Flink CEP，我们需要导入依赖：

  org.apache.flink  flink-cep_{scala.binary.version}  {flink.version}

Event Streams

登陆事件流

case class LoginEvent(userId: String, ip: String, eventType: String, eventTime: String) val env = StreamExecutionEnvironment.getExecutionEnvironment env.setStreamTimeCharacteristic(TimeCharacteristic.EventTime) env.setParallelism(1) val loginEventStream = env.fromCollection(List(  LoginEvent("1", "192.168.0.1", "fail", "1558430842"),  LoginEvent("1", "192.168.0.2", "fail", "1558430843"),  LoginEvent("1", "192.168.0.3", "fail", "1558430844"),  LoginEvent("2", "192.168.10.10", "success", "1558430845") )).assignAscendingTimestamps(_.eventTime.toLong)

Pattern API

每个 Pattern 都应该包含几个步骤，或者叫做 state。从一个 state 到另一个 state，通常我们需要定义一些条件，例如下列的代码：

val loginFailPattern = Pattern.begin[LoginEvent]("begin")  .where(_.eventType.equals("fail"))  .next("next")  .where(_.eventType.equals("fail"))  .within(Time.seconds(10)

每个 state 都应该有一个标示：例如 begin[LoginEvent]("begin")中的"begin"

每个 state 都需要有一个唯一的名字，而且需要一个 filter 来过滤条件，这个过滤条件定义事件需要符合的条件，例如:

.where(_.eventType.equals("fail"))

我们也可以通过 subtype 来限制 event 的子类型：

start.subtype(SubEvent.class).where(...);

事实上，你可以多次调用 subtype 和 where 方法；而且如果 where 条件是不相关的，你可以通过 or 来指定一个单独的 filter 函数：

pattern.where(...).or(...);

之后，我们可以在此条件基础上，通过 next 或者 followedBy 方法切换到下一个 state，next 的意思是说上一步符合条件的元素之后紧挨着的元素；而 followedBy 并不要求一定是挨着的元素。这两者分别称为严格近邻和非严格近邻。

val strictNext = start.next("middle")val nonStrictNext = start.followedBy("middle")

最后，我们可以将所有的 Pattern 的条件限定在一定的时间范围内：

next.within(Time.seconds(10))

这个时间可以是 Processing Time，也可以是 Event Time。

Pattern 检测

通过一个 input DataStream 以及刚刚我们定义的 Pattern，我们可以创建一个 PatternStream：

val input = ...val pattern = ...val patternStream = CEP.pattern(input, pattern)val patternStream = CEP.pattern(loginEventStream.keyBy(_.userId), loginFailPattern)

一旦获得 PatternStream，我们就可以通过 select 或 flatSelect，从一个 Map 序列找到我们需要的告警信息。

select

select 方法需要实现一个 PatternSelectFunction，通过 select 方法来输出需要的警告。它接受一个 Map 对，包含 string/event，其中 key 为 state 的名字，event 则为真是的 Event。

val loginFailDataStream = patternStream.select((pattern: Map[String, Iterable[LoginEvent]]) => {   val first = pattern.getOrElse("begin", null).iterator.next()   val second = pattern.getOrElse("next", null).iterator.next()   (second.userId, second.ip, second.eventType)  })

其返回值仅为 1 条记录。

flatSelect

通过实现 PatternFlatSelectFunction，实现与 select 相似的功能。唯一的区别就是 flatSelect 方法可以返回多条记录。

9.3 Flink CEP 案例

9.3.1 案例简介

需求：同一设备，5 分钟内连续三次用不同账号登录并领取优惠劵，并且在登录到领劵过程中没有浏览商品。产生一条预警日志。

复杂事件（Complex Event Process）的特点就是它不是由单一某一个事件来确定的，而是有多种事件组合而成的一种事件模式。

传统的聚合分析都是针对某一种事件进行统计分析，即使这类事件条件复杂，但是只要依据本次事件的信息都可以单独筛选出某一事件。而复杂事件还有根据前后事件出现情况，通过多个事件组合才能筛选分析。

以上的需求可以分解成几个要素：

同一设备
登录并领取优惠券，并且其间没有浏览商品
连续三次
5 分钟内
不同用户 id

9.3.2 首先构建数据流

object StreamCEP2 {  def main(args: Array[String]): Unit = {    val env: StreamExecutionEnvironment = StreamExecutionEnvironment.getExecutionEnvironment    val socketDstream: DataStream[String] = env.socketTextStream("hadoop1",7788)    socketDstream.print("text==")    val eventStream: DataStream[ActionEvent] = socketDstream.map(text => {        val textArr: Array[String] = text.split(" ")         ActionEvent(textArr(0), textArr(1),textArr(2),textArr(3).toLong)    }   //   TestEvent(text.split(" ")(0), text.split(" ")(1))    )    env.execute()      }}

增加一个 bean

case class ActionEvent(mid:String,uid:String,action:String ,ts:Long) {}

9.3.3 分组 -- 需求元素一：同一设备

以 mid 为 key 进行分组

def main(args: Array[String]): Unit = {    val env: StreamExecutionEnvironment = StreamExecutionEnvironment.getExecutionEnvironment    val socketDstream: DataStream[String] = env.socketTextStream("hadoop1",7788)    socketDstream.print("text==")    val eventStream: DataStream[ActionEvent] = socketDstream.map(text => {        val textArr: Array[String] = text.split(" ")         ActionEvent(textArr(0), textArr(1),textArr(2),textArr(3).toLong)    }   //   TestEvent(text.split(" ")(0), text.split(" ")(1))    )    val midKeyedStream: KeyedStream[ActionEvent, Tuple] = eventTsStream.keyBy("mid")    env.execute()  }

9.3.4 编写 Pattern --需求元素二：登录并领取优惠券，并且其间没有浏览商品

这个确实是一个用户 session 下的三个行为分别是

登录
没有浏览商品详情
领取了优惠券

这三个动作，没有办法通过一个 event 进行判断，即使通过开窗口的方式判断起来也是非常麻烦的，但是如果使用 FlinkCEP 进行处理就变的非常容易。

引入 pom.xml 的依赖

    org.apache.flink    flink-cep-scala_2.11    1.7.0

这三个动作一个用一个表达式来表达：

val pattern = Pattern.begin[ActionEvent]("start" ).where(_.action.equals("login"))  .notFollowedBy("without").where(_.action=="item").followedBy("follow").where(_.action=="coupon")

解释：

begin\notFollowedBy\followedBy 表示事件的类型

begin: 事件的起始

next: 紧挨着的事件

followedBy：在之后的事件（但不一定紧接着）

notNext: 紧挨着没有发生的事件

notFollowedBy: 之后再也没有发生

start\without\follow 部分：为该事件取名字，用于之后提取该阶段匹配到的相关事件

login\item\coupon 部分：返回一个 boolean 类型，通过流中数据来判断是否匹配事件

表达式最好以后通过如下代码得到一个模式流

val  patternStream:  PatternStream[ActionEvent] = CEP.pattern(midKeyedStream,pattern)

简单打印：

val  alertDstream: DataStream[String] = patternStream.select { pMap =>  pMap.mkString(",")}  alertDstream.print("alert:::")

9.3.5 触发次数--需求元素三: 连续三次

val midKeyedStream: KeyedStream[ActionEvent, Tuple] = eventTsStream.keyBy("mid")val strategy: SkipPastLastStrategy = AfterMatchSkipStrategy.skipPastLastEvent()val subpattern = Pattern.begin[ActionEvent]("start" ).where(_.action.equals("login")).notFollowedBy("without").where(_.action=="item").followedBy("follow").where(_.action=="coupon")val pattern: Pattern[ActionEvent, ActionEvent] = Pattern.begin(subpattern,strategy).times(3)

把原来的 patten 封装到新的 pattern 中的 begin 里并且标识要是触发 3 次

另外：设定跳过测量，为了避免 login、login、coupon 这种情况会触发两次，所以第一个 login 与 coupon 完成匹配的话，第一个 login 与 coupon 之间的其他 login 会被跳过。

9.3.6 时间间隔--需求元素四：五分钟内

首先，如果是指 processingTime 的 5 分钟的话直接，在 times(3)后面接 within 就可以了。

val pattern: Pattern[ActionEvent, ActionEvent] = Pattern.begin (subpattern,strategy ) .times(2).within(Time.minutes(5))

如果是 EventTime 的话，请设定环境的时间特性，并告知 EventTime 的时间字段。

env.setStreamTimeCharacteristic(TimeCharacteristic.EventTime)val eventTsStream: DataStream[ActionEvent] = eventStream.assignAscendingTimestamps(actionEvent=>actionEvent.ts).setParallelism(1)

9.3.7 收集过滤--需求元素五：不同用户 id

把流中的数据提取成为一个新的预警事件流

经过筛选后，选出事件中 uid 各不相同的情况，输出 alter 到预警流中

val alterDstream: DataStream[AlertEvent] = patternStream.flatSelect { (patternMap, collector: Collector[AlertEvent]) =>      println(patternMap)      val startEvents: Iterable[ActionEvent] = patternMap.getOrElse("start", null)      if(startEvents!=null && startEvents.size>0){           val startList: List[ActionEvent] = startEvents.toList           val firstEvent: ActionEvent = startList(0)           val uidSet: Set[String] = startList.map(_.uid).toSet           if(uidSet.size == startList.size) {                collector.collect(AlertEvent(firstEvent.mid, AlertType.CouponFraud, uidSet.mkString(","), firstEvent.ts))            }       }  }

添加预警事件

object AlertType extends Enumeration{  val CouponFraud =Value(1,"优惠券欺诈")  val Other = Value(2,"其他")}case class AlertEvent(mid:String,alterType:AlertType.Value ,uids:String,startTs:Long) {}

9.3.8 最后完整代码

def main(args: Array[String]): Unit = {    val env: StreamExecutionEnvironment = StreamExecutionEnvironment.getExecutionEnvironment    env.setStreamTimeCharacteristic(TimeCharacteristic.EventTime)    val socketDstream: DataStream[String] = env.socketTextStream("hadoop1",8888)    socketDstream.print("text==")    val eventStream: DataStream[ActionEvent] = socketDstream.map(text => {        val textArr: Array[String] = text.split(" ")         ActionEvent(textArr(0), textArr(1),textArr(2),textArr(3).toLong)    }   //   TestEvent(text.split(" ")(0), text.split(" ")(1))    )    val eventTsStream: DataStream[ActionEvent] = eventStream.assignAscendingTimestamps(actionEvent=>actionEvent.ts).setParallelism(1)    val midKeyedStream: KeyedStream[ActionEvent, Tuple] = eventTsStream.keyBy("mid")    val strategy: SkipPastLastStrategy = AfterMatchSkipStrategy.skipPastLastEvent()    val subpattern = Pattern.begin[ActionEvent]("start" ).where(_.action.equals("login")).notFollowedBy("without").where(_.action=="item").followedBy("follow").where(_.action=="coupon")    val pattern: Pattern[ActionEvent, ActionEvent] = Pattern.begin (subpattern,strategy ) .times(3).within(Time.minutes(5))    //.within(Time.seconds(10))     val patternStream: PatternStream[ActionEvent] = CEP.pattern(midKeyedStream,pattern)    val alterDstream: DataStream[AlertEvent] = patternStream.flatSelect { (patternMap, collector: Collector[AlertEvent]) => println(patternMap)      val startEvents: Iterable[ActionEvent] = patternMap.getOrElse("start", null)      if(startEvents!=null && startEvents.size>0){        val startList: List[ActionEvent] = startEvents.toList        val firstEvent: ActionEvent = startList(0)        val uidSet: Set[String] = startList.map(_.uid).toSet        if (uidSet.size == startList.size){            collector.collect(AlertEvent(firstEvent.mid, AlertType.CouponFraud, uidSet.mkString(","), firstEvent.ts))        }      }    }    alterDstream.print("alert:::")    env.execute()      }

阅读全文: http://gitbook.cn/gitchat/activity/5de886e9d8585b701daac21d

您还可以下载 CSDN 旗下精品原创内容社区 GitChat App ，阅读更多 GitChat 专享技术内容哦。

你可能感兴趣的:(Flink 快速实战开发)

QQ群采集助手，精准引流必备神器 2401_87347160 其他经验分享
功能概述微信群查找与筛选工具是一款专为微信用户设计的辅助工具，它通过关键词搜索功能，帮助用户快速找到相关的微信群，并提供筛选是否需要验证的群组的功能。主要功能关键词搜索：用户可以输入关键词，工具将自动查找包含该关键词的微信群。筛选功能：工具提供筛选机制，用户可以选择是否只显示需要验证或不需要验证的群组。精准引流：通过上述功能，用户可以更精准地找到目标群组，进行有效的引流操作。3.设备需求该工具可以
element实现动态路由+面包屑软件技术NINI vue案例 vue.js 前端
el-breadcrumb是ElementUI组件库中的一个面包屑导航组件，它用于显示当前页面的路径，帮助用户快速理解和导航到应用的各个部分。在Vue.js项目中，如果你已经安装了ElementUI，就可以很方便地使用el-breadcrumb组件。以下是一个基本的使用示例：安装ElementUI（如果你还没有安装的话）:你可以通过npm或yarn来安装ElementUI。bash复制代码npmi
理解Gunicorn：Python WSGI服务器的基石范范0825 ipython linux 运维
理解Gunicorn：PythonWSGI服务器的基石介绍Gunicorn，全称GreenUnicorn，是一个为PythonWSGI（WebServerGatewayInterface）应用设计的高效、轻量级HTTP服务器。作为PythonWeb应用部署的常用工具，Gunicorn以其高性能和易用性著称。本文将介绍Gunicorn的基本概念、安装和配置，帮助初学者快速上手。1.什么是Gunico
腾讯云技术深度探索：构建高效云原生微服务架构我的运维人生云原生架构腾讯云运维开发技术共享
腾讯云技术深度探索：构建高效云原生微服务架构在当今快速发展的技术环境中，云原生技术已成为企业数字化转型的关键驱动力。腾讯云作为行业领先的云服务提供商，不断推出创新的产品和技术，助力企业构建高效、可扩展的云原生微服务架构。本文将深入探讨腾讯云在微服务领域的最新进展，并通过一个实际案例展示如何在腾讯云平台上构建云原生应用。腾讯云微服务架构概览腾讯云微服务架构基于云原生理念，旨在帮助企业快速实现应用的容
使用Faiss进行高效相似度搜索 llzwxh888 faiss python
在现代AI应用中，快速和高效的相似度搜索是至关重要的。Faiss（FacebookAISimilaritySearch）是一个专门用于快速相似度搜索和聚类的库，特别适用于高维向量。本文将介绍如何使用Faiss来进行相似度搜索，并结合Python代码演示其基本用法。什么是Faiss？Faiss是一个由FacebookAIResearch团队开发的开源库，主要用于高维向量的相似性搜索和聚类。Faiss
人工智能时代，程序员如何保持核心竞争力？ jmoych 人工智能
随着AIGC（如chatgpt、midjourney、claude等）大语言模型接二连三的涌现，AI辅助编程工具日益普及，程序员的工作方式正在发生深刻变革。有人担心AI可能取代部分编程工作，也有人认为AI是提高效率的得力助手。面对这一趋势,程序员应该如何应对?是专注于某个领域深耕细作，还是广泛学习以适应快速变化的技术环境?又或者，我们是否应该将重点转向AI无法轻易替代的软技能？让我们一起探讨程序员
Python快速入门 —— 第三节：类与对象孤华暗香 Python快速入门 python 开发语言
第三节：类与对象目标：了解面向对象编程的基础概念，并学会如何定义类和创建对象。内容：类与对象：定义类：class关键字。类的构造函数：__init__()。类的属性和方法。对象的创建与使用。示例：classStudent:def__init__(self,name,age,major):self.name&#
Faiss Tips：高效向量搜索与聚类的利器焦习娜Samantha
FaissTips：高效向量搜索与聚类的利器faiss_tipsSomeusefultipsforfaiss项目地址:https://gitcode.com/gh_mirrors/fa/faiss_tips项目介绍Faiss是由FacebookAIResearch开发的一个用于高效相似性搜索和密集向量聚类的库。它支持多种硬件平台，包括CPU和GPU，能够在海量数据集上实现快速的近似最近邻搜索（AN
高级 ECharts 技巧：自定义图表主题与样式 SnowMan1993 echarts 信息可视化数据分析
ECharts是一个强大的数据可视化库，提供了多种内置主题和样式，但你也可以根据项目的设计需求，自定义图表的主题与样式。本文将介绍如何使用ECharts自定义图表主题，以提升数据可视化的吸引力和一致性。1.什么是ECharts主题？ECharts的主题是指定义图表样式的配置项，包括颜色、字体、线条样式等。通过预设主题，你可以快速更改图表的整体风格，而自定义主题则允许你在此基础上进行个性化设置。2.
基于CODESYS的多轴运动控制程序框架：逻辑与运动控制分离，快速开发灵活操作 GPJnCrbBdl python 开发语言
基于codesys开发的多轴运动控制程序框架，将逻辑与运动控制分离，将单轴控制封装成功能块，对该功能块的操作包含了所有的单轴控制（归零、点动、相对定位、绝对定位、设置当前位置、伺服模式切换等等）。程序框架由主程序按照状态调用分归零模式、手动模式、自动模式、故障模式，程序状态的跳转都已完成，只需要根据不同的工艺要求完成所需的动作即可。变量的声明、地址的规划都严格按照C++的标准定义，能帮助开发者快速
果然只有离职的时候，才有人敢说真话！ return2ok
今天公司出了神贴。今天中午吃饭，同事问我看了论坛上的神贴了吗？什么帖子？我问。同事显得很惊讶，你居然没看，现在那个帖子可能会成为年度最佳帖子。这么厉害？我等不及了，饭没吃完就快速的奔向办公室，打开公司论坛，我要一睹这个帖子的神奇。写这帖子的童鞋胆儿真肥。这哪里是一个帖子，这是很多个帖子，组成了一个系列。某人从公司文化、管理、人事、项目管理等多个方面分析了公司的概况，并抨击了公司的各种弊端，并提出了
nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
如何选择最适合你的项目研发管理软件？TAPD卓越版全面解析北京云巴巴信息技术有限公司产品经理需求分析
在当今快速发展的科技时代，项目研发管理软件已成为企业不可或缺的重要工具。面对市场上琳琅满目的产品，如何选择一款适合自己团队的项目研发管理软件呢？本文将围绕项目研发管理软件的选择标准，重点介绍TAPD卓越版的特点、优势以及使用体验，让你更好地理解和选择适合自己的项目研发管理软件。项目研发管理软件的选择标准在选择项目研发管理软件时，我们需要考虑以下几个方面的因素：功能全面性：软件是否覆盖了从需求管理、
2022-08-28 蔚蓝一片晴
初三暑假培训收获点滴从8月25至8月27日三天两晚的培训结束了，回到家中，该静下心来整理一下触动心灵的收获，成为成长的积淀。1.在优秀团队中快速成长与提升，做一名反思成长型教师一名专业型教师的教学指导包括了教学原理知识、案例知识、策略知识。面对教学中的遇到的有趣的情形、问题会去研究其理，寻找更好的教法学法对策。从新手到成熟型教师，再走向专业型教师，需要的是觉醒与反思，多进行案例研究，从案例中观察、
你可能遗漏的一些C#/.NET/.NET Core知识点追逐时光者 C#.NET DotNetGuide编程指南 c#.net .netcore microsoft
前言在这个快速发展的技术世界中，时常会有一些重要的知识点、信息或细节被忽略或遗漏。《C#/.NET/.NETCore拾遗补漏》专栏我们将探讨一些可能被忽略或遗漏的重要知识点、信息或细节，以帮助大家更全面地了解这些技术栈的特性和发展方向。拾遗补漏GitHub开源地址https://github.com/YSGStudyHards/DotNetGuide/blob/main/docs/DotNet/D
Java面试题精选：消息队列(二) 芒果不是芒 Java面试题精选 java kafka
一、Kafka的特性1.消息持久化：消息存储在磁盘，所以消息不会丢失2.高吞吐量：可以轻松实现单机百万级别的并发3.扩展性：扩展性强，还是动态扩展4.多客户端支持：支持多种语言（Java、C、C++、GO、）5.KafkaStreams（一个天生的流处理）:在双十一或者销售大屏就会用到这种流处理。使用KafkaStreams可以快速的把销售额统计出来6.安全机制：Kafka进行生产或者消费的时候会
2024.8.22 Python，链表两数之和，链表快速反转，二叉树的深度，二叉树前中后序遍历，N叉树递归遍历，翻转二叉树 RaidenQ python 链表开发语言
1.链表两数之和输入：l1=[2,4,3],l2=[5,6,4]输出：[7,0,8]解释：342+465=807.示例2：输入：l1=[0],l2=[0]输出：[0]示例3：输入：l1=[9,9,9,9,9,9,9],l2=[9,9,9,9]输出：[8,9,9,9,0,0,0,1]昨天的这个题，用自己的办法写的麻烦的要死，然后刚才一看chat归类的办法，感觉自己像个智障。classListNode
esp32开发快速入门 8 : MQTT 的快速入门，基于esp32实现MQTT通信 z755924843 ESP32开发快速入门服务器网络运维
MQTT介绍简介MQTT（MessageQueuingTelemetryTransport，消息队列遥测传输协议），是一种基于发布/订阅（publish/subscribe）模式的"轻量级"通讯协议，该协议构建于TCP/IP协议上，由IBM在1999年发布。MQTT最大优点在于，可以以极少的代码和有限的带宽，为连接远程设备提供实时可靠的消息服务。作为一种低开销、低带宽占用的即时通讯协议，使其在物联
Armv8.3 体系结构扩展--原文版代码改变世界ctw ARM-TEE-Android armv8 嵌入式 arm架构安全架构芯片 Trustzone Secureboot
快速链接:.ARMv8/ARMv9架构入门到精通-[目录]付费专栏-付费课程【购买须知】:个人博客笔记导读目录(全部)TheArmv8.3architectureextensionTheArmv8.3architectureextensionisanextensiontoArmv8.2.Itaddsmandatoryandoptionalarchitecturalfeatures.Somefeat
Spring MVC 全面指南：从入门到精通的详细解析一杯梅子酱技术栈学习 spring mvc java
引言：SpringMVC，作为Spring框架的一个重要模块，为构建Web应用提供了强大的功能和灵活性。无论是初学者还是有一定经验的开发者，掌握SpringMVC都将显著提升你的Web开发技能。本文旨在为初学者提供一个全面且易于理解的学习路径，通过详细的知识点分析和实际案例，帮助你快速上手SpringMVC，让学习过程既深刻又高效。一、SpringMVC简介1.1什么是SpringMVC？Spri
JavaScript `Map` 和 `WeakMap`详细解释跳房子的前端 JavaScript 原生方法 javascript 前端开发语言
在JavaScript中，Map和WeakMap都是用于存储键值对的数据结构，但它们有一些关键的不同之处。MapMap是一种可以存储任意类型的键值对的集合。它保持了键值对的插入顺序，并且可以通过键快速查找对应的值。Map提供了一些非常有用的方法和属性来操作这些数据对：set(key,value):将一个键值对添加到Map中。如果键已经存在，则更新其对应的值。get(key):获取指定键的值。如果键
自动写论文的网站推荐这5款实用类工具小猪包333 写论文人工智能深度学习计算机视觉 AI写作
在当今学术研究和写作领域，AI论文写作工具的出现极大地提高了写作效率和质量。这些工具不仅能够帮助研究人员快速生成论文草稿，还能进行内容优化、查重和排版等操作。以下是五款实用类工具推荐，特别是千笔-AIPassPaper。1.千笔-AIPassPaper千笔-AIPassPaper是一款功能强大且全面的AI论文写作助手，用户只需输入基本的研究需求和关键词，便能迅速生成一篇完整的论文。该工具利用先进的
推荐3家毕业AI论文可五分钟一键生成！文末附免费教程！小猪包333 写论文人工智能 AI写作深度学习计算机视觉
在当前的学术研究和写作领域，AI论文生成器已经成为许多研究人员和学生的重要工具。这些工具不仅能够帮助用户快速生成高质量的论文内容，还能进行内容优化、查重和排版等操作。以下是三款值得推荐的AI论文生成器：千笔-AIPassPaper、懒人论文以及AIPaperPass。千笔-AIPassPaper千笔-AIPassPaper是一款基于深度学习和自然语言处理技术的AI写作助手，旨在帮助用户快速生成高质
AI论文写作推荐哪个好？分享5款AI论文写作带数据图表网站小猪包333 写论文人工智能深度学习计算机视觉
在当今学术研究和写作领域，AI论文写作工具的出现极大地提高了写作效率和质量。这些工具不仅能够帮助研究人员快速生成论文草稿，还能进行内容优化、查重和排版等操作。以下是五款推荐的AI论文写作工具，包括千笔-AIPassPaper。千笔-AIPassPaper千笔-AIPassPaper是一款功能强大的AI论文写作助手，旨在帮助用户快速生成高质量的论文内容。AI论文，免费大纲，10分钟3万字https:
华为云分布式缓存服务DCS 8月新特性发布华为云PaaS服务小智华为云分布式缓存
分布式缓存服务（DistributedCacheService，简称DCS）是华为云提供的一款兼容Redis的高速内存数据处理引擎，为您提供即开即用、安全可靠、弹性扩容、便捷管理的在线分布式缓存能力，满足用户高并发及数据快速访问的业务诉求。此次为大家带来DCS8月的特性更新内容，一起来看看吧！
【算法练习】IDEA集成leetcode插件实现快速刷 2401_84102892 2024年程序员学习算法 intellij-idea leetcode
============点击右侧边leetcode->设置->配置地址、用户名、密码、存放目录、文件模板用户名要登录后在账号信息里看模板代码1.codefilename!velocityTool.camelC
效率神器来了：AI工具手把手教你快速提升工作效能 kkai人工智能人工智能学习媒体 ai chatgpt
随着科技的进步，AI工具已经成为提升工作效率的关键手段。本文将介绍一些实用的AI工具和方法，帮助你自动化繁琐的重复性任务、优化数据管理、促进团队协作与沟通，并提升决策质量。背景：OOPAI-免费问答学习交流-GPT自动化重复性任务Zapier：Zapier可以自动化多个应用程序之间的工作流程。例如，它能自动将Gmail中的附件保存至GoogleDrive，或在你发布新文章时，自动分享至社交媒体平台
助力新能源汽车产业发展，2025第五届广州国际新能源汽车产业智能制造技术展览会将于11月在广州召开 ws201907 制造汽车
助力新能源汽车产业发展，2025第五届广州国际新能源汽车产业智能制造技术展览会将于11月在广州召开伴随着全球新一轮科技革命和产业变革，汽车与能源、半导体、物联网等领域有关技术加速融合，新能源汽车已成为全球汽车产业转型升级的主要方向。近年来，在相关政策的影响下，新能源汽车市场呈现出快速增长的态势，市场规模不断扩大。截至2020年，中国新能源汽车保有量已超过500万辆，成为全球最大的新能源汽车市场。随
电子技术引领汽车智能新浪潮，尽在AUTO TECH 2025广州国际汽车电子技术盛会 JSZNZZ 汽车
随着科技的持续进步，汽车电子行业正迎来深刻的转型。这一变革的显著特征是从传统的机械控制方式逐渐过渡到智能化和网联化的管理系统。这种转变不仅提升了汽车电子产品的技术复杂性，还极大地丰富了其创新性和功能性。在这个过程中，产品开发的质量和效率变得尤为关键，它们直接决定了企业在激烈竞争环境中的市场地位和商业成功。面对快速变化的市场需求，汽车电子行业在产品开发过程中遇到了多方面的挑战。其中，信息孤岛是一个显
深度 Qlearning：在直播推荐系统中的应用 AGI通用人工智能之禅程序员提升自我硅基计算碳基计算认知计算生物计算深度学习神经网络大数据 AIGC AGI LLM Java Python 架构设计 Agent 程序员实现财富自由
深度Q-learning：在直播推荐系统中的应用关键词：深度Q-learning,强化学习,直播推荐系统,个性化推荐1.背景介绍1.1问题的由来随着互联网技术的飞速发展,直播平台如雨后春笋般涌现。面对海量的直播内容,用户很难快速找到自己感兴趣的内容。因此,个性化推荐系统在直播平台中扮演着越来越重要的角色。1.2研究现状目前,主流的个性化推荐算法包括协同过滤、基于内容的推荐等。这些方法在一定程度上缓
用MiddleGenIDE工具生成hibernate的POJO（根据数据表生成POJO类） AdyZhang POJO eclipse Hibernate MiddleGenIDE
推荐:MiddlegenIDE插件, 是一个Eclipse 插件. 用它可以直接连接到数据库, 根据表按照一定的HIBERNATE规则作出BEAN和对应的XML ，用完后你可以手动删除它加载的JAR包和XML文件! 今天开始试着使用
.9.png Cb123456 android
“点九”是andriod平台的应用软件开发里的一种特殊的图片形式，文件扩展名为：.9.png 　　智能手机中有自动横屏的功能,同一幅界面会在随着手机(或平板电脑)中的方向传感器的参数不同而改变显示的方向,在界面改变方向后,界面上的图形会因为长宽的变化而产生拉伸,造成图形的失真变形。　　我们都知道android平台有多种不同的分辨率，很多控件的切图文件在被放大拉伸后，边
算法的效率天子之骄算法效率复杂度最坏情况运行时间大O阶平均情况运行时间
算法的效率效率是速度和空间消耗的度量。集中考虑程序的速度，也称运行时间或执行时间，用复杂度的阶(O)这一标准来衡量。空间的消耗或需求也可以用大O表示，而且它总是小于或等于时间需求。以下是我的学习笔记： 1.求值与霍纳法则，即为秦九韶公式。 2.测定运行时间的最可靠方法是计数对运行时间有贡献的基本操作的执行次数。运行时间与这个计数成正比。
java数据结构何必如此 java 数据结构
Java 数据结构 Java工具包提供了强大的数据结构。在Java中的数据结构主要包括以下几种接口和类：枚举（Enumeration）位集合（BitSet）向量（Vector）栈（Stack）字典（Dictionary）哈希表（Hashtable）属性（Properties）以上这些类是传统遗留的，在Java2中引入了一种新的框架-集合框架(Collect
MybatisHelloWorld 3213213333332132
//测试入口TestMyBatis package com.base.helloworld.test; import java.io.IOException; import org.apache.ibatis.io.Resources; import org.apache.ibatis.session.SqlSession; import org.apache.ibat
Java|urlrewrite|URL重写|多个参数 7454103 java xml Web 工作
个人工作经验！如有不当之处，敬请指点 1.0 web -info 目录下建立 urlrewrite.xml 文件类似如下： <?xml version="1.0" encoding="UTF-8" ?> <!DOCTYPE u
达梦数据库+ibatis darkranger sql mysql ibatis SQL Server
--插入数据方面如果您需要数据库自增... 那么在插入的时候不需要指定自增列. 如果想自己指定ID列的值, 那么要设置 set identity_insert 数据库名.模式名.表名; ----然后插入数据; example: create table zhabei.test( id bigint identity(1,1) primary key, nam
XML 解析四种方式 aijuans android
XML现在已经成为一种通用的数据交换格式,平台的无关性使得很多场合都需要用到XML。本文将详细介绍用Java解析XML的四种方法。 XML现在已经成为一种通用的数据交换格式,它的平台无关性,语言无关性,系统无关性,给数据集成与交互带来了极大的方便。对于XML本身的语法知识与技术细节,需要阅读相关的技术文献,这里面包括的内容有DOM(Document Object
spring中配置文件占位符的使用 avords
1.类 <?xml version="1.0" encoding="UTF-8"?><!DOCTYPE beans PUBLIC "-//SPRING//DTD BEAN//EN" "http://www.springframework.o
前端工程化-公共模块的依赖和常用的工作流 bee1314 webpack
题记：一个人的项目，还有工程化的问题嘛？我们在推进模块化和组件化的过程中，肯定会不断的沉淀出我们项目的模块和组件。对于这些沉淀出的模块和组件怎么管理？另外怎么依赖也是个问题？你真的想这样嘛？ var BreadCrumb = require(‘../../../../uikit/breadcrumb’); //真心ugly。
上司说「看你每天准时下班就知道你工作量不饱和」，该如何回应？ bijian1013 项目管理沟通 IT职业规划
问题：上司说「看你每天准时下班就知道你工作量不饱和」，如何回应正常下班时间6点，只要是6点半前下班的，上司都认为没有加班。 Eno-Bea回答，注重感受，不一定是别人的虽然我不知道你具体从事什么工作与职业，但是我大概猜测，你是从事一项不太容易出现阶段性成果的工作
TortoiseSVN，过滤文件征客丶 SVN
环境： TortoiseSVN 1.8 配置：在文件夹空白处右键选择 TortoiseSVN -> Settings 在 Global ignote pattern 中添加要过滤的文件：多类型用英文空格分开 *name ：过滤所有名称为 name 的文件或文件夹 *.name ：过滤所有后缀为 name 的文件或文件夹 --------
【Flume二】HDFS sink细说 bit1129 Flume
1. Flume配置 a1.sources=r1 a1.channels=c1 a1.sinks=k1 ###Flume负责启动44444端口 a1.sources.r1.type=avro a1.sources.r1.bind=0.0.0.0 a1.sources.r1.port=44444 a1.sources.r1.chan
The Eight Myths of Erlang Performance bookjovi erlang
erlang有一篇guide很有意思： http://www.erlang.org/doc/efficiency_guide 里面有个The Eight Myths of Erlang Performance： http://www.erlang.org/doc/efficiency_guide/myths.html Myth: Funs are sl
java多线程网络传输文件(非同步)-2008-08-17 ljy325 java 多线程 socket
利用 Socket 套接字进行面向连接通信的编程。客户端读取本地文件并发送；服务器接收文件并保存到本地文件系统中。使用说明:请将TransferClient, TransferServer, TempFile三个类编译，他们的类包是FileServer. 客户端: 修改TransferClient: serPort, serIP, filePath, blockNum,的值来符合您机器的系
读《研磨设计模式》-代码笔记-模板方法模式 bylijinnan java 设计模式
声明：本文只为方便我个人查阅和理解，详细的分析以及源代码请移步原作者的博客http://chjavach.iteye.com/ import java.sql.Connection; import java.sql.DriverManager; import java.sql.PreparedStatement; import java.sql.ResultSet;
配置心得 chenyu19891124 配置
时间就这样不知不觉的走过了一个春夏秋冬，转眼间来公司已经一年了，感觉时间过的很快，时间老人总是这样不停走，从来没停歇过。作为一名新手的配置管理员，刚开始真的是对配置管理是一点不懂，就只听说咱们公司配置主要是负责升级，而具体该怎么做却一点都不了解。经过老员工的一点点讲解，慢慢的对配置有了初步了解，对自己所在的岗位也慢慢的了解。做了一年的配置管理给自总结下： 1.改变从一个以前对配置毫无
对“带条件选择的并行汇聚路由问题”的再思考 comsci 算法工作软件测试嵌入式领域模型
2008年上半年，我在设计并开发基于”JWFD流程系统“的商业化改进型引擎的时候，由于采用了新的嵌入式公式模块而导致出现“带条件选择的并行汇聚路由问题”(请参考2009-02-27博文)，当时对这个问题的解决办法是采用基于拓扑结构的处理思想，对汇聚点的实际前驱分支节点通过算法预测出来，然后进行处理，简单的说就是找到造成这个汇聚模型的分支起点，对这个起始分支节点实际走的路径数进行计算，然后把这个实际
Oracle 10g 的clusterware 32位下载地址 daizj oracle
Oracle 10g 的clusterware 32位下载地址 http://pan.baidu.com/share/link?shareid=531580&uk=421021908 http://pan.baidu.com/share/link?shareid=137223&uk=321552738 http://pan.baidu.com/share/l
非常好的介绍：Linux定时执行工具cron dongwei_6688 linux
Linux经过十多年的发展，很多用户都很了解Linux了，这里介绍一下Linux下cron的理解，和大家讨论讨论。cron是一个Linux 定时执行工具，可以在无需人工干预的情况下运行作业，本文档不讲cron实现原理，主要讲一下Linux定时执行工具cron的具体使用及简单介绍。新增调度任务推荐使用crontab -e命令添加自定义的任务（编辑的是/var/spool/cron下对应用户的cr
Yii assets目录生成及修改 dcj3sjt126com yii
assets的作用是方便模块化，插件化的，一般来说出于安全原因不允许通过url访问protected下面的文件，但是我们又希望将module单独出来，所以需要使用发布，即将一个目录下的文件复制一份到assets下面方便通过url访问。 assets设置对应的方法位置 \framework\web\CAssetManager.php assets配置方法在m
mac工作软件推荐 dcj3sjt126com mac
mac上的Terminal + bash ＋ screen组合现在已经非常好用了，但是还是经不起iterm＋zsh＋tmux的冲击。在同事的强烈推荐下，趁着升级mac系统的机会，顺便也切换到iterm＋zsh＋tmux的环境下了。我为什么要要iterm2 切换过来也是脑袋一热的冲动，我也调查过一些资料，看了下iterm的一些优点： * 兼容性好，远程服务器 vi 什么的低版本能很好兼
Memcached(三)、封装Memcached和Ehcache frank1234 memcached ehcache spring ioc
本文对Ehcache和Memcached进行了简单的封装，这样对于客户端程序无需了解ehcache和memcached的差异，仅需要配置缓存的Provider类就可以在二者之间进行切换，Provider实现类通过Spring IoC注入。 cache.xml <?xml version="1.0" encoding="UTF-8"?>
Remove Duplicates from Sorted List II hcx2013 remove
Given a sorted linked list, delete all nodes that have duplicate numbers, leaving only distinct numbers from the original list. For example,Given 1->2->3->3->4->4->5,
Spring4新特性——注解、脚本、任务、MVC等其他特性改进 jinnianshilongnian spring4
Spring4新特性——泛型限定式依赖注入 Spring4新特性——核心容器的其他改进 Spring4新特性——Web开发的增强 Spring4新特性——集成Bean Validation 1.1(JSR-349)到SpringMVC Spring4新特性——Groovy Bean定义DSL Spring4新特性——更好的Java泛型操作API Spring4新
MySQL安装文档 liyong0802 mysql
工作中用到的MySQL可能安装在两种操作系统中，即Windows系统和Linux系统。以Linux系统中情况居多。安装在Windows系统时与其它Windows应用程序相同按照安装向导一直下一步就即，这里就不具体介绍，本文档只介绍Linux系统下MySQL的安装步骤。 Linux系统下安装MySQL分为三种：RPM包安装、二进制包安装和源码包安装。二
使用VS2010构建HotSpot工程 p2p2500 HotSpot OpenJDK VS2010
1. 下载OpenJDK7的源码： http://download.java.net/openjdk/jdk7 http://download.java.net/openjdk/ 2. 环境配置 ▶
Oracle实用功能之分组后列合并 seandeng888 oracle 分组实用功能合并
1 实例解析由于业务需求需要对表中的数据进行分组后进行合并的处理，鉴于Oracle10g没有现成的函数实现该功能，且该功能如若用JAVA代码实现会比较复杂，因此，特将SQL语言的实现方式分享出来，希望对大家有所帮助。如下：表test 数据如下： ID,SUBJECTCODE,DIMCODE,VALUE 1&nbs
Java定时任务注解方式实现 tuoni java spring jvm xml jni
Spring 注解的定时任务，有如下两种方式：第一种： <?xml version="1.0" encoding="UTF-8"?> <beans xmlns="http://www.springframework.org/schema/beans" xmlns:xsi="http
11大Java开源中文分词器的使用方法和分词效果对比 yangshangchuan word分词器 ansj分词器 Stanford分词器 FudanNLP分词器 HanLP分词器
本文的目标有两个： 1、学会使用11大Java开源中文分词器 2、对比分析11大Java开源中文分词器的分词效果本文给出了11大Java开源中文分词的使用方法以及分词结果对比代码，至于效果哪个好，那要用的人结合自己的应用场景自己来判断。 11大Java开源中文分词器，不同的分词器有不同的用法，定义的接口也不一样，我们先定义一个统一的接口： /** * 获取文本的所有分词结果, 对比

Flink 快速实战开发

第一章 Flink 简介

1.1 初识 Flink

1.2 Flink 的重要特点

1.2.1 事件驱动型 (Event-driven)

1.2.2 流与批的世界观

1.2.3 分层 API

第二章 快速上手

2.1 搭建 maven 工程 FlinkTutorial

2.1.1 pom 文件

2.1.2 添加 scala 框架 和 scala 文件夹

2.2 批处理 wordcount

2.3 流处理 wordcount

第三章 Flink 部署

3.1 Standalone 模式

3.1.1 安装

3.1.2 提交任务

3.2 Yarn 模式

第四章 Flink 运行架构

4.1 任务提交流程（yarn 模式）

4.2 任务调度原理

4.3 Worker 与 Slots

4.4 程序与数据流

4.5 并行数据流

4.6 task 与 operator chains

第五章 Flink 流处理 Api

5.1 Environment

5.1.1 getExecutionEnvironment

5.1.2 createLocalEnvironment

5.1.3 createRemoteEnvironment

5.2 Source

5.2.1 从集合读取数据

5.2.2 从文件读取数据

5.2.3 以 kafka 消息队列的数据作为来源

5.3 Transform

5.3.1 map

5.3.2 flatMap

5.3.3 Filter

5.3.4 KeyBy

5.3.5 滚动聚合算子（Rolling Aggregation）

5.3.6 Reduce

5.3.7 Split 和 Select

5.3.8 Connect 和 CoMap

5.3.9 Union

5.4 Sink

5.4.1 Kafka

5.4.2 Redis

5.4.3 Elasticsearch

5.4.4 JDBC 自定义 sink

第六章 Time 与 Window

6.1 Time

6.2 Window

6.2.1 Window 概述

6.2.2 Window 类型

6.3 Window API

6.3.1 TimeWindow

6.3.2 CountWindow

第七章 EventTime 与 Window

7.1 EventTime 的引入

7.2 Watermark

7.2.1 基本概念

7.2.2 Watermark 的引入

7.3 EvnetTimeWindow API

7.3.1 滚动窗口（TumblingEventTimeWindows）

7.3.2 滑动窗口（SlidingEventTimeWindows）

7.3.3 会话窗口（EventTimeSessionWindows）

第八章 Table API 与 SQL

8.1 需要引入的 pom 依赖

8.2 构造表环境

8.2.1 动态表

8.2.2 字段

8.3 TableAPI

8.3.1 通过一个例子 了解 TableAPI

8.3.2 关于 group by

8.3.3 关于时间窗口

8.4 SQL 如何编写

第九章 Flink CEP 简介

9.1 什么是复杂事件 CEP

9.2 Flink CEP

9.3 Flink CEP 案例

第二章快速上手

2.1.2 添加 scala 框架和 scala 文件夹

8.3.1 通过一个例子了解 TableAPI

9.3.3 分组 -- 需求元素一：同一设备