记录一次FLink 背压过大问题处理过程

最近flink job出现了背压的问题, 后果是导致了checkpoint的生成超时, 影响了flink job的运行.

定位问题:

如下图:

1) flink的checkpoint生成超时, 失败:

 

checkpoint超时

记录一次FLink 背压过大问题处理过程_第1张图片

2) 查看jobmanager日志,定位问题:

记录一次FLink 背压过大问题处理过程_第2张图片

 

jobmanager日志

 

3) 找大神帮忙定位问题, 原来是出现了背压的问题,  缓冲区的数据处理不过来,barrier流动慢,导致checkpoint生成时间长, 出现超时的现象. (checkpoint超时时间设置了30分钟)

下图是背压过高, input 和 output缓冲区都占满的情况

 

buffer缓冲区情况

记录一次FLink 背压过大问题处理过程_第3张图片

4) 背压的情况也可以在flink后台的job的JobGraph中查看

 

背压过高

记录一次FLink 背压过大问题处理过程_第4张图片

下面说说flink感应反压的过程:

你可能感兴趣的:(flink)