cronaldo91

云原生监控系统Prometheus：基于Prometheus构建智能化监控告警系统

一、理论

1.Promethues简介

2.监控告警系统设计思路

3.Prometheus监控体系

4.Prometheus时间序列数据

5.Prometheus的生态组件

6.Prometheus工作原理

7.Prometheus监控内容

8.部署Prometheus

9.部署Exporters

10.部署Grafana进行展示

二、实验

1.部署Prometheus

2.部署Exporters

2.监控远程MySQL

3.部署Grafana进行展示

三、问题

1.Prometheus和Zabbix区别

2.如何防止告警信息轰炸

3.监控服务有哪4个黄金指标

4.访问prometheus服务器被监控端agent服务器状态报错

5.mysqld_exporter如何指定启动参数

四、总结

一、理论

1.Promethues简介

（1）概念

Prometheus 是一个开源的服务监控系统和时序数据库（TDSB），其提供了通用的数据模型和快捷数据采集、存储和查询接口。它的核心组件Prometheus server会定期从静态配置的监控目标或者基于服务发现自动配置的自标中进行拉取数据，当新拉取到的数据大于配置的内存缓存区时，数据就会持久化到存储设备当中。

每个被监控的主机都可以通过专用的exporter 程序提供输出监控数据的接口，它会在目标处收集监控数据，并暴露出一个HTTP接口供Prometheus server查询，Prometheus通过基于HTTP的pull的方式来周期性的采集数据。
任何被监控的目标都需要事先纳入到监控系统中才能进行时序数据采集、存储、告警和展示，监控目标可以通过配置信息以静态形式指定，也可以让Prometheus通过服务发现的机制进行动态管理。
Prometheus 能够直接把API Server作为服务发现系统使用，进而动态发现和监控集群中的所有可被监控的对象

Prometheus 官网地址：https://prometheus.io
 
Prometheus github 地址：https://github.com/prometheus

（2）特点

多维数据模型：由度量名称和键值对标识的时间序列数据
时序数据，是在一段时间内通过重复测量（measurement）而获得的观测值的集合；将这些观测值绘制于图形之上，它会有一个数据轴和一个时间轴；

服务器指标数据、应用程序性能监控数据、网络数据等也都是时序数据；

1）内置时间序列（pime series）数据库：Prometheus；外置的远端存储通常会用：InfluxDB、openTsDB等
2）promQL一种灵活的查询语言，可以利用多维数据完成复杂查询
3）基于HTTP的pull（拉取）方式采集时间序列数据
4）同时支持PushGateway组件收集数据
5）通过服务发现或者静态配置，来发现目标服务对象
6）支持作为数据源接入Grafana

2.监控告警系统设计思路

（1）模块组成

① 数据收集模块
② 数据提取模块(prometheus-TSDB,查询语言是promQL)
③ 监控告警模块（布尔值表达式判断是否需要告警，不成立是健康状态）

（2）层次

 
第一层:数据收集层       多渠道监控数据（网络，硬件，应用，数据，物理环境）

第二层:数据展示层       数据生成曲线图展示（对时序数据的动态展示)

第三层:数据提取层       定时采集数据到监控模块

第四层:告警规则配置层   告警规则设置、告警伐值设置（定义布尔值表达式，筛选异常状态）

第五层:告警事件生成层   实时记录告警事件、形成分析图表（趋势分析、可视化)

第六层:用户展示管理层   同一用户管理、集中监控、集中维护

3.Prometheus监控体系

（1）系统层监控（需要监控的数据）

1）CPU、Load、Memory、swap、disk、I/O、process等
2）网络监控：网络设备、工作负载、网络延迟、丢包率等

（2）中间件及基础设施类监控

1）消息中间件：kafka、RocketMQ、等消息代理（redis 中间件）
2）WEB服务容器：tomcat、weblogic、apache、php、spring系列
3）数据库/缓存数据库：Mysql、Postgresql、MongoDB、es、redis

redis监控内容：

redis的服务状态
redis所在服务器的系统层监控
RDB和AOF日志监控

日志--->如果是哨兵模式--->哨兵共享集群信息，产生的日志
--->直接包含的其他节点哨兵信息及redis信息

key的数量
key被命中的数据/次数
最大连接数--->redis和系统
redis:redis-cli登录--->config get maxclients查看最大连接

（3）应用层监控

它用于衡量应用程序代码状态和性能。

监控的分类：

1）白盒监控：自省指标，等待被下载（cadvisor）
2）黑盒监控：基于探针（snmp）的监控方式，不会主动干预、影响数据

（4）业务层监控

用于衡量应用程序的价值。如电商业务的销售量，ops、dau日活、转化等。

业务接口：登入数量，注册数、订单量、搜索量和支付量。

4.Prometheus时间序列数据

（1）序列数据

时间序列数据（TimeSeries Data）:按照时间顺序记录系统、设备状态变化的数据被称为时序数据。

应用场景很多，如：

1）人驾驶车辆运行中要记录的经度，纬度，速度，方向，旁边物体的距离等等。每时每刻都要将数据记录下来做分析。

2）某一个地区的各车辆的行驶轨迹数据

3）传统证券行业实时交易数据

4）实时运维监控数据等

（2）时间序列数据特点

Prometheus 有着非常高效的时间序列数据存储方法，每个采样数据仅仅占用 3.5byte 左右空间，上百万条时间序列，30 秒间隔，保留 60 天，大概花了 200 多 G（来自官方数据）。

1）性能好：关系型数据库对于大规模数据的处理性能糟糕。NOSQL 可以比较好的处理大规模数据，让依然比不上时间序列数据库。
2）存储成本低：高效的压缩算法，节省存储空间，有效降低 IO。

（3）数据来源

Prometheus基于HTTP call (http/https请求)，从配置文件中指定的网络端点（endpoint/IP:端口）上周期性获取指标数据。很多环境、被监控对象，本身是没有直接响应/处理http请求的功能，prometheus-exporter则可以在被监控端收集所需的数据，收集过来之后，还会做标准化，把这些数据转化为prometheus可识别，可使用的数据（兼容格式）。

（4）收集数据

1）监控概念：白盒监控、黑盒监控

2）白盒监控：自省方式，被监控端内部，可以生成指标，只要等待监控系统来采集时提供出去即可。

3）黑盒监控：对于被监控系统没有侵入性，对其没有直接‘影响"，这种类似于基于探针机制进行监控（snmp协议）

prometheus支持通过三种类型的途径从目标上抓取/采集（scrape）指标数据（基于白盒监控）：

1）exporter--->工作在被监控端，周期性的抓取数据并 转换为prometheus来收集，自己并不推送
2）Instrumentation--->指被监控对象内部自身有数据收集、监控的功能，只需要prometheus直接去获取
3）Pushgateway--->短周期5s-10s的数据收集

（5）常见的时间序列数据库

（6）时间序列数据库引擎排行

DB-Engines Ranking - die Rangliste der populärsten Time Series DBMS

（7）prometheus获取方式

Prometheus同其他TSDB相比有一个非常典型的特性：主动从各Target上拉取（pull）数据，非等待被监控端的推送（push）

两个获取方式各有优劣，其中，Pull模型的优势在于：

1）集中控制:有利于将配置集在Prometheus server上完成，包括指标及采取速率等;
2）Prometheus的根本目标在于收集在target上预先完成聚合的聚合型数据，而非一款由事件驱动的存储系统通过targets(标识的是具体的被监控端)
3）比如配置文件中的targets : [ ‘localhost:9090’]

（8）Prometheus 数据模型

Prometheus 仅用于以“键值”(key)形式储存时序式的聚合数，不支持存储文本信息；

1）其中的“键”称为指标，它通常意味着cpu速率、内存使用率、负载等；

2）同一指标可能会适配到多个目标，比如cpu使用率这个指标，我们需要对100台服务器设备进行使用。所以它使

3）用“标签”（labels）作为元数据，从而为指标添加更多的信息描述；
这些标签可以作为过滤器进行指标过滤及运算。

具体的看如下数据展示描述：

如上图中，cpu_usage{core=“1”,ip=“128.0.0.1”} 14.04
cpu_usage为指标名称，{core=“1”,ip=“128.0.0.1”}为标签（标签内的条件可以多个，用逗号分隔），14.04 为表达式返回的值

5.Prometheus的生态组件

Prometheus 负责时序型指标数据的采集及存储，但数据的分析、聚合及直观展示以及告警等功能并非由Prometheus Server所负责。

（1）Prometheus server

Prometheus server：服务核心组件，采用pull方式收集监控数据，通过http协议传输。并存储时间序列数据。Prometheus server 由三个部分组成：Retrival，Storage，PromQL

1）Retrieval：负责在活跃的target 主机上抓取监控指标数据。
2）Storage：存储，主要是把采集到的数据存储到磁盘中。默认为15天（可修改）。
3）PromQL：是Prometheus提供的查询语言模块。

（2）pushgateway

Pushgateway：类似一个中转站，Prometheus的server端只会使用pull方式拉取数据，但是某些节点因为某些原因只能使用push方式推送数据，那么它就是用来接收push而来的数据并暴露给Prometheus的server拉取的中转站。可以理解成目标主机可以上报短期任务的数据到Pushgateway，然后Prometheus server 统一从Pushgateway拉取数据。

（3）exporters

Exporters：指标暴露器，负责收集不支持内建Instrumentation的应用程序或服务的性能指标数据，并通过HTTP接口供Prometheus Server获取。换句话说，Exporter 负责从目标应用程序上采集和聚合原始格式的数据，并转换或聚合为Prometheus格式的指标向外暴露。

常用的Exporters：

1）Node-Exporter：用于收集服务器节点（例如k8s）的物理指标状态数据，如平均负载、CPU、内存、磁盘、网络等资源信息的指标数据，需要部署到所有运算节点。指标详细介绍：https://github.com/prometheus/node_exporter
2）mysqld-exporter/nginx-exporter
3）Kube-state-Metrics：为prometheus 采集k8s资源数据的exporter，通过监听APIServer 收集kubernetes集群内资源对象的状态指标数据，例如pod、deployment、service 等等。同时它也提供自己的数据，主要是资源采集个数和采集发生的异常次数统计。
4）cAdvisor：用来监控容器内部使用资源的信息，比如CPU、内存、网络I/0、磁盘I/0。
5）blackbox-exporter：监控业务容器存活性。

需要注意的是kube-state-metrics 只是简单的提供一个metrics 数据，并不会存储这些指标数据，
所以可以使用prometheus来抓取这些数据然后存储，主要关注的是业务相关的一些元数据，
比如Deployment、Pod、副本状态等；调度了多少个replicas？现在可用的有几个？
多少个Pod是running/stopped/terminated 状态？Pod 重启了多少次？有多少job在运行中。

（4）Service Discovery

Service Discovery：服务发现，用于动态发现待监控的Target，Prometheus支持多种服务发现机制：文件、DNS、Consul、Kubernetes等等。

服务发现可通过第三方提供的接口，Prometheus查询到需要监控的Target列表，然后轮询这些Target 获取监控数据。该组件目前由Prometheus Server内建支持。

（5）Alertmanager

Alertmanager：是一个独立的告警模块，从Prometheus server端接收到“告警通知”后，会进行去重、分组，并路由到相应的接收方，发出报警，常见的接收方式有：电子邮件、钉钉、企业微信等。

1）Prometheus Server 仅负责生成告警指示，具体的告警行为由另一个独立的应用程序AlertManager负责；
2）告警指示由 Prometheus Server基于用户提供的告警规则周期性计算生成，Alertmanager 接收到Prometheus Server发来的告警指示后，基于用户定义的告警路由向告警接收人发送告警信息。

（6）client Library

client Library：客户端库，目的在于为那些期望原生提供Instrumentation功能的应用程序提供便捷的开发途径，用于基于应用程序内建的测量系统。

（7）grafana

Grafana：是一个跨平台的开源的度量分析和可视化工具，可以将采集的数据可视化的展示，并及时通知给告警接收方。其官方库中具有丰富的仪表盘插件。

6.Prometheus工作原理

（1）Prometheus数据流向：

1）Prometheus server定期从配置好的jobs或者exporters中拉取metrics，或者接收来自 Pushgateway发送过来的metrics，或者从其它的Prometheus server中拉metrics。
2）Prometheus server在本地存储收集到的metrics，并运行定义好的alerts.rules，记录新的时间序列或者向Alert manager推送警报。
3）Alertmanager根据配置文件，对接收到的警报进行处理，发出告警。
4）在图形界面中，可视化采集数据。

（2）Prometheus工作模式

1）Prometheus Server 基于服务发现（Service Discovery）机制或静态配置获取要监视的目标（Target），并通过每个目标上的指标exporter来采集（Scrape）指标数据；
2）Prometheus Server 内置了一个基于文件的时间序列存储来持久存储指标数据，用户可使用PromQL接口来检索数据，也能够按需将告警需求发往A1ertmanager完成告警内容发送；
3）一些短期运行的作业的生命周期过短，难以有效地将必要的指标数据供给到Server端，它们一般会采用推送（Push）方式输出指标数据，Prometheus借助于Pushgateway 接收这些推送的数据，进而由server端进行抓取

（3）Prometheus工作流程

1）Prometheus以prometheus Server 为核心，用于收集和存储时间序列数据。Prometheus Server从监控目标中通过pull方式拉取指标数据，或通过pushgateway 把采集的数据拉取到Prometheus server中。
2）Prometheus server 把采集到的监控指标数据通过TSDB存储到本地HDD/ssD中。
3）Prometheus 采集的监控指标数据按时间序列存储，通过配置报警规则，把触发的报警发送到Alertmanager。
4）Alertmanager 通过配置报警接收方，发送报警到邮件、钉钉或者企业微信等。
5）Prometheus 自带的Web UI 界面提供PromQL 查询语言，可查询监控数据。
6）Grafana 可接入Prometheus 数据源，把监控数据以图形化形式展示出。

注意:告警数据采集、告警信息提取、告警通知
 
1）首先，需要采集监控数据，pro会周期性的pull或被push指标数据，数据采集的方式主要包括exporters、instrumentation、pushgateway 3种方式，前两者为pull方式获取，pushgateway借助于push方式推送给prometheus。
 
2）根据prometheus配置文件中（K8S-configmap的配置中），获取被监控端的数据之后，保存在TSDB中，我们可以借助Grafana或者告警平台来展示数据，grafana的展示是通过PromQL来获取数据。
 
3）prometheus通过rule配置来借助于PromQL来定义布尔值表达式，产生告警信息
 
4）一旦出现告警，prometheus产生告警信息，发送给alertmanager,alertmanager根据自定义的告警路由，来进行告警通知，对接第三方平台，例如告警平台、邮件、钉钉。

（4）Prometheus的局限性

1）Prometheus是一款指际监控系统，不适合存储事件及日志等；它更多地展示的是趋势性的监控，而非精准数据；
2）Prometheus认为只有最近的监控数据才有查询的需要，其本地存储的设计初衷只是保存短期（例如一个月）数据，因而不支持针对大量的历史数据进行存储；若需要存储长期的历史数据，建议基于远端存储机制将数据保存于InfluxDB或openTsDB等系统中；
3）Prometheus的集群机制成熟度不高，可基于Thanos（和灭霸是一个单词）实现Prometheus集群的高可用及联邦集群

7.Prometheus监控内容

（1）监控级别及内容

表1 监控级别及内容

级别	监控内容	exporter
网络	网络协议：http、dns、tcp、icmp; 网路硬件：路由器、交换机等	BlockBox Exporter;SNMP Exporter
主机	资源用量	node exporter
容器	资源用量	cadvisor
应用（包括Library）	延迟、错误，QPS,内部状态	代码集中集成Prometheus Client
中间件状态	资源用量，以及服务状态	代码集中集成Prometheus Client
编排工具	集群资源用量，调度等	Kubernetes Components

（2）网络监控

1）网络性能监控：主要涉及网络监测，网络实时流量监控（网络延迟、访问量、成功率）和历史数据统计、汇总和历史数据分析等功能。

2）网络***检测：主要针对内网或者外网的网络***。如DDoS***的。通过分析异常流量来确定网络***行为。

3）设备监控：主要针对数据中心内的多种网络设备进行监控。包括路由器，防火墙和交换机等硬件设备，可以通过snmp等协议收集数据。

（3）存储监控

1）存储性能监控方面：存储通常监控块的读写速率，IOPS。读写延迟，磁盘用量等；文件存储通常监控文件系统inode。读写速度、目录权限等。

2）存储系统监控方面：不同的存储系统有不同的指标，例如，对于ceph存储需要监控OSD, MON的运行状态，各种状态pg的数量以及集群IOPS等信息。

3）存储设备监控方面：对于构建在x86服务器上的存储设备，设备监控通过每个存储节点上的采集器统一收集磁盘、SSD、网卡等设备信息；存储厂商以黑盒方式提供商业存储设备，通常自带监控功能，可监控设备的运行状态，性能和容量的。

（4）服务器监控

1）CPU：涉及整个 CPU 的使用量、用户态百分比、内核态百分比，每个 CPU 的使用量、等待队列长度、I/O 等待百分比、CPU 消耗最多的进程、上下文切换次数、缓存命中率等。

2）内存：涉及内存的使用量、剩余量、内存占用最高的进程、交换分区大小、缺页异常等。

3）网络 I/O：涉及每个网卡的上行流量、下行流量、网络延迟、丢包率等。

4）磁盘 I/O：涉及硬盘的读写速率、IOPS、磁盘用量、读写延迟等。

（5）中间件监控

1）消息中间件： RabbitMQ Exporter、Kafka Exporter

2）Web 服务中间件：Apache Exporter、Nginx Exporter

3）数据库中间件：MySQL Exporter、PostgreSQL Exporter、Redis Exporter

8.部署Prometheus

（1）环境准备

服务器类型	IP地址	组件
Prometheus服务器	192.168.204.18	Prometheus、node_exporter
grafana服务器	192.168.204.19	Grafana
agent服务器	192.168.204.20	node_exporter

关闭安全机制

#prometheus节点
[root@prometheus ~]# systemctl stop firewalld
[root@prometheus ~]# setenforce 0
setenforce: SELinux is disabled
[root@prometheus ~]# sed -i 's/SELINUX=enforcing/SELINUX=disabled/g' /etc/selinux/config

#grafana节点
[root@grafana ~]# systemctl stop firewalld
[root@grafana ~]# setenforce 0
setenforce: SELinux is disabled
[root@grafana ~]# sed -i 's/SELINUX=enforcing/SELINUX=disabled/g' /etc/selinux/config


#agent节点
[root@agent ~]# systemctl stop firewalld
[root@agent ~]# setenforce 0
setenforce: SELinux is disabled
[root@agent ~]# sed -i 's/SELINUX=enforcing/SELINUX=disabled/g' /etc/selinux/config

修正地址映射

vim /etc/hosts

192.168.204.18 prometheus
192.168.204.19 grafana
192.168.204.20 agent

（2）Prometheus部署

prometheus下载地址：

https://prometheus.io/download/

①上传 prometheus-2.37.0.linux-amd64.tar.gz 到 /opt 目录中，并解压

[root@prometheus ~]# cd /opt
[root@prometheus opt]# ls
cni  containerd  rh
[root@prometheus opt]# rz -E
rz waiting to receive.
[root@prometheus opt]# ls
cni  containerd  prometheus-2.37.0.linux-amd64.tar.gz  rh
[root@prometheus opt]# tar xf prometheus-2.37.0.linux-amd64.tar.gz 
[root@prometheus opt]# mv prometheus-2.37.0.linux-amd64 /usr/local/prometheus
[root@prometheus opt]# cd /usr/local/prometheus
[root@prometheus prometheus]# ls
console_libraries  consoles  LICENSE  NOTICE  prometheus  prometheus.yml  promtool

②修改配置文件

cat /usr/local/prometheus/prometheus.yml | grep -v "^#"
global:					#用于prometheus的全局配置，比如采集间隔，抓取超时时间等
  scrape_interval: 15s			#采集目标主机监控数据的时间间隔，默认为1m
  evaluation_interval: 15s 		#触发告警生成alert的时间间隔，默认是1m
  # scrape_timeout is set to the global default (10s).
  scrape_timeout: 10s			#数据采集超时时间，默认10s
 
alerting:				#用于alertmanager实例的配置，支持静态配置和动态服务发现的机制
  alertmanagers:
    - static_configs:
        - targets:
          # - alertmanager:9093
 
rule_files:				#用于加载告警规则相关的文件路径的配置，可以使用文件名通配机制
  # - "first_rules.yml"
  # - "second_rules.yml"
 
scrape_configs:			#用于采集时序数据源的配置
  # The job name is added as a label `job=` to any timeseries scraped from this config.
  - job_name: "prometheus"		#每个被监控实例的集合用job_name命名，支持静态配置（static_configs）和动态服务发现的机制（*_sd_configs）
 
    # metrics_path defaults to '/metrics'
    # scheme defaults to 'http'.
 
    static_configs:				#静态目标配置，固定从某个target拉取数据
      - targets: ["localhost:9090"]

修改静态模板配置，固定从某个target拉取数据

 - targets: ["192.168.204.18:9090"]

③配置系统启动文件，设置开机自启

Unit为服务单元，After为依赖关系，config.file为配置文件，storage.tsdb.path为数据目录，

storage.tsdb.retention为保存时间，ExecReload为重载

[root@prometheus prometheus]# vim /usr/lib/systemd/system/prometheus.service
 
[Unit]
Description=Prometheus Server
Documentation=https://prometheus.io
After=network.target
 
[Service]
Type=simple
ExecStart=/usr/local/prometheus/prometheus \
--config.file=/usr/local/prometheus/prometheus.yml \
--storage.tsdb.path=/usr/local/prometheus/data/ \
--storage.tsdb.retention=15d \
--web.enable-lifecycle
  
ExecReload=/bin/kill -HUP $MAINPID
Restart=on-failure
 
[Install]
WantedBy=multi-user.target

④开启prometheus,并访问网页验证

systemctl start prometheus
systemctl enable prometheus
 
netstat -natp | grep :9090
 
浏览器访问：http://192.168.204.18:9090 ，访问到 Prometheus 的 Web UI 界面
点击页面的 Status -> Targets，如看到 Target 状态都为 UP，说明 Prometheus 能正常采集到数据
http://192.168.204.18:9090/metrics ，可以看到 Prometheus 采集到自己的指标数据

⑤通过浏览器访问 http:// 服务器 IP:9090 就可以访问到 Prometheus 的主界面

⑥默认只监控了本机一台，点 Status→点 Targets→可以看到只监控了本机

9.部署Exporters

（1）监控远程Linux主机(192.168.109.20)

在远程 linux 主机（被监控端 agent）上安装 node_exporter 组件。

下载地址：

https://prometheus.io/download/

①上传 node_exporter-1.3.1.linux-amd64.tar.gz 到 /opt 目录中，并解压

cd /opt/
tar xf node_exporter-1.3.1.linux-amd64.tar.gz
mv node_exporter-1.3.1.linux-amd64/node_exporter /usr/local/bin

②配置启动文件，设置开机自启

vim /usr/lib/systemd/system/node_exporter.service

[Unit]   
Description=mysqld_exporter
Documentation=https://prometheus.io/
After=network.target   
 
[Service]
Type=simple
ExecStart=/usr/local/bin/node_exporter \          
--collector.ntp \               
--collector.mountstats \
--collector.systemd \
--collector.tcpstat
 
ExecReload=/bin/kill -HUP $MAINPID
Restart=on-failure
 
[Install]
WantedBy=multi-user.target

③启动node_exporter

systemctl start node_exporter
systemctl enable node_exporter
 
netstat -natp | grep :9100
 
浏览器访问：http://192.168.204.20:9100/metrics ，可以看到 Node Exporter 采集到的指标数据

④ 通过浏览器访问 http:// 被监控端 IP:9100/metrics 就可以查看到 node_exporter 在被监控端收集的监控信息

修改Prometheus服务器的配置文件

回到 Prometheus 服务器的配置文件里添加被监控机器的配置段：

vim /usr/local/prometheus/prometheus.yml
  - job_name: 'agent'
    static_configs:
    - targets: ['192.168.204.20:9100']

改完配置文件后，重启服务

systemctl restart prometheus.service
systemctl status prometheus

⑤访问prometheus服务器

回到 web 管理界面→点 Status→点 Targets→可以看到多了一台监控目标

192.168.204.18:9090

注：也可以在本机安装 node_exporter，使用上面的方式监控本机。

(2) 监控远程MySQL

在被管理机 agent上安装 mysqld_exporter 组件

下载地址：

https://prometheus.io/download/

(1) 安装mariadb数据库，并授权

安装命令 yum -y install mariadb mariadb-server
安装完成MariaDB，首先启动MariaDB systemctl start mariadb
设置开机启动 systemctl enable mariadb
取消开机启动 systemctl disable mariadb

在当前数据库中增加授权

#进入数据库
mysql
 
授权IP为192.168.204.20，因为不是prometheus服务器直接来找mariadb获取数据，而是prometheus服务器找mysql_exporter，然后mysql_exporter再找mariadb.所以这个IP指的是mysql_exporter的IP.
GRANT PROCESS, REPLICATION CLIENT, SELECT ON *.* TO 'exporter'@'192.168.204.20' IDENTIFIED BY 'exporter123' WITH MAX_USER_CONNECTIONS 3;

 
flush privileges;

(2) 下载mysqld_exporter组件

wget https://github.com/prometheus/mysqld_exporter/releases/download/v0.12.0/mysqld_exporter-0.12.0.linux-amd64.tar.gz

（3）安装mysqld_exporter组件

进入目录 cd /usr/local/prometheus/
下载 wget https://github.com/prometheus/mysqld_exporter/releases/download/v0.12.1/mysqld_exporter-0.12.1.linux-amd64.tar.gz
解压 tar xzvf mysqld_exporter-0.12.1.linux-amd64.tar.gz
修改目录名 mv mysqld_exporter-0.12.1.linux-amd64 mysqld_exporter
修改用户及组 chown -R root:root /usr/local/prometheus/mysqld_exporter/mysqld_exporter
修改权限 chmod 755 /usr/local/prometheus/mysqld_exporter/mysqld_exporter

(4) 添加mysqld_exporter为系统服务

# vim /usr/lib/systemd/system/mysqld_exporter.service
[Unit]
Description=mysqld_exporter
After=network.target
[Service]
Type=simple
User=mysql
# exporter对应授权账号,exporter123对应授权密码,localhost对应授权账号密码所在的地址
Environment=DATA_SOURCE_NAME=exporter:exporter123@(localhost:3306)/
ExecStart=/usr/local/prometheus/mysqld_exporter/mysqld_exporter --web.listen-address=0.0.0.0:9104 
  --config.my-cnf /etc/my.cnf \
  --collect.slave_status \
  --collect.slave_hosts \
  --log.level=error \
  --collect.info_schema.processlist \
  --collect.info_schema.innodb_metrics \
  --collect.info_schema.innodb_tablespaces \
  --collect.info_schema.innodb_cmp \
  --collect.info_schema.innodb_cmpmem 
Restart=on-failure
[Install]
WantedBy=multi-user.targe

（5）启动服务并监听端口

systemctl start mysqld_exporter
systemctl enable mysqld_exporter

netstat -antp | grep 9104

(6) 修改Prometheus服务器的配置文件

回到 Prometheus 服务器的配置文件里添加被监控的 mariadb 的配置段

vim /usr/local/prometheus/prometheus.yml
 35   - job_name: 'agent_mariadb'
 36     static_configs:
 37     - targets: ['192.168.204.20:9104']

改完配置文件之后，重启服务

systemctl restart prometheus.service

netstat -antp | grep 9090

(7) 访问prometheus服务器

回到 web 管理界面→点 Status→点 Targets→可以看到监控 mariadb

192.168.204.18:9090/

10.部署Grafana进行展示

Grafana 是一个开源的度量分析和可视化工具，可以通过将采集的数据分析，查询，然后进行可视化的展示，并能实现报警。

下载地址:

https://grafana.com/grafana/download/

(1) 下载安装Grafana

#使用yum解决依赖关系  我这边直接上传软件包到opt
yum install -y grafana-7.4.0-1.x86_64.rpm
或
rpm -ivh /opt/grafana-7.3.6-1.x86_64.rpm
 
systemctl start grafana-server
systemctl enable grafana-server
 
netstat -natp | grep :3000
 
浏览器访问：http://192.168.109.19:3000 ，默认账号和密码为 admin/admin

通过浏览器访问 http:// grafana 服务器 IP:3000 就到了登录界面，使用默认的 admin 用户，admin 密码就可以登陆了。

192.168.204.19:3000/login

(2) 配置数据源

下面把 Prometheus 服务器收集的数据做为一个数据源添加到 grafana，让 grafana 可以得到 Prometheus 的数据。

点击增加数据源

为此数据自定义一个名称

Prometheus_data

填写prometheus的IP和port

http://192.168.204.18:9090

Auth模块是公网传输数据加密与验证，为了保证安全

15s获取一次，GET方式

填完之后点击保存

点击设置，选择Data Source,可以查看到成功添加数据源

（3）导入模板

点击prometheus_data,选择Dashboards

点击仪表盘，全部导入

全部导入后，点击Manage

随便点击一个模板

192.168.204.19:3000/

(4) 为数据源做数据展示

创建Dashboard

数据源选择添加的Prometheus_data

写上查询的值，可以多个条件一起，都显示在同一张图上

(1分钟负载、5分钟负载、15分钟负载)

自定义名称，点击保存

最后在dashboard可以查看到，点击“agent_cpu_load”

注：有多条数据的时候，可以在查询的键值后面加个大括号，括号里的条件表示只匹配当前的监控项。

(5) 导入grafana监控面板

浏览器访问：https://grafana.com/grafana/dashboards ，在页面中搜索 node exporter ，选择适合的面板，点击 Copy ID 或者 Download JSON
 
在 grafana 页面中，+ Create -> Import ，输入面板 ID 号或者上传 JSON 文件，点击 Load，即可导入监控面板

(6) Grafana 图形显示 MySQL 监控数据

在 grafana 上修改配置文件,并下载安装 mysql 监控的 dashboard（包含相关 json 文件，这些 json 文件可以看作是开发人员开发的一个监控模板）。

vim /etc/grafana/grafana.ini 

[dashboards.json]
enabled = true
path = /var/lib/grafana/dashboards

cd /var/lib/grafana/

#克隆
yum install -y git
git clone [email protected]:percona/grafana-dashboards.git

cp -r grafana-dashboards/dashboards/ /var/lib/grafana/

#重启grafana
systemctl restart grafana-server.service

在 grafana 上修改配置文件,并下载安装 mysql 监控的 dashboard（包含相关 json 文件，这些 json 文件可以看作是开发人员开发的一个监控模板）。

点 import 导入后，报 prometheus 数据源找不到，因为这些 json 文件里默认要找的就是叫 Prometheus 的数据源，但我们前面建立的数据源却是叫 prometheus_data。

那么请自行把原来的 prometheus_data 源改名为 Prometheus 即可（注意：第一个字母 P 是大写）。然后再回去刷新一下，就有数据了。

(7) Grafana+onealert报警

Prometheus 报警需要使用 alertmanager 这个组件，而且报警规则需要手动编写（对运维来说不友好）。所以我这里选用 grafana+onealert 报警。注意：实现报警前把所有机器时间同步再检查一遍。

登陆http://www.onealert.com/→注册帐户→登入后台管理

(8) 在Grafana中配置Webhook URL

1、在Grafana中创建Notification channel，选择类型为Webhook；
2、推荐选中Send on all alerts和Include image，Cloud Alert体验更佳；
3、将第一步中生成的Webhook URL填入Webhook settings Url；
URL格式：
http://api.aiops.com/alert/api/event/grafana/v1/897dcd4c804140098a171d680bf6e26a/ （保存当前应用，即可获取完整webhook地址信息）
4、Http Method选择POST；
5、Send Test&Save；

在grafana增加通知通道

增加通道

192.168.204.19:3000/

Name: onealert

Type: webhook

Url: (onelert那里产生)

（9）测试CPU负载告警

现在可以去设置一个报警来测试了（这里用前面加的 cpu 负载监控来做测试）

保存后就可以测试了，如果 agent1上的 cpu 负载还没有到 0.3，你可以试试 0.1，或者运行一些程序把 agent1负载调大。

最终的邮件报警效果

二、实验

1.部署Prometheus

（1）环境准备

服务器类型	IP地址	组件
Prometheus服务器	192.168.204.18	Prometheus、node_exporter
grafana服务器	192.168.204.19	Grafana
agent服务器	192.168.204.20	node_exporter

修改主机名：

修改地址映射：

关闭安全机制

（2）Prometheus部署

prometheus下载地址：

https://prometheus.io/download/

①上传 prometheus-2.37.0.linux-amd64.tar.gz 到 /opt 目录中，并解压

②修改配置文件

修改静态模板配置，固定从某个target拉取数据

③配置系统启动文件，设置开机自启

Unit为服务单元，After为依赖关系，config.file为配置文件，storage.tsdb.path为数据目录，

storage.tsdb.retention为保存时间，ExecReload为重载

④开启prometheus,并访问网页验证

⑤通过浏览器访问 http:// 服务器 IP:9090 就可以访问到 Prometheus 的主界面

⑥默认只监控了本机一台，点 Status→点 Targets→可以看到只监控了本机

通过 http:// 服务器 IP:9090/metrics 可以查看到监控的数据：

2.部署Exporters

（1）监控远程Linux主机(192.168.204.20)

在远程 linux 主机（被监控端 agent）上安装 node_exporter 组件。

下载地址：

https://prometheus.io/download/

①上传 node_exporter-1.3.1.linux-amd64.tar.gz 到 /opt 目录中，并解压

②配置启动文件，设置开机自启

③启动node_exporter

④ 通过浏览器访问 http:// 被监控端 IP:9100/metrics 就可以查看到 node_exporter 在被监控端收集的监控信息

修改Prometheus服务器的配置文件

回到 Prometheus 服务器的配置文件里添加被监控机器的配置段

在主配置文件后添加这三行，不能加在上面，否则重启会报错

取一个job名称来代表被监控的机器

targets这里改成被监控机器的IP，后面端口接9100

改完配置文件后，重启服务

⑤访问prometheus服务器

回到 web 管理界面→点 Status→点 Targets→可以看到多了一台监控目标

注：也可以在本机安装 node_exporter，使用上面的方式监控本机。

（2）监控远程Linux主机(192.168.204.18)

也可以在远程 linux 主机（监控端 prometheus）上安装 node_exporter 组件，即监控本机。

下载地址：

https://prometheus.io/download/

①上传 node_exporter-1.3.1.linux-amd64.tar.gz 到 /opt 目录中，并解压

②配置启动文件，设置开机自启

③启动node_exporter

浏览器访问，可以看到 Node Exporter 采集到的指标数据

④ 通过浏览器访问 http:// 被监控端 IP:9100/metrics 就可以查看到 node_exporter 在被监控端收集的监控信息

修改Prometheus服务器的配置文件

回到 Prometheus 服务器的配置文件里添加被监控机器的配置段

在主配置文件后添加这三行，不能加在上面，否则重启会报错

取一个job名称来代表被监控的机器

targets这里改成被监控机器的IP，后面端口接9100

改完配置文件后，重启服务

⑤访问prometheus服务器

回到 web 管理界面→点 Status→点 Targets→可以看到多了一台监控目标

2.监控远程MySQL

在被管理机 agent上安装 mysqld_exporter 组件

下载地址：

https://prometheus.io/download/

(1) 安装mariadb数据库，并授权

在当前数据库中增加授权

(2) 下载mysqld_exporter组件

wget https://github.com/prometheus/mysqld_exporter/releases/download/v0.12.0/mysqld_exporter-0.12.0.linux-amd64.tar.gz

（3）安装mysqld_exporter组件

(4) 添加mysqld_exporter为系统服务

（5）启动服务并监听端口

(6) 修改Prometheus服务器的配置文件

回到 Prometheus 服务器的配置文件里添加被监控的 mariadb 的配置段

改完配置文件之后，重启服务

(7) 访问prometheus服务器

回到 web 管理界面→点 Status→点 Targets→可以看到监控 mariadb

3.部署Grafana进行展示

Grafana 是一个开源的度量分析和可视化工具，可以通过将采集的数据分析，查询，然后进行可视化的展示，并能实现报警。

下载地址:

https://grafana.com/grafana/download/

(1) 下载安装Grafana

通过浏览器访问 http:// grafana 服务器 IP:3000 就到了登录界面，使用默认的 admin 用户，admin 密码就可以登陆了。

(2) 配置数据源

下面把 Prometheus 服务器收集的数据做为一个数据源添加到 grafana，让 grafana 可以得到 Prometheus 的数据。

点击增加数据源

为此数据自定义一个名称

填写prometheus的IP和port

http://192.168.204.18:9090

Auth模块是公网传输数据加密与验证，为了保证安全

15s获取一次，GET方式

填完之后点击保存

点击设置，选择Data Source,可以查看到成功添加数据源

（3）导入模板

点击prometheus_data,选择Dashboards

点击仪表盘，全部导入

全部导入后，点击Manage

随便点击一个模板

192.168.204.19:3000/

(4) 为数据源做数据展示

创建Dashboard

数据源选择添加的Prometheus_data

写上查询的值，可以多个条件一起，都显示在同一张图上

(1分钟负载、5分钟负载、15分钟负载)

自定义名称，点击保存

最后在dashboard可以查看到，点击“agent_cpu_load”

注：有多条数据的时候，可以在查询的键值后面加个大括号，括号里的条件表示只匹配当前的监控项。

(5) 导入grafana监控面板

浏览器访问：https://grafana.com/grafana/dashboards ，在页面中搜索 node exporter ，选择适合的面板，点击 Copy ID 或者 Download JSON
 
在 grafana 页面中，+ Create -> Import ，输入面板 ID 号或者上传 JSON 文件，点击 Load，即可导入监控面板

在页面中搜索 node exporter

选择适合的面板，点击 Copy ID 或者 Download JSON

在 grafana 页面中，+ Create -> Import

输入面板 ID 号，点击 Load

选择数据源并点击导入，即可导入监控面板

此时就可以监控到这台机子的信息了（192.168.204.20）

也可以切换查询（192.168.204.18）

点击编写

可以看到实际上都是通过PromQL语句来查询的

(6) Grafana 图形显示 MySQL 监控数据

在 grafana 上修改配置文件,并下载安装 mysql 监控的 dashboard（包含相关 json 文件，这些 json 文件可以看作是开发人员开发的一个监控模板）。

点 import 导入后，报 prometheus 数据源找不到，因为这些 json 文件里默认要找的就是叫 Prometheus 的数据源，但我们前面建立的数据源却是叫 prometheus_data。

那么请自行把原来的 prometheus_data 源改名为Metrics 即可（注意：第一个字母 M 是大写）。然后再回去刷新一下，就有数据了。

修改前：

修改后：

保存提交

(7) Grafana+onealert报警

登陆https://caweb.aiops.com/→注册帐户→登入后台管理

下拉选择Grafana,点击进行配置

自定义一个名称

保存之后获得key

(8) 在Grafana中配置Webhook URL

①在Grafana中创建Notification channel，选择类型为Webhook

②推荐选中Send on all alerts和Include image，Cloud Alert体验更佳

③将第一步中生成的Webhook URL填入Webhook settings Url：

④Http Method选择POST

⑤ Send Test&Save

可以先“Test”测试一下报警媒介是否ok，然后再点击保存

测试成功（自动去重）

保存，创建成功

（9）测试CPU负载告警

现在可以去设置一个报警来测试了（这里用前面加的 cpu 负载监控来做测试）

自定义一个名称，类似于zabbix触发器名称;

IS ABOVE 这里填0.3，按实际使用也可以填0.1，表示当cpu负载平均值大于0.1就发出报警

点通知，选择之前定义好的onealert通道，自定义通知内容

保存后就可以测试了，如果 agent上的 cpu 负载还没有到 0.3，你可以试试 0.1，或者运行一些程序把 agent负载调大（比如压力测试或import一个新模板）。

点击测试

平台收到报警信息：

最终的微信报警效果：

最终的邮件报警效果：

三、问题

1.Prometheus和Zabbix区别

（1）监控的维度

①监控的广度

②监控的深度

③ 监控选型

（2）区别

和Zabbix类似，Prometheus也是一个近年比较火的开源监控框架，和Zabbix不同之处在于Prometheus相对更灵活点，模块间比较解耦，比如告警模块、代理模块等等都可以选择性配置。服务端和客户端都是开箱即用，不需要进行安装。zabbix则是一套安装把所有东西都弄好，很庞大也很繁杂。
zabbix的客户端agent可以比较方便的通过脚本来读取机器内数据库、日志等文件来做上报。而Prometheus的上报客户端则分为不同语言的SDK和不同用途的exporter两种，比如如果你要监控机器状态、mysql性能等，有大量已经成熟的exporter来直接开箱使用，通过http通信来对服务端提供信息上报（server去pull信息）；而如果你想要监控自己的业务状态，那么针对各种语言都有官方或其他人写好的sdk供你使用，都比较方便，不需要先把数据存入数据库或日志再供zabbix-agent采集。
zabbix的客户端更多是只做上报的事情，push模式。而Prometheus则是客户端本地也会存储监控数据，服务端定时来拉取想要的数据。
界面来说zabbix比较陈旧，而prometheus比较新且非常简洁，简洁到只能算一个测试和配置平台。要想获得良好的监控体验，搭配Grafana还是二者的必走之路。

2.如何防止告警信息轰炸

（1）解决方法

1）alertmanagr: prometheus可以生成告警信息，但是不能直接提供告警，需要使用一个外置的组件alertmanager来进行告警，emailetctif优势在于，收敛、支持静默、去重、可以防止告警信息的轰炸

2）把这条告警规则中的支持静默开启，让它必须，配置文件里直接改alertmanager改一个单词

3.监控服务有哪4个黄金指标

（1）指标

4个黄金指标可以在服务级别帮助衡量终端用户体验、服务中断、业务影响等层面的问题。主要关注与以下四种类型的指标：延迟，通讯量，错误以及饱和度：

（2）延迟：服务请求所需时间

记录用户所有请求所需的时间，重点是要区分成功请求的延迟时间和失败请求的延迟时间。 例如在数据库或者其他关键祸端服务异常触发HTTP 500的情况下，用户也可能会很快得到请求失败的响应内容，如果不加区分计算这些请求的延迟，可能导致计算结果与实际结果产生巨大的差异。除此以外，在微服务中通常提倡“快速失败”，开发人员需要特别注意这些延迟较大的错误，因为这些缓慢的错误会明显影响系统的性能，因此追踪这些错误的延迟也是非常重要的。

（3）通讯量：监控当前系统的流量，用于衡量服务的容量需求

流量对于不同类型的系统而言可能代表不同的含义。例如，在HTTP REST API中, 流量通常是每秒HTTP请求数；

（4）错误：监控当前系统所有发生的错误请求，衡量当前系统错误发生的速率

对于失败而言有些是显式的(比如, HTTP 500错误)，而有些是隐式(比如，HTTP响应200，但实际业务流程依然是失败的)。
对于一些显式的错误如HTTP 500可以通过在负载均衡器(如Nginx)上进行捕获，而对于一些系统内部的异常，则可能需要直接从服务中添加钩子统计并进行获取。

（5）饱和度：衡量当前服务的饱和度

主要强调最能影响服务状态的受限制的资源。 例如，如果系统主要受内存影响，那就主要关注系统的内存状态，如果系统主要受限与磁盘I/O，那就主要观测磁盘I/O的状态。因为通常情况下，当这些资源达到饱和后，服务的性能会明显下降。同时还可以利用饱和度对系统做出预测，比如，“磁盘是否可能在4个小时候就满了”。

4.访问prometheus服务器被监控端agent服务器状态报错

(1) 报错

（2）原因分析

配置文件错误

（3）解决方法

修改配置文件被监控机器的IP

修改前：

修改后：

重启

成功：

5.mysqld_exporter如何指定启动参数

(1 ) 参数

mysqld_exporter常用启动参数:

1） exporter版本>0.10.0时：
--collect.auto_increment.columns
--no-collect.auto_increment.columns

2）exporter版本<=0.10.0时：
-collect.auto_increment.columns
-collect.auto_increment.columns=[true|false]

通过以下参数控制收集数据：

通用启动参数：

（2）SSL配置

如果MySQL服务器支持SSL，则需要指定一个CA信任库来验证服务器的信任链，并为SSL连接的客户端指定SSL密钥对。
要将mysqld_exporter配置为使用自定义CA证书，请将以下内容添加到.my.cnf的配置文件中：

ssl-ca=/path/to/ca/file

要指定客户端SSL密钥对，请将以下内容添加到cnf中。

ssl-key=/path/to/ssl/client/key
ssl-cert=/path/to/ssl/client/cert

仅在mysql cnf文件中支持自定义SSL配置，如果在环境变量DATA_SOURCE_NAME中设置mysql服务器的数据源名称，则不支持自定义SSL配置。

四、总结

Prometheus收集k8s/服务的三种方式

1）Exporters（指标暴露器）：收集节点的信息、将数据格式化或转化为promtheus可识别的http这种转化方式/镜像拉取方式
2）Instrumentation （应用内置的指标暴露器）： 收集有内置指标暴露器的信息
3）Pushgateway ： 收集短周期的数据

报警不成功的可能原因：

各服务器之间时间不同步，这样时序数据会出问题，也会造成报警出问题

必须写通知内容，留空内容是不会发报警的

修改完报警配置后，记得要点右上角的保存

保存配置后，需要由 OK 状态变为 alerting 状态才会报警（也就是说，你配置保存后，就已经是 alerting 状态是不会报警的）

grafana 与 onealert 通信有问题

各组件默认端口：

node 默认端口：9100
mysql默认端口：9104
redis 默认端口：9121
process默认端口：9256
alertmanager默认端口：9093

指标类型（metric type）：

Prometheus 使用4种方法来描述监视的指标：
1）Counter
计数器，用于保存计数型数据，如网站访问量等。

2）Gauge
仪表盘，用于存储有着起伏特征的指标数据，如空间空闲大小等。

3）Histogram
直方图，在一段时间范围内对数据进行采样，并将其计入可配置的存储中，后续可通过制定区间筛选样本，也可以统计样本总数，最后一般将数据展示为直方图。

4）Summary
摘要，Histogram的扩展类型，用于表示一段时间内的数据采样结果（通常是请求持续时间或响应大小等），但它直接存储了分位数（通过客户端计算，然后展示出来），而不是通过区间计算

作业（job）和实例（Instance）：

1）Instance
实例可以简单的理解为就是一个target，网络客户端,实际上在多核心的服务器上，一个instance就代表一个cpu核心；

2）job
通常，具有类似功能的Instance的集合称为一个job。例如一个nginx集群中所有的nginx进程。

PromQL：

1）内置的数据查询语言，支持用户进行实时的数据查询及聚合操作

2）PromQL支持处理两种向量，并内置提供了一组用于数据处理的函数
即使向量：最近一次的时间戳上跟踪的数据指标
时间范围向量：指定范围时间内的所有时间戳上的数指标

Alerts：

1）抓取到异常值后，Prometheus 支持通过报警（alert）机制向用户发送反馈，以便用户能够及时采取应对措施。

2）Prometheus server 仅负责生成报警指示，具体的报警行为由另一个独立的应用程序AlertManager负责。
*报警指示由Prometheus server 基于用户提供的“报警规则”周期性计算生成；
*AlertManager接收到Prometheus server发来的报警指示后，基于用户定义的报警路由（route）向接收人（receivers）发送报警信息；

grafana常用模板编号记录：

第一部分
监控容器
推荐ID
3146
8685
10000
8588
315


第二部分
监控物理机/虚拟机(linux)
推荐ID
8919
9276
监控物理机/虚拟机(windows)
推荐ID
10467
10171
2129

第三部分
监控协议http/icmp/tcp/dns/
http监控某个网站
icmp监控某台机器
tcp监控某个端口
dns监控dns
推荐ID
9965

你可能感兴趣的:(云原生,kubernetes,prometheus)

腾讯云技术深度探索：构建高效云原生微服务架构我的运维人生云原生架构腾讯云运维开发技术共享
腾讯云技术深度探索：构建高效云原生微服务架构在当今快速发展的技术环境中，云原生技术已成为企业数字化转型的关键驱动力。腾讯云作为行业领先的云服务提供商，不断推出创新的产品和技术，助力企业构建高效、可扩展的云原生微服务架构。本文将深入探讨腾讯云在微服务领域的最新进展，并通过一个实际案例展示如何在腾讯云平台上构建云原生应用。腾讯云微服务架构概览腾讯云微服务架构基于云原生理念，旨在帮助企业快速实现应用的容
react-intl——react国际化使用方案苹果酱0567 面试题汇总与解析 java 开发语言中间件 spring boot 后端
国际化介绍i18n：internationalization国家化简称，首字母+首尾字母间隔的字母个数+尾字母，类似的还有k8s(Kubernetes)React-intl是React中最受欢迎的库。使用步骤安装#usenpmnpminstallreact-intl-D#useyarn项目入口文件配置//index.tsximportReactfrom"react";importReactDOMf
Kubernetes数据持久化看清所苡看轻 kubernetes(k8s)emptyDir HostPath pv pvc kubernetes
在k8s中，Volume（数据卷）存在明确的生命周期（与包含该数据卷的容器组（pod）相同）。因此Volume的生命周期比同一容器组（pod）中任意容器的生命周期要更长，不管容器重启了多少次，数据都被保留下来。当然，如果pod不存在了，数据卷自然退出了。此时，根据pod所使用的数据卷类型不同，数据可能随着数据卷的退出而删除，也可能被真正持久化，并在下次容器组重启时仍然可以使用。从根本上来说，一个数
Kubernetes部署MySQL数据持久化沫殇-MS Kubernetes MySQL数据库 kubernetes mysql 容器
一、安装配置NFS服务端1、安装nfs-kernel-server：sudoapt-yinstallnfs-kernel-server2、服务端创建共享目录#列出所有可用块设备的信息lsblk#格式化磁盘sudomkfs-text4/dev/sdb#创建一个目录：sudomkdir-p/data/nfs/mysql#更改目录权限：sudochown-Rnobody:nogroup/data/nfs
Kubernetes的3种数据持久化方式 Seal^_^ 【云原生】容器化与编排技术持续集成 #Kubernetes kubernetes 容器云原生 EmptyDir 面试 HostPath
Kubernetes的3种数据持久化方式1.EmptyDir2.HostPath3.PersistentVolume(PV)TheBegin点点关注，收藏不迷路Kubernetes提供了几种数据持久化方式，以满足不同场景的需求：1.EmptyDir用途：临时数据存储，Pod内容器间共享。特点：生命周期与Pod相同，Pod删除时数据也删除。2.HostPath用途：访问宿主机特定文件或目录。特点：增
【Kubernetes】常见面试题汇总（十一） summer.335 Kubernetes kubernetes 容器云原生
目录33.简述Kubernetes外部如何访问集群内的服务？34.简述Kubernetesingress？35.简述Kubernetes镜像的下载策略？33.简述Kubernetes外部如何访问集群内的服务？（1）对于Kubernetes，集群外的客户端默认情况，无法通过Pod的IP地址或者Service的虚拟IP地址：虚拟端口号进行访问。（2）通常可以通过以下方式进行访问Kubernetes集群
k8s中Service暴露的种类以及用法听说唐僧不吃肉 K8S kubernetes 容器云原生
一、说明在Kubernetes中，有几种不同的方式可以将服务（Service）暴露给外部流量。这些方式通过定义服务的spec.type字段来确定。二、详解1.ClusterIP定义：默认类型，服务只能在集群内部访问。作用：通过集群内部IP地址暴露服务。示例：spec:type:ClusterIPports:-port:80targetPo
Kubernetes 自定义控制器开发 IT回忆录 Kubenetes kubernetes
目录前言一、CRD二、创建数据库表（Mysql）二、控制器开发1.使用kubernetes的examplecontroller模板2.在controller.go中新增数据表监听方法3.修改tools工具生成资源对象结构体定义这里记录开发k8s控制器的一般方式，controller开发主要使用k8s提供的client-go库进行。前言Controller监听集群内部资源对象的变化，编辑资源对象(增
用kubedam搭建的k8s证书过期处理方法我滴鬼鬼呀wks k8s 1024程序员节
kubeadm部署的k8s证书过期1、查看证书过期时间kubeadmalphacertscheck-expiration若证书已经过期无法试用kubectl命令建议修改服务器时间到未过期的时间段2、配置kube-controller-manager.yaml文件cat/etc/kubernetes/manifests/kube-controller-manager.yamlapiVersion:v
k8s证书过期问题处理 olina_qin kubernetes 容器云原生
k8s证书过期问题处理opensslx509-in/etc/kubernetes/pki/apiserver.crt-noout-dateskubeadmcertsrenewallsystemctlrestartkubeleopensslx509-in/etc/kubernetes/pki/apiserver.crt-noout-text|grep"NotAfter"cp/etc/kubernet
Kubernetes Ingress 控制器（Nginx）安装与使用教程农优影
KubernetesIngress控制器（Nginx）安装与使用教程kubernetes-ingressNGINXandNGINXPlusIngressControllersforKubernetes项目地址:https://gitcode.com/gh_mirrors/ku/kubernetes-ingress1.项目目录结构及介绍在nginxinc/kubernetes-ingress仓库中，
【K8s】专题十一：Kubernetes 集群证书过期处理方法行者Sun1989 Kubernetes kubernetes 云原生容器
本文内容均来自个人笔记并重新梳理，如有错误欢迎指正！如果对您有帮助，烦请点赞、关注、转发、订阅专栏！专栏订阅入口Linux专栏|Docker专栏|Kubernetes专栏往期精彩文章【Docker】（全网首发）KylinV10下MySQL容器内存占用异常的解决方法【Docker】（全网首发）KylinV10下MySQL容器内存占用异常的解决方法（续）【Docker】MySQL源码构建Docker镜
Docker学习十一：Kubernetes概述爱打羽球的程序猿 Docker学习系列 docker kubernetes 学习
一、Kubernetes简介2006年，Google提出了云计算的概念，当时的云计算领域还是以虚拟机为代表的云平台。2013年，Docker横空出世，Docker提出了镜像、仓库等核心概念，规范了服务的交付标准，使得复杂服务的落地变得更加简单，之后Docker又定义了OCI标准，Docker在容器领域称为事实的标准。但是，Docker诞生只是帮助定义了开发和交付标准，如果想要在生产环境中大批量的使
Cloud Native Weekly | 华为云抢先发布Redis5.0，红帽宣布收购混合云提供商 weixin_34302561 数据库 devops 大数据
1——华为云抢先发布Redis5.02——DigitalOceanK8s服务正式上线3——红帽宣布收购混合云提供商NooBaa4——微软发布多项AzureKubernetes服务更新1华为云抢先发布Redis5.012月17日，华为云在DCS2.0的基础上，快人一步，抢先推出了新的Redis5.0产品，这是一个崭新的突破。目前国内在缓存领域的发展普遍停留在Redis4.0阶段，华为云率先发布了Re
SpringBoot整合ES搜索引擎实现网站热搜词及热度计算码踏云端 springboot Elasticsearch spring boot elasticsearch 后端热搜词热度计算 java
博主简介：历代文学网（PC端可以访问：https://literature.sinhy.com/#/literature?__c=1000，移动端可微信小程序搜索“历代文学”）总架构师，15年工作经验，精通Java编程，高并发设计，Springboot和微服务，熟悉Linux，ESXI虚拟化以及云原生Docker和K8s，热衷于探索科技的边界，并将理论知识转化为实际应用。保持对新技术的好奇心，乐于
（k8s）Kubernetes 从0到1容器编排之旅道不贱卖，法不轻传 kubernets kubernetes 容器云原生
一、引言在当今数字化的浪潮中，Kubernetes如同一艘强大的航船，引领着容器化应用的部署与管理。它以其卓越的灵活性、可扩展性和可靠性，成为众多企业和开发者的首选。然而，要真正发挥Kubernetes的强大威力，仅仅掌握基本操作是远远不够的。本文将带你深入探索Kubernetes使用过程中的奇技妙法，为你开启一段优雅的容器编排之旅。二、高级资源管理之精妙艺术1.资源配额与限制：雕琢资源之美•Ku
【监控告警】02-Promtheus的学习之路 Kearey. 监控告警微服务网关学习方法
prometheus采用的是拉模式为主，推模式为辅的方式采集数据。Prometheus作为一个指标系统天生就不是精确的——由于指标本身就是稀疏采样的，事实上所有的图表和警报都是”估算”，我们也就不必太纠结于图表和警报的对应性，能够帮助我们发现问题解决问题就是一个好监控系统。当然，有时候我们也得证明这个警报确实没问题，那可以看一眼`ALERTS`指标。`ALERTS`是Prometheus在警报计算
prometheus中step或resolution的含义 iceman1952 prometheus
prometheus官方文档对resolution的解释真是语焉不详，只有下面寥寥几句话Queryingexamples|PrometheusSubqueryReturnthe5-minuterateofthehttp_requests_totalmetricforthepast30minutes,witharesolutionof1minute.rate(http_requests_total[
Prometheus运维六 PromQL查询语言详解及操作安顾里 Prometheus 监控类大数据 kubernetes 运维 linux
海阔凭鱼跃，天高任鸟飞Prometheus官网：https://prometheus.io/文章目录1.什么是PromQL?2.PromQL的基本使用2.1时间序列选择器2.1.1瞬时向量选择器2.2区间向量选择器2.2.1范围向量选择器2.2.2时间位移操作2.2.3使用聚合操作2.3标量和字符串3.PromQL操作符4.内置常用函数5.HTTPAPI操作PromQL6.使用建议1.什么是Pro
【K8S】kubernetes集群架构与组件奇奇怪怪^ 云 Linux IT 运维服务器 linux
文章目录【K8S】kubernetes集群架构与组件kubernetes组件**master组件**node组件整体流程POD终止过程【K8S】kubernetes集群架构与组件kubernetes组件K8S是属于主从设备模型(Master-slave架构)，即有Master节点负责集群的调度、管理和运维，Slave节点是集群中的运算工作负载节点在K8S中，主节点一般被称为Master节点，而从节
K8S学习笔记02——K8S组件沉淅尘 #Docker #K8S kubernetes
Kubernetes组件一、控制平面组件（ControlPlaneComponents）(1)kube-apiserver(2)etcd(3)kube-scheduler(4)kube-controller-manager(5)cloud-controller-manager二、Node组件1.kubelet2.kube-proxy3.容器运行时（ContainerRuntime）三、插件（Add
Kubernetes——组件窒息う Kubernetes kubernetes 容器
文章目录K8S的优势核心架构角色与功能集群图例K8S的优势能管理大量跨主机容器快速部署应用快速扩展应用无缝对接新的应用节省资源，优化硬件资源的使用核心架构master（管理节点）node（计算节点）images（镜像节点）角色与功能Master功能提供集群的控制对集群进行全局决策检测和响应集群事件Master节点核心组件APIServer是整个系统的对外接口，提供客户端和其他组件调用后端元数据存储
基于Prometheus和Grafana的现代服务器监控体系构建 golove666 运维 prometheus grafana 服务器
构建一个基于Prometheus和Grafana的现代服务器监控体系涉及多个步骤。以下是大体的流程和步骤说明：1.Prometheus监控系统Prometheus是一个开源的系统监控和报警工具，专门设计用于抓取时间序列数据。1.1Prometheus的安装Docker安装Prometheusdockerrun-d--name=prometheus-p9090:9090prom/prometheus
Kubernetes组件汉只只网络 docker 大数据分布式 hadoop
Kubernetes核心组件Kubernetes定义了一组构建块，它们可以共同提供部署、维护和扩展应用程序的机制。组成Kubernetes的组件设计为松耦合和可扩展的，这样可以满足多种不同的工作负载。可扩展性在很大程度上由KubernetesAPI提供——它被作为扩展的内部组件以及Kubernetes上运行的容器等使用。Kubernetes主要由以下几个核心组件组成：etcd保存了整个集群的状态；
压测服务器并使用 Grafana 进行可视化豆瑞瑞 grafana
简介仓库代码GitCode-全球开发者的开源社区,开源代码托管平台参考Welcome!-TheApacheHTTPServerProjectGrafana|查询、可视化、警报观测平台https://prometheus.io/docs/introduction/overview/
首次全面解析云原生成熟度模型：解决企业「诊断难、规划难、选型难」问题阿里云云栖号云原生云计算运维阿里云
从“上云”到“云上”原生，云原生提供了最优用云路径，云原生的技术价值已被广泛认可。当前行业用户全面转型云原生已是大势所趋，用户侧云原生平台建设和应用云原生化改造进程正在加速。然而，云原生复杂的技术栈和传统IT的历史包袱给用户带来了巨大挑战，针对平台建设和应用改造的能力要求缺少统一规范成为企业转型的最大障碍。在用户侧，企业执行层面存在“三难”问题，即诊断难、规划难、选型难，需求和供给不能精准对应，缺
【Linux 从基础到进阶】Kubernetes 集群搭建与管理爱技术的小伙子 Linux从基础到进阶 linux kubernetes 运维
Kubernetes集群搭建与管理Kubernetes（简称K8s）是一个用于自动化部署、扩展和管理容器化应用程序的开源平台。它提供了容器编排功能，能够管理大量的容器实例，并支持应用的自动扩展、高可用性和自愈能力。本文将详细介绍如何在CentOS和Ubuntu系统上安装和配置Kubernetes集群，并讲解Kubernetes的基本概念和管理操作。1.Kubernetes基础概念在了解如何搭建Ku
【Kubernetes】常见面试题汇总（十三） summer.335 Kubernetes kubernetes 容器云原生
目录39.简述KubernetesScheduler使用哪两种算法将Pod绑定到worker节点？40.简述Kuberneteskubelet的作用？41.简述Kuberneteskubelet监控Worker节点资源是使用什么组件来实现的？39.简述KubernetesScheduler使用哪两种算法将Pod绑定到worker节点？KubernetesScheduler根据如下两种调度算法将Po
Java服务端中的性能监控：Prometheus与Grafana的集成微赚淘客系统@聚娃科技 java prometheus grafana
Java服务端中的性能监控：Prometheus与Grafana的集成大家好，我是微赚淘客返利系统3.0的小编，是个冬天不穿秋裤，天冷也要风度的程序猿！在构建和维护Java服务端应用时，性能监控是确保系统稳定性和性能的重要环节。Prometheus与Grafana是当前最流行的性能监控工具组合之一，能够提供强大的数据采集、存储和可视化功能。本文将介绍如何在Java服务端中集成Prometheus与
Ansible自动化部署kubernetes集群 theo.wu kubernetes ansible 自动化
机器环境介绍1.1.机器信息介绍IPhostnameapplicationCPUMemory192.168.204.129k8s-master01etcd，kube-apiserver，kube-controller-manager，kube-scheduler,kubelet,kube-proxy,containerd2C4G192.168.204.130k8s-worker01etcd，kub
java线程Thread和Runnable区别和联系 zx_code java jvm thread 多线程 Runnable
我们都晓得java实现线程2种方式，一个是继承Thread，另一个是实现Runnable。模拟窗口买票，第一例子继承thread，代码如下 package thread; public class ThreadTest { public static void main(String[] args) { Thread1 t1 = new Thread1(
【转】JSON与XML的区别比较丁_新 json xml
1.定义介绍 (1).XML定义扩展标记语言 (Extensible Markup Language, XML) ，用于标记电子文件使其具有结构性的标记语言，可以用来标记数据、定义数据类型，是一种允许用户对自己的标记语言进行定义的源语言。 XML使用DTD(document type definition)文档类型定义来组织数据;格式统一，跨平台和语言，早已成为业界公认的标准。 XML是标
c++ 实现五种基础的排序算法 CrazyMizzz C++c 算法
#include<iostream> using namespace std; //辅助函数，交换两数之值 template<class T> void mySwap(T &x, T &y){ T temp = x; x = y; y = temp; } const int size = 10; //一、用直接插入排
我的软件麦田的设计者我的软件音乐类娱乐放松
这是我写的一款app软件，耗时三个月，是一个根据央视节目开门大吉改变的，提供音调，猜歌曲名。1、手机拥有者在android手机市场下载本APP，同意权限，安装到手机上。2、游客初次进入时会有引导页面提醒用户注册。（同时软件自动播放背景音乐）。3、用户登录到主页后，会有五个模块。a、点击不胫而走，用户得到开门大吉首页部分新闻，点击进入有新闻详情。b、
linux awk命令详解被触发 linux awk
awk是行处理器: 相比较屏幕处理的优点，在处理庞大文件时不会出现内存溢出或是处理缓慢的问题，通常用来格式化文本信息 awk处理过程: 依次对每一行进行处理，然后输出 awk命令形式: awk [-F|-f|-v] ‘BEGIN{} //{command1; command2} END{}’ file [-F|-f|-v]大参数，-F指定分隔符，-f调用脚本，-v定义变量 var=val
各种语言比较 _wy_ 编程语言
Java Ruby PHP 擅长领域
oracle 中数据类型为clob的编辑知了ing oracle clob
public void updateKpiStatus(String kpiStatus,String taskId){ Connection dbc=null; Statement stmt=null; PreparedStatement ps=null; try { dbc = new DBConn().getNewConnection(); //stmt = db
分布式服务框架 Zookeeper -- 管理分布式环境中的数据矮蛋蛋 zookeeper
原文地址： http://www.ibm.com/developerworks/cn/opensource/os-cn-zookeeper/ 安装和配置详解本文介绍的 Zookeeper 是以 3.2.2 这个稳定版本为基础，最新的版本可以通过官网 http://hadoop.apache.org/zookeeper/来获取，Zookeeper 的安装非常简单，下面将从单机模式和集群模式两
tomcat数据源 alafqq tomcat
数据库 JNDI(Java Naming and Directory Interface，Java命名和目录接口)是一组在Java应用中访问命名和目录服务的API。没有使用JNDI时我用要这样连接数据库： 03. Class.forName("com.mysql.jdbc.Driver"); 04. conn
遍历的方法百合不是茶遍历
遍历在java的泛
linux查看硬件信息的命令 bijian1013 linux
linux查看硬件信息的命令一.查看CPU： cat /proc/cpuinfo 二.查看内存： free 三.查看硬盘： df linux下查看硬件信息 1、lspci 列出所有PCI 设备； lspci - list all PCI devices:列出机器中的PCI设备（声卡、显卡、Modem、网卡、USB、主板集成设备也能
java常见的ClassNotFoundException bijian1013 java
1.java.lang.ClassNotFoundException: org.apache.commons.logging.LogFactory 添加包common-logging.jar2.java.lang.ClassNotFoundException: javax.transaction.Synchronization
【Gson五】日期对象的序列化和反序列化 bit1129 反序列化
对日期类型的数据进行序列化和反序列化时，需要考虑如下问题： 1. 序列化时，Date对象序列化的字符串日期格式如何 2. 反序列化时，把日期字符串序列化为Date对象，也需要考虑日期格式问题 3. Date A -> str -> Date B,A和B对象是否equals 默认序列化和反序列化 import com
【Spark八十六】Spark Streaming之DStream vs. InputDStream bit1129 Stream
1. DStream的类说明文档： /** * A Discretized Stream (DStream), the basic abstraction in Spark Streaming, is a continuous * sequence of RDDs (of the same type) representing a continuous st
通过nginx获取header信息 ronin47 nginx header
1. 提取整个的Cookies内容到一个变量，然后可以在需要时引用，比如记录到日志里面， if ( $http_cookie ~* "(.*)$") { set $all_cookie $1; } 变量$all_cookie就获得了cookie的值，可以用于运算了
java-65.输入数字n，按顺序输出从1最大的n位10进制数。比如输入3，则输出1、2、3一直到最大的3位数即999 bylijinnan java
参考了网上的http://blog.csdn.net/peasking_dd/article/details/6342984 写了个java版的： public class Print_1_To_NDigit { /** * Q65.输入数字n，按顺序输出从1最大的n位10进制数。比如输入3，则输出1、2、3一直到最大的3位数即999 * 1.使用字符串
Netty源码学习-ReplayingDecoder bylijinnan java netty
ReplayingDecoder是FrameDecoder的子类，不熟悉FrameDecoder的，可以先看看 http://bylijinnan.iteye.com/blog/1982618 API说，ReplayingDecoder简化了操作，比如： FrameDecoder在decode时，需要判断数据是否接收完全： public class IntegerH
js特殊字符过滤 cngolon js特殊字符 js特殊字符过滤
1.js中用正则表达式过滤特殊字符, 校验所有输入域是否含有特殊符号function stripscript(s) { var pattern = new RegExp("[`~!@#$^&*()=|{}':;',\\[\\].<>/?~！@#￥……&*（）——|{}【】‘；：”“'。，、？]"
hibernate使用sql查询 ctrain Hibernate
import java.util.Iterator; import java.util.List; import java.util.Map; import org.hibernate.Hibernate; import org.hibernate.SQLQuery; import org.hibernate.Session; import org.hibernate.Transa
linux shell脚本中切换用户执行命令方法 daizj linux shell 命令切换用户
经常在写shell脚本时，会碰到要以另外一个用户来执行相关命令，其方法简单记下： 1、执行单个命令：su - user -c "command" 如：下面命令是以test用户在/data目录下创建test123目录 [root@slave19 /data]# su - test -c "mkdir /data/test123"
好的代码里只要一个 return 语句 dcj3sjt126com return
别再这样写了：public boolean foo() { if (true) { return true; } else { return false;
Android动画效果学习 dcj3sjt126com android
1、透明动画效果方法一：代码实现 public View onCreateView(LayoutInflater inflater, ViewGroup container, Bundle savedInstanceState) { View rootView = inflater.inflate(R.layout.fragment_main, container, fals
linux复习笔记之bash shell (4)管道命令 eksliang linux管道命令汇总 linux管道命令 linux常用管道命令
转载请出自出处： http://eksliang.iteye.com/blog/2105461 bash命令执行的完毕以后，通常这个命令都会有返回结果，怎么对这个返回的结果做一些操作呢？那就得用管道命令‘|’。上面那段话，简单说了下管道命令的作用，那什么事管道命令呢？答：非常的经典的一句话，记住了，何为管
Android系统中自定义按键的短按、双击、长按事件 gqdy365 android
在项目中碰到这样的问题：由于系统中的按键在底层做了重新定义或者新增了按键，此时需要在APP层对按键事件（keyevent）做分解处理，模拟Android系统做法，把keyevent分解成： 1、单击事件：就是普通key的单击； 2、双击事件：500ms内同一按键单击两次； 3、长按事件：同一按键长按超过1000ms（系统中长按事件为500ms）； 4、组合按键：两个以上按键同时按住；
asp.net获取站点根目录下子目录的名称 hvt .net C#asp.net hovertree Web Forms
使用Visual Studio建立一个.aspx文件(Web Forms)，例如hovertree.aspx,在页面上加入一个ListBox代码如下： <asp:ListBox runat="server" ID="lbKeleyiFolder" /> 那么在页面上显示根目录子文件夹的代码如下： string[] m_sub
Eclipse程序员要掌握的常用快捷键 justjavac java eclipse 快捷键 ide
判断一个人的编程水平，就看他用键盘多，还是鼠标多。用键盘一是为了输入代码（当然了，也包括注释），再有就是熟练使用快捷键。曾有人在豆瓣评《卓有成效的程序员》：“人有多大懒，才有多大闲”。之前我整理了一个程序员图书列表，目的也就是通过读书，让程序员变懒。写道程序员作为特殊的群体，有的人可以这么懒，懒到事情都交给机器去做，而有的人又可
c++编程随记 lx.asymmetric C++笔记
为了字体更好看，改变了格式…… &&运算符： #include<iostream> using namespace std; int main(){ int a=-1,b=4,k; k=(++a<0)&&!(b--
linux标准IO缓冲机制研究音频数据 linux
一、什么是缓存I/O(Buffered I/O)缓存I/O又被称作标准I/O,大多数文件系统默认I/O操作都是缓存I/O。在Linux的缓存I/O机制中，操作系统会将I/O的数据缓存在文件系统的页缓存(page cache)中，也就是说，数据会先被拷贝到操作系统内核的缓冲区中，然后才会从操作系统内核的缓冲区拷贝到应用程序的地址空间。1.缓存I/O有以下优点:A.缓存I/O使用了操作系统内核缓冲区，
随想生活暗黑小菠萝生活
其实账户之前就申请了，但是决定要自己更新一些东西看也是最近。从毕业到现在已经一年了。没有进步是假的，但是有多大的进步可能只有我自己知道。毕业的时候班里12个女生，真正最后做到软件开发的只要两个包括我，PS：我不是说测试不好。当时因为考研完全放弃找工作，考研失败，我想这只是我的借口。那个时候才想到为什么大学的时候不能好好的学习技术，增强自己的实战能力，以至于后来找工作比较费劲。我
我认为POJO是一个错误的概念 windshome java POJO 编程 J2EE 设计
这篇内容其实没有经过太多的深思熟虑，只是个人一时的感觉。从个人风格上来讲，我倾向简单质朴的设计开发理念；从方法论上，我更加倾向自顶向下的设计；从做事情的目标上来看，我追求质量优先，更愿意使用较为保守和稳妥的理念和方法。 &