TiDB 使用开源时序数据库 Prometheus 作为监控和性能指标信息存储方案,使用 Grafana 作为可视化组件进行展示。
Prometheus 是一个拥有多维度数据模型的、灵活的查询语句的时序数据库。Prometheus 作为热门的开源项目,拥有活跃的社区及众多的成功案例。
Prometheus 提供了多个组件供用户使用。目前,TiDB 使用了以下组件:
Grafana 是一个开源的 metric 分析及可视化系统。TiDB 使用 Grafana 来展示 TiDB 的各项性能指标。如下图所示:
TiDB 提供了以下两种接口来监控集群状态:
状态接口用于监控组件的一些基本信息,并且可以作为 keepalive 的监测接口。另外,通过 PD 的状态接口可以看到整个 TiKV 集群的详细信息。
http:// h o s t : {host}: host:{port}
api_name
详细信息:参见 TiDB API 文档http:// h o s t : {host}: host:{port}/status
获取当前 TiDB Server 的状态,并判断该 TiDB Server 是否存活。结果以 JSON 格式返回:curl http://127.0.0.1:10080/status
{
connections: 0, # 当前 TiDB Server 上的客户端连接数
version: "5.7.25-TiDB-v3.0.0-beta-250-g778c3f4a5", # TiDB 版本号
git_hash: "778c3f4a5a716880bcd1d71b257c8165685f0d70" # TiDB 当前代码的 Git Hash
}
http:// h o s t : {host}: host:{port}/pd/api/v1/${api_name}
api_name
详细信息:参见 PD API Doc通过该接口可以获取当前所有 TiKV 节点的状态以及负载均衡信息。下面以一个单节点的 TiKV 集群为例,说明用户需要了解的信息:
curl http://127.0.0.1:2379/pd/api/v1/stores
{
"count": 1, # TiKV 节点数量
"stores": [ # TiKV 节点的列表
# 集群中单个 TiKV 节点的信息
{
"store": {
"id": 1,
"address": "127.0.0.1:20160",
"version": "3.0.0-beta",
"state_name": "Up"
},
"status": {
"capacity": "20 GiB", # 存储总容量
"available": "16 GiB", # 存储剩余容量
"leader_count": 17,
"leader_weight": 1,
"leader_score": 17,
"leader_size": 17,
"region_count": 17,
"region_weight": 1,
"region_score": 17,
"region_size": 17,
"start_ts": "2019-03-21T14:09:32+08:00", # 启动时间
"last_heartbeat_ts": "2019-03-21T14:14:22.961171958+08:00", # 最后一次心跳的时间
"uptime": "4m50.961171958s"
}
}
]
Metrics 接口用于监控整个集群的状态和性能。
如果使用 TiDB Ansible 部署 TiDB 集群,监控系统(Prometheus 和 Grafana)会同时部署。
如果使用其他方式部署 TiDB 集群,在使用 metrics 接口前,需先部署 Prometheus 和 Grafana。
成功部署 Prometheus 和 Grafana 之后,配置 Grafana。
假设 TiDB 的拓扑结构如下:
节点 | 主机 IP | 服务 |
---|---|---|
Node1 | 192.168.199.113 | PD1, TiDB, node_export, Prometheus, Grafana |
Node2 | 192.168.199.114 | PD2, node_export |
Node3 | 192.168.199.115 | PD3, node_export |
Node4 | 192.168.199.116 | TiKV1, node_export |
Node5 | 192.168.199.117 | TiKV2, node_export |
Node6 | 192.168.199.118 | TiKV3, node_export |
下载二进制包:
wget https://github.com/prometheus/prometheus/releases/download/v2.2.1/prometheus-2.2.1.linux-amd64.tar.gz &&
wget https://github.com/prometheus/node_exporter/releases/download/v0.15.2/node_exporter-0.15.2.linux-amd64.tar.gz &&
wget https://s3-us-west-2.amazonaws.com/grafana-releases/release/grafana-4.6.3.linux-x64.tar.gz
注意:
wget https://github.com/prometheus/node_exporter/releases/download/v0.15.2/node_exporter-0.15.2.linux-amd64.tar.gz可能下载不下来,可以下载wget https://github.com/prometheus/node_exporter/releases/download/v0.18.1/node_exporter-0.15.2.linux-amd64.tar.gz
解压二进制包:
tar -xzf prometheus-2.2.1.linux-amd64.tar.gz &&
tar -xzf node_exporter-0.15.2.linux-amd64.tar.gz && #要和上面保持一致
tar -xzf grafana-4.6.3.linux-x64.tar.gz
cd node_exporter-0.15.2.linux-amd64
启动 node_exporter 服务:
./node_exporter --web.listen-address=":9100" \
--log.level="info" &
编辑 Prometheus 的配置文件:
cd prometheus-2.2.1.linux-amd64 &&
vi prometheus.yml
...
global:
scrape_interval: 15s
evaluation_interval: 15s
# scrape_timeout 设置为全局默认值 (10s)
external_labels:
cluster: 'test-cluster'
monitor: "prometheus"
scrape_configs:
- job_name: 'overwritten-nodes'
honor_labels: true # 不要覆盖 job 和实例的 label
static_configs:
- targets:
- '192.168.199.113:9100' #记得更改成你的IP地址
- '192.168.199.114:9100'
- '192.168.199.115:9100'
- '192.168.199.116:9100'
- '192.168.199.117:9100'
- '192.168.199.118:9100'
- job_name: 'tidb'
honor_labels: true # 不要覆盖 job 和实例的 label
static_configs:
- targets:
- '192.168.199.113:10080' #记得更改成你的IP地址
- job_name: 'pd'
honor_labels: true # 不要覆盖 job 和实例的 label
static_configs:
- targets:
- '192.168.199.113:2379' #记得更改成你的IP地址
- '192.168.199.114:2379'
- '192.168.199.115:2379'
- job_name: 'tikv'
honor_labels: true # 不要覆盖 job 和实例的 label
static_configs:
- targets:
- '192.168.199.116:20180' #记得更改成你的IP地址
- '192.168.199.117:20180'
- '192.168.199.118:20180'
...
启动 Grafana 服务:
./prometheus \
--config.file="./prometheus.yml" \
--web.listen-address=":9090" \
--web.external-url="http://192.168.199.113:9090/" \
--web.enable-admin-api \
--log.level="info" \
--storage.tsdb.path="./data.metrics" \
--storage.tsdb.retention="15d" &
编辑 Grafana 的配置文件:
cd grafana-4.6.3 &&
vi conf/grafana.ini
...
[paths]
data = ./data
logs = ./data/log
plugins = ./data/plugins
[server]
http_port = 3000
domain = 192.168.199.113 #记得更改成你的IP
[database]
[session]
[analytics]
check_for_updates = true
[security]
admin_user = admin #初始用户名
admin_password = admin #初始密码
[snapshots]
[users]
[auth.anonymous]
[auth.basic]
[auth.ldap]
[smtp]
[emails]
[log]
mode = file
[log.console]
[log.file]
level = info
format = text
[log.syslog]
[event_publisher]
[dashboards.json]
enabled = false
path = ./data/dashboards
[metrics]
[grafana_net]
url = https://grafana.net
...
启动 Grafana 服务:
./bin/grafana-server \
--config="./conf/grafana.ini" &
1、默认地址:http://你的ip:3000
2、默认账户:admin
3、默认密码:admin
执行以下步骤,为 PD Server、TiKV Server 和 TiDB Server 分别导入 Grafana 面板:
4. 选择文件注意:
TiKV、PD 和 TiDB 面板对应的 JSON 文件分别为
tikv_summary.json
,tikv_details.json
,tikv_trouble_shooting.json
,pd.json
,tidb.json
,tidb_summary.json
。Grafana版本不一样,操作界面也不一样。
5. 点击 Import,Prometheus 面板即导入成功。
在顶部菜单中,点击 New dashboard,选择要查看的面板。
可查看以下集群组件信息:
TiDB Server:
PD Server:
TiKV Server: