percona-toolkit工具检查MySQL复制一致性及修复

percona-toolkit是一组高级命令行工具的集合,用来执行各种通过手工执行非常复杂和麻烦

mysql和系统任务,这些任务包括:

1、检查masterslave数据的一致性

2、有效地对记录进行归档

3、查找重复的索引

4、对服务器信息进行汇总

5、分析来自日志和tcpdump的查询

6、当系统出问题的时候收集重要的系统信息


   percona-toolkit源自Maatkit Aspersa工具,这两个工具是管理mysql的最有名的工具,现在Maatkit工具已经不维护了,请大家还是使用percona-toolkit吧!这些工具主要包括开发、性能、配置、监控、复制、系统、实用六大类,如果能掌握并加以灵活应用,将能极大的提

高工作效率。


一、 pt-table-checksum检查主从库数据的一致性

pt-table-checksumMASTER上校验指定库、表,将结果存在一个库表里,复制进程将检验sql传递到slave上再执行一次。通过比较M/S的检验值确定数据是否一致。利用主从复制做检验,不需要在检验期间对主从数据库同时锁表,可以控制校验的数据和速度,不影响到正常服务。

安装:

#依赖包

yum �Cy perl-DBI perl-DBD-MySQL perl-TermReadKey

#percona-toolkit

wget http://www.percona.com/downloads/percona-toolkit/LATEST/percona-toolkit-2.2.5.tar.gz

tar xzvfpercona-toolkit-2.2.5.tar.gz  

cdpercona-toolkit-2.2.5

perl Makefile.pl&& make && makeinstall

使用方法:

pt-table-checksum [OPTIONS] [DSN]

pt-table-checksum:在主<M>上通过执行校验的查询对复制的一致性进行检查,对比主从的校验值,从而产生结果。DSN指向的是主的地址,该工具的退出状态不为零,如果发现有任何差别,或者如果出现任何警告或错误,更多信息请见官网。

不指定任何参数,会直接对本地的所有数据库的表进行检查。

pt-table-checksum -S /tmp/mysql.socku=root,p=xxxxxx


注意:

1根据测试,需要一个既能登录主库,也能登录从库,而且还能同步数据库的账号;

2只能指定一个host,必须为主库的IP

3在检查时会向表加S锁;

4运行之前需要从库的同步IOSQL进程是YES状态。

可以用该语句授权用户,这里为了方便直接用root用户

GRANT SELECT,PROCESS, SUPER, REPLICATION SLAVE ON *.* TO ‘checksums’@’x.x.x.x’ IDENTIFIED BY‘xxxx’;


执行检测(MASTER上):

[[root@orcl ~]# pt-table-checksum--nocheck-replication-filters --replicate=jack.checksum --databases=jackh=18.8.0.12,u=root,p=xxxxxx,P=3306 --empty-replicate-table--create-replicate-table --no-check-binlog-format

           TS ERRORS  DIFFS    ROWS  CHUNKS SKIPPED    TIME TABLE

11-11T14:03:17      0     1        6       1      0   0.484 jack.test

参数说明:

TS :完成检查的时间。

ERRORS :检查时候发生错误和警告的数量。

DIFFS 0表示一致,1表示不一致。当指定--no-replicate-check时,会一直为0,当指定--replicate-check-only会显示不同的信息。

ROWS :表的行数。

CHUNKS :被划分到表中的块的数目。

SKIPPED :由于错误或警告或过大,则跳过块的数目。

TIME :执行的时间。

TABLE :被检查的表名。


参数意义:

--nocheck-replication-filters :不检查复制过滤器,建议启用。后面可以用--databases来指定需要检查的数据库。

--no-check-binlog-format : 不检查复制的binlog模式,要是binlog模式是ROW,则会报错。

--replicate-check-only :只显示不同步的信息。

--replicate= :把checksum的信息写入到指定表中,建议直接写到被检查的数据库当中。

--databases= :指定需要被检查的数据库,多个则用逗号隔开。

--tables= :指定需要被检查的表,多个用逗号隔开

h=18.8.0.12 Master的地址

u=root :用户名

p=xxxxxx :密码

P=3306 :端口

更多的参数请见官网,上面指出来的是常用的,对该场景够用的参数。


通过DIFFS1可以看出主从的表数据不一致。通过查看从库上的test.checksum表可以看到主从库的检验信息。

mysql> select * from checksum\G;

*************************** 1. row***************************

           db: jack

          tbl: test

        chunk: 1

  chunk_time: 0.001853

 chunk_index: NULL

lower_boundary: NULL

upper_boundary: NULL

    this_crc: 54f1685  #从的校验值

    this_cnt: 6       #从的行数

  master_crc: 54f1685     #主的校验值

   master_cnt: 6         #主的行数

           ts: 2013-11-11 13:47:00

1 row in set (0.00 sec)

通过上面的 this_crc <> master_crc 更能清楚的看出他们的不一致了,通过chunk知道是这个张表的哪个块上的记录出现不一致。要是主的binlog模式是Row 则会报错:

Replica db2 has binlog_format ROWwhich could cause pt-table-checksum to break replication.

Please read "Replicas usingrow-based replication" in the LIMITATIONS section of the tool'sdocumentation.

If you understand the risks, specify--no-check-binlog-format to disable this check.


从错误信息得出,要是不改binlog模式的话,则在执行上面的命令时候要指定:--no-check-binlog-format,即:

pt-table-checksum  --nocheck-replication-filters--no-check-binlog-format --replicate-check-only --replicate=test.checksum--databases=jack --tables=test  h=18.8.0.12,u=root,p=xxxxxx,P=3306


指定--replicate-check-only参数会在前一次pt-table-checksum检验的数据之上比较(不会再执行计算),显示出数据不一致的SLAVE主机名:

[root@orcl ~]#pt-table-checksum --nocheck-replication-filters --no-check-binlog-format--replicate-check-only --replicate=jack.checksum --databases=jack--tables=test  h=18.8.0.12,u=root,p=xxxxxx,P=3306

[root@orcl ~]# pt-table-checksum--nocheck-replication-filters --replicate=jack.checksum --databases=jackh=18.8.0.12,u=root,p=xxxxxx --empty-replicate-table --create-replicate-table--replicate-check-only --no-check-binlog-format

Differences on ogg2

TABLE CHUNK CNT_DIFF CRC_DIFF CHUNK_INDEXLOWER_BOUNDARY UPPER_BOUNDARY

jack.test 1 -1 1  

数据不一致的SLAVE和表都找出来了,下面就用pt-table-sync来修补数据。


二、 pt-table-sync修复从库不一致的数据

使用方法:

pt-table-sync [OPTIONS] DSN [DSN]

pt-table-sync: 高效的同步MySQL表之间的数据,他可以做单向和双向同步的表数据。他可以同步单个表,也可以同步整个库。它不同步表结构、索引、或任何其他模式对象。所以在修复一致性之前需要保证他们表存在。

继续上面的复制环境,主和从的test表数据不一致,需要修复,

执行:

[root@orcl ~]# pt-table-sync --print--replicate=jack.checksum h=18.8.0.12,u=root,p=xxxxxx,P=3306h=18.8.5.146,u=root,p=xxxxxx,P=3306

REPLACE INTO `jack`.`test`(`name`)VALUES ('testF') /*percona-toolkit src_db:jack src_tbl:testsrc_dsn:P=3306,h=18.8.0.12,p=...,u=root dst_db:jack dst_tbl:testdst_dsn:P=3306,h=18.8.5.146,p=...,u=root lock:1 transaction:1changing_src:jack.checksum replicate:jack.checksum bidirectional:0 pid:60971user:root host:orcl*/;

参数的意义:

--replicate= :指定通过pt-table-checksum得到的表,这2个工具差不多都会一直用。

--databases= : 指定执行同步的数据库,多个用逗号隔开。

--tables= :指定执行同步的表,多个用逗号隔开。

--sync-to-master :指定一个DSN,即从的IP,他会通过show processlistshow slavestatus 去自动的找主。

h=127.0.0.1 :服务器地址,命令里有2ip,第一次出现的是M的地址,第2次是Slave的地址。

u=root :帐号。

p=xxxxxx :密码。

--print :打印,但不执行命令。

--execute :执行命令。

更多的参数请见官网,上面指出来的是常用的,对该场景够用的参数。

和上面的命令一样效果的命令:

[root@orcl ~]#pt-table-sync --print --sync-to-master h=18.8.5.146,u=root,p=xxxxxx,P=3306--databases jack --tables test

#用一个IP SLAVE)就可以了。

REPLACE INTO`jack`.`test`(`name`) VALUES ('testF') /*percona-toolkit src_db:jacksrc_tbl:test src_dsn:P=3306,h=18.8.0.12,p=...,u=root dst_db:jack dst_tbl:testdst_dsn:P=3306,h=18.8.5.146,p=...,u=root lock:1 transaction:1 changing_src:1replicate:0 bidirectional:0 pid:60981 user:root host:orcl*/;

还可以让它自己执行修复数据的SQL语句,但是这样就没有输出了:

[root@orcl ~]#  pt-table-sync --execute --sync-to-masterh=18.8.5.146,u=root,p=xxxxxxx,P=3306 --databases jack --tables test

数据已经修复完成了:

mysql> select * from test;

+-------+

| name |

+-------+

| testA |

| testB |

| testC |

| testD |

| testE |

| testF |

+-------+

6 rows in set (0.00 sec)

建议还是用--print 打印出来的好,这样就可以知道那些数据有问题,可以人为的干预下。不然直接执行了,出现问题之后更不好处理。总之还是在处理之前做好数据的备份工作。

注意:要是表中没有唯一索引或则主键则会报错:

Can't make changes on the masterbecause no unique index exists at /usr/local/bin/pt-table-sync line 10591。


补充:

要是从库有的数据,而主库没有,那这个数据怎么处理?会给出删除SLAVE多余数据,和修复SLAVE缺失数据的SQL语句。

如果在shell窗口不想显示输入密码则可以添加:--ask-pass 参数,如:

[root@orcl~]#  pt-table-sync --print --ask-pass--sync-to-master h=18.8.5.146,u=root,P=3306 --databases jack --tables test

Enter passwordfor 18.8.5.146:

DELETE FROM`jack`.`test` WHERE `name`='testG' LIMIT 1 /*percona-toolkit src_db:jacksrc_tbl:test src_dsn:P=3306,h=18.8.0.12,p=...,u=root dst_db:jack dst_tbl:testdst_dsn:P=3306,h=18.8.5.146,p=...,u=root lock:1 transaction:1 changing_src:1replicate:0 bidirectional:0 pid:60993 user:root host:orcl*/;

如果使用--ask-pass,报错:

Cannot read response; isTerm::ReadKey installed? Can't locate Term/ReadKey.pm in @INC

安装Term/ReadKey.pm模块:

[root@host125~]# perl -MCPAN -e "shell"

cpan[1]> install Term::ReadKey


总结:

该工具执行检查表动作,检查连接的帐号需要有很高的权限,在一般权限上需要加SELECT, PROCESS,SUPER, REPLICATION SLAVE等权限。pt-table-checksum 配合pt-table-sync使用,在执行pt-table-sync数据同步之前,一定要执行pt-table-checksum命令检查。



参考地址:http://blog.csdn.net/wulantian/article/details/12062005

http://blog.csdn.net/huwenb/article/details/11898015

http://blog.chinaunix.net/uid-20639775-id-3236916.html

你可能感兴趣的:(mysql,percona-toolkit)