Hive元数据存储和表数据存储

一、相关概念

1、元数据(metadata)

元数据(Meta Date),主要记录数据仓库中模型的定义、各层级间的映射关系、监控数据仓库的数据状态及 ETL 的任务运行状态。一般会通过元数据资料库(Metadata Repository)来统一地存储和管理元数据,其主要目的是使数据仓库的设计、部署、操作和管理能达成协同和一致。

元数据包括表的属性、表的名称、表的列、分区及其属性以及表数据所在的目录等。

2、Metastore作用

客户端连接metastore服务,metastore再去连接MySQL数据库来存取元数据。有了metastore服务,就可以有多个客户端同时连接,而且这些客户端不需要知道MySQL数据库的用户名和密码,只需要连接metastore 服务即可。

3、hive表

hive表包含内部表和外部表。

二、元数据存储

1、元数据的存储方式

元数据的存储主要有两种方式:第一种是使用hive自带的derby数据库进行元数据的存储;第二种是使用mysql数据库来进行hive元数据的存储;

2、两种方式存储区别

(1)内置derby存储

缺点 :不同路径启动 hive,每一个 hive 拥有一套自己的元数据,无法共享
理解 :在哪个目录下启动,就会在对应的目录下生成 derby.log 和 metastore.db,只有在此目录下再次启动才可以继续使用上次的元数据库。
这个是默认的,配置简单,但是一次只能一个客户端连接,适用于用来实验,不适用于生产环境。

(2)mysql存储

a、本地模式(Local):本地安装mysql 替代derby存储元数据

不再使用内嵌的Derby作为元数据的存储介质,而是使用其他数据库比如MySQL来存储元数据。hive服务和metastore服务运行在同一个进程中,mysql是单独的进程,可以同一台机器,也可以在远程机器上。
这种方式是一个多用户的模式,运行多个用户client连接到一个数据库中。这种方式一般作为公司内部同时使用Hive。每一个用户必须要有对MySQL的访问权利,即每一个客户端使用者需要知道MySQL的用户名和密码才行。






  hive.metastore.warehouse.dir
  /user/hive_remote/warehouse



  hive.metastore.local
  true



  javax.jdo.option.ConnectionURL
  jdbc:mysql://localhost/hive_remote?createDatabaseIfNotExist=true



  javax.jdo.option.ConnectionDriverName
  com.mysql.jdbc.Driver



  javax.jdo.option.ConnectionUserName
  hive



  javax.jdo.option.ConnectionPassword
  password


b、远程模式(Remote): 远程安装mysql 替代derby存储元数据

Hive服务和metastore在不同的进程内,可能是不同的机器,该模式需要将hive.metastore.local设置为false,将hive.metastore.uris设置为metastore服务器URL;
远程元存储需要单独起metastore服务,然后每个客户端都在配置文件里配置连接到该metastore服务。将metadata作为一个单独的服务进行启动。各种客户端通过beeline来连接,连接之前无需知道数据库的密码;
仅连接远程的mysql并不能称之为“远程模式”,是否远程指的是metastore和hive服务是否在同一进程内;
 







  hive.metastore.warehouse.dir
  /user/hive/warehouse



  javax.jdo.option.ConnectionURL
  jdbc:mysql://master:3306/hive_remote?createDatabaseIfNotExist=true



  javax.jdo.option.ConnectionDriverName
  com.mysql.jdbc.Driver



  javax.jdo.option.ConnectionUserName
  hive



  javax.jdo.option.ConnectionPassword
  password



  hive.metastore.local
  false



  hive.metastore.uris
  thrift://master:9083



三、表数据存储

1、内部表数据由Hive自身管理,外部表数据由HDFS管理;
2、内部表数据存储的位置是hive.metastore.warehouse.dir(默认:/user/hive/warehouse);
3、外部表数据的存储位置由自己制定(如果没有LOCATION,Hive将在HDFS上的/user/hive/warehouse文件夹下以外部表的表名创建一个文件夹,并将属于这个表的数据存放在这里);
4、未被external修饰的是内部表(managed table),被external修饰的为外部表(external table);
5、删除内部表会直接删除元数据(metadata)及存储数据;删除外部表仅仅会删除元数据,HDFS上的文件并不会被删除;
6、对内部表的修改会将修改直接同步给元数据,而对外部表的表结构和分区进行修改,则需要修复(MSCK REPAIR TABLE table_name;)

参考博客:

https://blog.csdn.net/qq_40990732/article/details/80914873

https://blog.csdn.net/hyj_king/article/details/104947999

你可能感兴趣的:(Hive)