图数据库NebulaGraph

如何设计一个高性能的图 Schema

本文整理自青藤云安全工程师——文洲在青藤云技术团队内部分享，分享视频参考：https://www.bilibili.com/video/BV1r64y1R72i

图数据库的性能和 schema 的设计息息相关，但是 NebulaGraph 官方本身对图 schema 的设计其实没有一个定论，唯一的共识就是是面向性能去做 schema 设计。
而 Neo4j 在它的书籍上则阐述希望用户能够尊重本身业务领域实体的关系进行设计，这次的分享主要是为了解答下面这些问题：

什么时候用图数据库，什么时候用图计算
什么时候建实体，什么时候建关系
什么时候建实体，什么时候添加属性
什么时候属性加索引
什么时候属性加到图
图数据库最佳实践

希望能从原理上能够解释一下，如果当中有任何不妥当的地方欢迎一起交流。

背景知识

先来讲解下存储背景，再讲 Schema 设计中会遇到的问题，最后讲下实践过程中我们能达成一致的最佳实践。

在使用图数据库之前，先了解下图数据库这个 NoSQL 数据库同关系型数据库不一样的地方。

关系型数据库存储结构

以上图为例，存一个 ID 作为一个主键，然后它有个特征 k，我们对 k 创建索引进行查询，对于左下角这份列表数据，内存中存储的话，会以一个 B+ 树进行存储（上图右侧）：一个主索引 ID 和一个从索引 k。举个例子，现在我们要查询 k=3 的数据，它就先查询 ID=100 然后经过回表后回到具体的值。

这体现了关系型数据库的一个特点，如果你要查询速度快，那就需要创建一个索引。假如你不创建索引，那数据库就会扫全表。

我们再来看下写过程。数据一般先写到内存 Mem（这是一个常规的优化减小磁盘压力），写到一定程度再同步到磁盘中，这个过程我们叫原位刷盘，刷盘就是说找到这个地方的数据，然后修改掉数据，即原位修改。

如果你之前熟悉 MySQL 或者是其他关系型数据库，这套原理应该是比较熟悉的。

而相对应的，用传统的数据库来实现图功能的话，代价比较大，下图便展示了它的实现弊端：

现在有个场景，现在我们有某个人（上图 Person 表），我们要找朋友的朋友（上图的 PersonFriend 表），在关系型数据库中便是两级索引，先查 Person 表索引找到 Person ID，再查 PersonFriend 表通过 ID 找到对应的人，就是一个 JOIN 查询过程。如果这里使用的是 B+ 树，那么程序复杂度便是 O(logn)；如果是这里的多级大小表，在笛卡尔积上即 O(n*m)，都加索引有一定程度优化，但查询这种多级关系的话，到了一定程度会遇到系统“爆炸”，无法进行相关查询。

LSM 存储模型

本文主题是图的高性能设计，主要基于 NebulaGraph 来讲解。这里部分存储细节同 Neo4j 会略有不同。

NebulaGraph 存储模型采用了 LSM 存储模型，同上面我们讲的原位修改不同，LSM 模型是先写内存，写到一定程度之后再写入到对应磁盘中，每次都是增量顺序写。LSM 模型是一个多级模型，第一层是 L0，第二层是 L1，一般默认是 7 层。

这里引用网图来讲解下 LSM 层级结构：

上图的 L0 层其实有重复数据，像上图的 1-68 的 key 在 L0 层的 2-37，以及 23-48，其实这两部数据是存在重叠的；但L1 层的数据就不存在重叠情况了，1-12、15~25…要最大地发挥图性能的话，先得了解它的写入过程。LSM 模型的写是顺序写，即不会进行上文说到的原位修改。不管是写入新数据还是更新原来数据，永远是在后面插入新的数据（参考上图右侧深蓝色数据）。这样设计的好处在于，写入数据就不需要找之前的数据，一旦涉及查找数据就会慢，这样设计提升了写速度。

但这也会带来一个问题：我们写入重复的数据，或是写入的数据越来越多，查询会不会受影响呢？我们来看看 LSM 是如何查数据的。LSM 进行数据查询时，先查内存，内存里没有数据再查不可变区域（Immutable Memtable），没有的话，再往下一级级地查（参考上图左侧部分）。所以，重复的数据越多，或者磁盘数据越多，便会越慢。

所以为了保证写入和查询性能，无论我们设计属性还是其他 schema，都要控制写入量，也就是 LSM 的写入不能是无限制追加，它有一个定时的合并操作，定期地将重复数据进行合并，叫做 Compaction。

Compaction 过程也需要控制。合并数据能减小数据量，但同时 Compaction 会带来磁盘压力，磁盘压力过大，读操作速度也会变慢。综合来看，Compaction 是一个写入平衡的过程。

NebulaGraph 存储结构和索引

下面再来了解下 NebulaGraph 本身的存储结构和索引。

NebulaGraph 本身是分布式数据库，因为便于理解这里剔除了相关的分布式结构。简单来了解下 NebulaGraph 的结构，上面提到过的 LSM 其实是 kv（key value）存储，所以我们图里存储点、边、索引在磁盘上都是 kv 结构。我们可以看到上图左侧（紫色部分）有个 vid 带着出边（out）和入边（in）以及相关属性。再看下上图右侧部分（紫色部分），可以看到一条边的两个点是存储在一起的，对应的点属性序列化保存。相当于说，kv 结构中的 key 便是我们的点的 vid，然后 value 便是属性的序列化结构。因为是序列化的结构，所以你的属性名是什么便会存成什么，比如这里原始数据 name 字段，它改命名为 family_name，实际存储就是序列化后的 family_name，也就是属性名越长，存储量越大。除了属性名之外，其实属性值也会导致存储量增大。举个例子，现在有个人（点），他的生平介绍要不要放在属性里进行存储？答案是：不应该。因为你的生平介绍会很长，这就会导致 LSM 的存储压力会很大。无论是 Compaction 还是读写，都会有很大的压力。类似比如存储进程实体，对应的进程描述文本也较大，会带来较大存储压力。

再来说下我们的边，NebulaGraph 中出边和入边保存在一个 kv 结构中（参考上图右侧橙色部分）。NebulaGraph 中有个词叫做前缀扫描，具体来说便是现在要查找某个 vid 对应的边，它是如何查找的呢？先按照 vid 来前缀扫描，在内存中这个过程是个二分查找，所以 NebulaGraph 查询快就是在这里。在 Neo4j 里面这种叫做“免索引邻接”。像上面的朋友的朋友的场景，传统数据库是通过索引进行查找的，而在这里直接扫描找寻某个人便可。在物理存储这块，点（人和相关的人）都是存储在一起的，找到了某个人便找到了他的朋友。查询上速度非常快，这也是原生图数据库带来的好处。

除了上面的存储结构，索引也是高性能 schema 设计的一个作用因素。像上图的右侧部分，上面的紫色部分存储着点，这里有 2 个点：第一个点是 vid1，name 是 wen，age 是 20；另外一个是 vid2，name 是 wei，age 是 20。这里我们创建了 2 个索引，一个是针对 name，一个是针对 age。这两个索引的存储结构参考上图右侧下方的白色部分，查找 name 为 wen 的数据时，按照上面我们科普过的会进行二分查找，扫描到对应的 name 索引的 wen 数据，然后再从索引数据中找到对应的点（vid1）数据，再借助 vid 数据来找寻它的相关信息。这里 vid 找关联数据的原理同上面的存储结构描述。

小结

小结下 NebulaGraph 存储结构和索引，在这里关系是一等公民，索引辅助查询（并非用来提速），重要的是抽象关系。

Schema 设计

进入本文的重点——Schema 的设计，Schema 设计的三大基本原则：

尊重领域实体关系
以性能为目标
考虑可视化分析

而三者并不冲突，上面三点其中某一点做得很好，另外两点也会做的不错。

Talking is cheap，下面我们来结合具体的例子来了解下三大原则。这些 case 图主要引用自 Neo4j，但是对于 NebulaGraph 相关的 schema 设计也有参考意义。

实体和关系的选择

上图是 Neo4j 图数据库书籍中的示例图。简单描述下这个场景，Bob 和 Charlie 等人在发邮件。那你设计这么一个场景的 Schema 是否很自然就会将发邮件变成关系边？因为 Bob 同 Charlie 发邮件，不是很明显就是发邮件关系吗？那我们来回顾下上面说的三大原则第一点：尊重领域实体关系。Bob 和 Charlie 建立联系自然不是通过发邮件这个行为，而是通过邮件本身来建立联系，所以这里便缺少了一个实体。在考虑可视化分析原则这边，你要分析实体之间的关系，你思考它们是通过什么来建立的联系。这时候就会发生之前提到过的发邮件设置为边的情况（把邮件放置在边上），单看 Bobo 的话（左图），我们可以清楚地看到发邮件这个动作。左图上面部分，Bobo Emailed Charlie。但如果这时候，要查看这个邮件抄送给了谁，还有这封邮件有哪些相关人，像左图的 schema 就不能很好地进行查询。因为缺少了 Email 这个实体。而上图右侧部分便能可以方便地找寻相关信息。

下面再来讲下如何进行实体和属性选择。

实体和属性选择

在这个部分，我将结合青藤云的情况来讲一个我们的 case——进程之间的父子关系。

如上图左侧所示，md5 为 1 的 pid 100 进程起了一个 pid 102 的子进程，这个子进程的 md5 是 2。同时，md5 也为 1 的 pid 101 也起了进程，pid 为 103、md5 为 3。按照我们之前的实现方法，是在 md5 上创建索引，继而建立起跟 pid 102、pid 103 的联系。但这种做法，上面讲过性能并不高，免索引复杂是 O(1)，而这种做法的复杂度是 O(logn)。所以说，我们这时候应该基于 ProcessFile 进程文件 md5 来建立关系（进程间是基于 md5 联系起来的）：我们先抽取 md5 建立一个名叫 ProcessFile 的实体，属性是 md5。如果我们要查询指定进程所关联的进程，很直观地去找寻和这个 ProcessFile 关联的进程就可以分析出来我们要的结果。举个例子，pid 102 的进程是一个木马，我想找寻是哪个父进程释放的它，或者是同它父进程同 md5 文件的进程，该怎么找？

上图的展示了两种形式，第一种（左侧）的话就需要找索引；第二种（右侧）通过 CREATE_PROCESS 就可以直接找到 pid 102 的父进程 pid 100，再通过 PFILE_OF 关系你可以找到它同 md 文件的进程 pid 101。

好的，简单结合 Schema 设计三大原则来回顾下这个 case：

属性上创建索引会影响写入，此外属性放在 ProcessFile 还是放在 Process 中，存储性能是不一样的。这里主要涉及到写入量，因为 Process 进程是一直可以不停地启动，但是 md5 文件可能本身并不多。如果是放在 Process 中，进程起得越多，数据写入量也就会越大，进而查询压力也会增大查询变慢。
可视化探索这块主要和不定需求有关。因为一开始我们设计 schema 的时候可能并没有全方位考量，或者说像是一些安全、防作弊规则并未拟定，不知道它会是什么样。而这时你要根据这种不确定来设计 Schema，就需要将图“释放”给相关业务人员，让他在图里点击，设计他的关系，所以相对应的我们就不能通过索引来实现这种需求，因为业务人员可能没有相关的技术背景。

添加属性

上图左边描述文字截自 v2.0 的官方文档：https://docs.nebula-graph.com.cn/2.0/3.ngql-guide/1.nGQL-overview/2.graph-modeling/#_3。

在合理设置边属性的第二部分提到，“为边创建属性时请勿使用长字符串”。这个和我们之前提到过的，属性名和属性值都应该短，不应该长是一个意思。像上图右侧部分，很明显可以看到 vid 重复写多次的话，每次写就是重复的流量和存储，这会大大增大内存占用和磁盘容量。如果我们把 session_guid 变成 sid 会节约很多存储。而后面的描述信息，也有两种处理方式。第一种，直接删除描述；第二种，将过长的描述存储在外部，比如放置在 Elasticsearch，然后将 ES 存储这块内容的 eid 存储在上图的 value 中。这样也可以大大减少存储量，提升写入 / 查询性能。

除了这点之外，我们还要注意合理设置分组标签。青藤云暂时没遇到类似 case，所以这里讲下这句话什么意思。简单来说，就是写入这边需要做一个 tag 的区分，结合上文提到的二分查找，你就比较好理解了。举个简单例子，这里有个人，他的公司相关信息，或者年龄相关的信息，或者是个人喜好之类的信息用相关的 tag 区分开，这样查询时可以更快地找到对应的信息。

最后回到文档「合理设置边属性」中第一部分中的“深度图遍历的性能较低，为了减少遍历深度，请使用点属性代替边。例如，模型 a 包括姓名、年龄、眼睛颜色三种属性，建议您创建一个标签 person，然后为它添加姓名、年龄、眼睛颜色的属性。”，按照官方的举的例子，固然是这样的。但实际应用中，并非一定要遵循这一原则——属性用点属性而不是用边，该用实体的时候还是得用实体。所以我这里下面备注写了：描述实体本身特性。像实体本身的特性 age / status，边的 time / count 这些属性会变成相对应的属性，这样能更好地描述本质特性，也能起到比较好的辅助效果。

添加索引

借助之前我们的实践经验，来讲下索引这块内容。在 NebulaGraph 的官方文档中提及了：尽量少用索引。那么问题来了，到底什么时候应该用索引呢？我们先从原理上来解释下索引。在上图的例子中，value 中存储了 2 样东西：一个是 status，状态；另外一个是 ip。右侧的表格是对应的 kv 存储结构，key 是个点结构。给点加索引之后，它便会变成左侧表格的结构，idx-x-vid1。如果我们要查询 status 等于 0 的这列值的时候，由于加了索引之后数据结构是以 0（status）为前缀，vid 放在 0 后面；如果我们要查询 ip 的话，存储结构则将 ip 变成前缀，vid 存储在后面。这样会产生何种问题呢？status 如果只有 1 和 0，现在你有 1 万亿的点，这样添加索引是没有意义的。而且，因为 NebulaGraph 的查找是二分查找，复杂度收敛到 O(n)，相当于有多少数据就查多少数据。即便你添加了一个 limit，但是在 NebulaGraph 这边（注：本次分享时，NebulaGraph 的最新版本为 v2.0.1）limit 并没有下推，所以所有数据会先捞上来到计算层，在内存中使用 limit 进行数据过滤。

正是由于这种情况，所以在 v2.5 之前的 NebulaGraph 用户会经常在论坛反馈 OOM 问题，其实就是内存爆炸。

所以说，索引应该是尽可能和业务相关的标识。

细粒度关系和通用关系

通过上面的 Neo4j 这个 case 我们来讲解下颗粒度问题。

像上面的人有 2 个地址，一个是收件地址，另外一个是付款地址。如果此时，我们想找寻这个人的地址，如果没有 ADDRESS 这个通用标签的话，DELIVERY_ADDRESS 和 BILLING_ADDRESS 这两个关系都得查下。这时候如果用的是二分查找，如果这堆关系本身存储在一起还好，可以一次性查找出来；但，如果关系不在一起，就需要分 2 次查询，这会降低它的查询速率。

因此，我们可以再创建一个通用标签，但是要注意的是，标签的建立是基于对某个业务有强需求。像上面的例子，需要知道用户的所有地址，也要知道他的单独地址，比如：收件地址。这种情况下，建立一个通用标签才是一个加速的方法，但注意要谨慎使用。同样的，通用标签设计时，也需要考虑可视化的情况。

加速查询

之前我们讲过一个发邮件的例子，但是现在场景有所变化了，我现在不关心发邮件这个事情，我只关心人和人之间的关系，比如，wen 这个人的联系关系，有谁和他联系过，而这个联系方式可能是 Email，也可能是手机（Phone），或者是微信。这时候我应该如何设计 schema 呢？当然之前的设计是可以沿用的，但为了加速查询，满足业务上的需求。这里加了 CONTACT 属性，用来加速查找。

小结 Schema 设计

讲到这里，我们总结下上面的例子，其实我们的例子都是围绕着三大原则来展开的，即：性能、可视化、领域关系。

典型 Schema 设计

下面来我们来讲下有些典型场景下的 Schema 设计。

时间设计

现在有个场景，有一堆发生过的事件，现在想查询在某个月，或者是某个时间段内，发生了哪些事件，我们该如何设计 Schema 呢？也许我们可以在时间属性上创建个索引，把这个时间当作索引来存储，但这样的话，查询速度不会很快，尤其是数据量较大的情况下。那我们应该怎么做呢？Neo4j 给了一种设计思路叫做时间树，就是说时间本身是有层级关系的。如上图所示，时间有个层级，想要查询某个事件同时间段内的其他事件，可以通过这个层级快速找到。

上图右侧则是一个时序关系，可以快速找寻某事件发生的时间前后有哪些事情发生，而在 NebulaGraph 中，你可以通过 rank 来实现时序图功能。

上面的例子只是给大家一个参考，并不代表会应用在青藤云实际业务中。

地址设计

上面这个是地址的设计，可能大家都会遇到。假如，现在我们要查询北京朝阳太阳宫在发生事件 A 时，同一个地理位置有多少用户 / IP 在这。传统的设计方法中，添加属性是无法满足该业务需求的。那怎么实现呢？其实这些地址划分可以作为实体，而且地址之间是有关系的。以上述的物流为例，上面的例子：中国-北京-朝阳-太阳宫，就可以通过集散中心-派送点-派送区域-派送段形式进行查询。如果你要查询同一个街道或者是同个市，也可以按照这个关系快速进行查询。

像我们遇到的地址位置，或者是网络层问题，都可以参考这种设计。之前在 BOSS 直聘（分享嘉宾曾就职 BOSS 直聘）中，我们就是参考了类似的实现来找寻某个区域的相关用户。

图最佳实践

上面讲述的内容主要是围绕 Schema 设计，下面这块当作补充资料，主要讲的是图的最佳实践。

命名规范

如果你要编写一个比较长的语句，不知道你有没有注意过，这个语句该如何快速区分哪些是实体，哪些是关系，哪些又是属性。所以，这里就要提一下命名规范问题。一旦命名规范了，一条长查询语句也可能快速辨别实体、关系、属性。

你可以参考下面的命名规范：

实体采用驼峰方式，例如：User、Email、Process；
关系采用全部大写，包含动词和副词，例如：HAS_IP；
属性采用英文小写简写，例如：title、sid、pid

图计算

上图给出了图数据库和图计算的工作流，可以直观地查看到二者的区别。图数据库的工作流相对简单，拿我们常见的一个场景举例，已知某个有问题的进程 A，要溯源找寻它的源头。对应到图这边，图数据库的查询一般会 GO / LOOKUP / MATCH / FETCH 锚定某个起始点，比如这里的进程 A，然后管道 / WITCH 进行下一步的处理，最后用 RETURN / YIELD 来返回基本结构。但，注意，这个基本结构会进行二次加工。刚设计 Schema 的时候提到过，并不是所有的属性都会设计进去，只有和业务相关的核心属性才会设计进入。像请求接口之类的操作，都会在下一步过滤 / 扩展处理时完成。

上面说的是图的直接业务简单查询，但还有一种场景是用图来进行机器学习，比如 GNN 和 GCN 用图来做 feature / 特征，这块本文就不展开讲述，流程和上面有所不同。

那，什么时候用图数据库，什么时候用图计算呢？

如上图所示，有限点的拓展就比较适合用图数据库，或者说 NebulaGraph 来实现；而全局挖掘就比较适合用图计算。从图计算的流程上来看，简单粗暴地讲，图计算就是把一批数据捞到内存中，一次性计算完，然后“吐”出来，再进行下一步的过滤和处理。至于它是如何计算的，图计算里面配有计算引擎。

现在我们来问个问题，如果要找全图点度 Top10 的点，应该用什么？

自然是图计算，图计算也就是 OLAP 主打的是吞吐，即一次性能处理多少数据；而图数据库，主要是应对 OLTP 场景，侧重低延迟，就是查询有多快，以及支持多大量的并发请求 QPS。

只要我们记住图数据库和图计算各自的擅长场景，就比较好处理相关的业务。

大图优化

像传统关系型数据库中，业务无限膨胀的话，就需要做分库分表。图也是类似的，在大图上做某些查询时，你会发现性能很差，这时候你就需要进行分图处理。像上面说到过的关系细化和加速查询，比如我现在只关心进程关系，在特定业务场景下就需要将进程关系单独设计成一张图。这就是图的一个优化手段。或者，你也可以进行业务隔离。像现在的业务是针对推荐场景，剩下的安全场景是否要放置在同一个图空间下呢？如果业务量不大的情况下，是可以的。但是如果是数据量大的话，还是需要同传统数据库一样进行业务隔离，什么业务进入什么图。

这里延伸一下，分图场景下如何进行多图查询呢？简单来说就是进程一张图，网络是一张图，这时候要查询进程和网络的关系。业界的话，管这个叫做查询端融合。虽然你要查询的数据是 2 张图，但是我假装你是在一张图上进行查询。

以上为本文的分享。

延伸阅读

下面收录了本文相关的阅读资料：

MySQL 《高性能 MySQL》
LSM 论文：http://citeseerx.ist.psu.edu/viewdoc/download?doi=10.1.1.44.2782&rep=rep1&type=pdf
LSM 调优：https://zhuanlan.zhihu.com/p/351241814

谢谢你读完本文 (///▽///)

如果你想尝鲜图数据库 NebulaGraph，体验云上图数据库一键服务你的业务 ->☆白嫖 NebulaGraph 云服务；NebulaGraph 也是一款开源的图数据库，上 GitHub 看代码、(^з)-☆ star 它 -> GitHub；和其他的 NebulaGraph 用户一起交流图数据库技术和应用技能，留下「你的名片」一起玩耍呀~

你可能感兴趣的:(Nebula,Graph,数据库,neo4j)

Google earth studio 简介陟彼高冈yu 旅游
GoogleEarthStudio是一个基于Web的动画工具，专为创作使用GoogleEarth数据的动画和视频而设计。它利用了GoogleEarth强大的三维地图和卫星影像数据库，使用户能够轻松地创建逼真的地球动画、航拍视频和动态地图可视化。网址为https://www.google.com/earth/studio/。GoogleEarthStudio是一个基于Web的动画工具，专为创作使用G
关于提高复杂业务逻辑代码可读性的思考编程经验分享开发经验 java 数据库开发语言
目录前言需求场景常规写法拆分方法领域对象总结前言实际工作中大部分时间都是在写业务逻辑，一般都是三层架构，表示层（Controller）接收客户端请求，并对入参做检验，业务逻辑层（Service）负责处理业务逻辑，一般开发都是在这一层中写具体的业务逻辑。数据访问层（Dao）是直接和数据库交互的，用于查数据给业务逻辑层，或者是将业务逻辑层处理后的数据写入数据库。简单的增删改查接口不用多说，基本上写好一
SQL Server_查询某一数据库中的所有表的内容 qq_42772833 SQL Server 数据库 sqlserver
1.查看所有表的表名要列出CrabFarmDB数据库中的所有表（名），可以使用以下SQL语句：USECrabFarmDB;--切换到目标数据库GOSELECTTABLE_NAMEFROMINFORMATION_SCHEMA.TABLESWHERETABLE_TYPE='BASETABLE';对这段SQL脚本的解释：SELECTTABLE_NAME：这个语句的作用是从查询结果中选择TABLE_NAM
深入理解 MultiQueryRetriever：提升向量数据库检索效果的强大工具 nseejrukjhad 数据库 python
深入理解MultiQueryRetriever：提升向量数据库检索效果的强大工具引言在人工智能和自然语言处理领域，高效准确的信息检索一直是一个关键挑战。传统的基于距离的向量数据库检索方法虽然广泛应用，但仍存在一些局限性。本文将介绍一种创新的解决方案：MultiQueryRetriever，它通过自动生成多个查询视角来增强检索效果，提高结果的相关性和多样性。MultiQueryRetriever的工
MongoDB Oplog 窗口喝醉酒的小白 MongoDB 运维
在MongoDB中，oplog（操作日志）是一个特殊的日志系统，用于记录对数据库的所有写操作。oplog允许副本集成员（通常是从节点）应用主节点上已经执行的操作，从而保持数据的一致性。它是MongoDB副本集实现数据复制的基础。MongoDBOplog窗口oplog窗口是指在MongoDB副本集中，从节点可以用来同步数据的时间范围。这个窗口通常由以下因素决定：Oplog大小：oplog的大小是有限
python os 环境变量 CV矿工 python 开发语言 numpy
环境变量：环境变量是程序和操作系统之间的通信方式。有些字符不宜明文写进代码里，比如数据库密码，个人账户密码，如果写进自己本机的环境变量里，程序用的时候通过os.environ.get（）取出来就行了。os.environ是一个环境变量的字典。环境变量的相关操作importos"""设置/修改环境变量：os.environ[‘环境变量名称’]=‘环境变量值’#其中key和value均为string类
【PG】常见数据库、表属性设置江无羡数据库
PG的常见属性配置方法数据库复制、备份相关表的复制标识单表操作批量表操作链接数据库复制、备份相关表的复制标识单表操作通过ALTER语句单独更改一张表的复制标识。ALTERTABLE[tablename]REPLICAIDENTITYFULL;批量表操作通过代码块的方式，对某个schema中的所有表一起更新其复制标识。SELECTtablename,CASErelreplidentWHEN'd'TH
nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
insert into select 主键自增_mybatis拦截器实现主键自动生成 weixin_39521651 insert into select 主键自增 mybatis delete返回值 mybatis insert返回主键 mybatis insert返回对象 mybatis plus insert返回主键 mybatis plus 插入生成id
前言前阵子和朋友聊天，他说他们项目有个需求，要实现主键自动生成，不想每次新增的时候，都手动设置主键。于是我就问他，那你们数据库表设置主键自动递增不就得了。他的回答是他们项目目前的id都是采用雪花算法来生成，因此为了项目稳定性，不会切换id的生成方式。朋友问我有没有什么实现思路，他们公司的orm框架是mybatis，我就建议他说，不然让你老大把mybatis切换成mybatis-plus。mybat
关于Mysql 中 Row size too large (＞ 8126) 错误的解决和理解秋刀prince mysql mysql 数据库
提示：啰嗦一嘴，数据库的任何操作和验证前，一定要记得先备份！！！不会有错；文章目录问题发现一、问题导致的可能原因1、页大小2、行格式2.1compact格式2.2Redundant格式2.3Dynamic格式2.4Compressed格式3、BLOB和TEXT列二、解决办法1、修改页大小（不推荐）2、修改行格式3、修改数据类型为BLOB和TEXT列4、其他优化方式（可以参考使用）4.1合理设置数据
Java爬虫框架（一）--架构设计狼图腾-狼之传说 java 框架 java 任务 html解析器存储电子商务
一、架构图那里搜网络爬虫框架主要针对电子商务网站进行数据爬取，分析，存储，索引。爬虫：爬虫负责爬取，解析，处理电子商务网站的网页的内容数据库：存储商品信息索引：商品的全文搜索索引Task队列：需要爬取的网页列表Visited表：已经爬取过的网页列表爬虫监控平台：web平台可以启动，停止爬虫，管理爬虫，task队列，visited表。二、爬虫1.流程1)Scheduler启动爬虫器，TaskMast
MongoDB知识概括 GeorgeLin98 持久层 mongodb
MongoDB知识概括MongoDB相关概念单机部署基本常用命令索引-IndexSpirngDataMongoDB集成副本集分片集群安全认证MongoDB相关概念业务应用场景：传统的关系型数据库（如MySQL），在数据操作的“三高”需求以及应对Web2.0的网站需求面前，显得力不从心。解释：“三高”需求：①Highperformance-对数据库高并发读写的需求。②HugeStorage-对海量数
Mongodb Error: queryTxt ETIMEOUT xxxx.wwwdz.mongodb.net 佛一脚 error react mongodb 数据库
背景每天都能遇到奇怪的问题，做个记录，以便有缘人能得到帮助！换了一台电脑开发nextjs程序。需要连接mongodb数据，对数据进行增删改查。上一台电脑好好的程序，新电脑死活连不上mongodb数据库。同一套代码，没任何修改，搞得我怀疑人生了，打开浏览器进入mongodb官网毫无问题，也能进入线上系统查看数据，网络应该是没问题。于是我尝试了一下手机热点，这次代码能正常跑起来，连接数据库了！！！是不
入门MySQL——查询语法练习 K_un
前言：前面几篇文章为大家介绍了DML以及DDL语句的使用方法，本篇文章将主要讲述常用的查询语法。其实MySQL官网给出了多个示例数据库供大家实用查询，下面我们以最常用的员工示例数据库为准，详细介绍各自常用的查询语法。1.员工示例数据库导入官方文档员工示例数据库介绍及下载链接：https://dev.mysql.com/doc/employee/en/employees-installation.h
博客网站制作教程 2401_85194651 java maven
首先就是技术框架：后端：Java+SpringBoot数据库：MySQL前端：Vue.js数据库连接：JPA(JavaPersistenceAPI)1.项目结构blog-app/├──backend/│├──src/main/java/com/example/blogapp/││├──BlogApplication.java││├──config/│││└──DatabaseConfig.java
ubuntu安装wordpress lissettecarlr
1安装nginx网上安装方式很多，这就就直接用apt-get了apt-getinstallnginx不用启动啥，然后直接在浏览器里面输入IP:80就能看到nginx的主页了。如果修改了一些配置可以使用下列命令重启一下systemctlrestartnginx.service2安装mysql输入安装前也可以更新一下软件源，在安装过程中将会让你输入数据库的密码。sudoapt-getinstallmy
深入浅出 -- 系统架构之负载均衡Nginx的性能优化 xiaoli8748_软件开发系统架构系统架构负载均衡 nginx
一、Nginx性能优化到这里文章的篇幅较长了，最后再来聊一下关于Nginx的性能优化，主要就简单说说收益最高的几个优化项，在这块就不再展开叙述了，毕竟影响性能都有多方面原因导致的，比如网络、服务器硬件、操作系统、后端服务、程序自身、数据库服务等，对于性能调优比较感兴趣的可以参考之前《JVM性能调优》中的调优思想。优化一：打开长连接配置通常Nginx作为代理服务，负责分发客户端的请求，那么建议开启H
【RabbitMQ 项目】服务端：数据管理模块之绑定管理月夜星辉雪 rabbitmq 分布式
文章目录一.编写思路二.代码实践一.编写思路定义绑定信息类交换机名称队列名称绑定关键字：交换机的路由交换算法中会用到没有是否持久化的标志，因为绑定是否持久化取决于交换机和队列是否持久化，只有它们都持久化时绑定才需要持久化。绑定就好像一根绳子，两端连接着交换机和队列，当一方不存在，它就没有存在的必要了定义绑定持久化类构造函数：如果数据库文件不存在则创建，打开数据库，创建binding_table插入
计算机毕业设计PHP仓储综合管理系统（源码+程序+VUE+lw+部署） java毕设程序源码王哥 php 课程设计 vue.js
该项目含有源码、文档、程序、数据库、配套开发软件、软件安装教程。欢迎交流项目运行环境配置：phpStudy+Vscode+Mysql5.7+HBuilderX+Navicat11+Vue+Express。项目技术：原生PHP++Vue等等组成，B/S模式+Vscode管理+前后端分离等等。环境需要1.运行环境：最好是小皮phpstudy最新版，我们在这个版本上开发的。其他版本理论上也可以。2.开发
3.增删改查--连接查询问女何所忆
关系型数据库的一个特点就是，多张表之间存在关系，以致于我们可以连接多张表进行查询操作，所以连接查询会是关系型数据库中最常见的操作。连接查询主要分为三种，交叉连接、内连接和外连接，我们一个个说。1、交叉连接交叉连接其实连接查询的第一个阶段，它简单表现为两张表的笛卡尔积形式，具体例子：如果你没学过数学中的笛卡尔积概念，你可以这样简单的理解这里的交叉连接：两张表的交叉连接就是一个连接合并的过程，T1表中
docker from指令的含义_多个FROM-含义 weixin_39722188 docker from指令的含义
小编典典什么是基本图片？一组文件，加上EXPOSE端口ENTRYPOINT和CMD。您可以添加文件并基于该基础图像构建新图像，Dockerfile并以FROM指令开头：后面提到的图像FROM是新图像的“基础图像”。这是否意味着如果我neo4j/neo4j在FROM指令中声明，则在运行映像时，neo数据库将自动运行并且可在端口7474的容器中使用？仅当您不覆盖CMD和时ENTRYPOINT。但是图像
Redis:缓存击穿我的程序快快跑啊缓存 redis java
缓存击穿(热点key)：部分key(被高并发访问且缓存重建业务复杂的)失效,无数请求会直接到数据库，造成巨大压力1.互斥锁：可以保证强一致性线程一：未命中之后，获取互斥锁，再查询数据库重建缓存，写入缓存，释放锁线程二：查询未命中，未获得锁(已由线程一获得)，等待一会，缓存命中互斥锁实现方式：redis中setnxkeyvalue:改变对应key的value,仅当value不存在时执行，以此来实现互
生成式地图制图 Bwywb_3 深度学习机器学习深度学习生成对抗网络
生成式地图制图（GenerativeCartography）是一种利用生成式算法和人工智能技术自动创建地图的技术。它结合了传统的地理信息系统（GIS）技术与现代生成模型（如深度学习、GANs等），能够根据输入的数据自动生成符合需求的地图。这种方法在城市规划、虚拟环境设计、游戏开发等多个领域具有应用前景。主要特点：自动化生成：通过算法和模型，系统能够根据输入的地理或空间数据自动生成地图，而无需人工逐
mysql学习教程，从入门到精通，TOP 和MySQL LIMIT 子句（15）知识分享小能手大数据数据库 MySQL mysql 学习 oracle 数据库开发语言 adb 大数据
1、TOP和MySQLLIMIT子句内容在SQL中，不同的数据库系统对于限制查询结果的数量有不同的实现方式。TOP关键字主要用于SQLServer和Access数据库中，而LIMIT子句则主要用于MySQL、PostgreSQL（通过LIMIT/OFFSET语法）、SQLite等数据库中。下面将分别详细介绍这两个功能的语法、语句以及案例。1.1、TOP子句（SQLServer和Access）1.1
ERROR 1064 (42000): You have an error in your SQL syntax; check the manual that corresponds to your †徐先森® Oracle数据库 Web相关错误集
createtablestudents(idintunsignedprimarykeyauto_increment,namevarchar(50)notnull,ageintunsigned,highdecimal(3,2),genderenum('男','女','中性','保密','妖')default'保密',cls_idintunsigned);在对数据库插入如上带有中文带有默认值的字段的时
Redis 有哪些危险命令？如何防范？花小疯 redis 缓存数据库危险命令大数据
Redis有哪些危险命令？Redis的危险命令主要有以下几个：1.keys客户端可查询出所有存在的键。2.flushdb删除Redis中当前所在数据库中的所有记录，并且此命令从不会执行失败。3.flushall删除Redis中所有数据库中的所有记录，不止是当前所在数据库，并且此命令从不会执行失败。4.config客户端可修改Redis配置。怎么禁用和重命名危险命令？看下redis.conf默认配置
【Golang】 Golang 的 GORM 库中的 Rows 函数不爱洗脚的小滕 golang 开发语言后端
文章目录前言一、Rows函数解释二、代码实现三、总结前言在使用Go语言进行数据库操作时，GORM（GoObject-RelationalMapping）库是一个常用的工具。它提供了一种简洁和强大的方式来处理数据库操作。本文将介绍GORM库中的Rows函数，这是一个用于执行原生SQL查询并返回结果的函数。一、Rows函数解释在GORM库中，Rows函数用于执行原生SQL查询并返回*sql.Rows结
接口测试如何设计测试用例李蕴Ronnie
接口测试用例设计方式针对每个必填参数，都设计一条参数为空的测试用例必填参数不存在传的参数值在数据库中不存在添加数据接口，传入已有的数据重复添加编辑数据接口，各个字段分别编辑，合并编辑参数数据类型限制，针对每个参数设计一条参数值类型不符合的逆向用例参数自身取值范围，针对所有参数，设计一条每个参数值在取值范围内最大值的正向测试用例是否满足前提条件（token、headers），几个前提条件几条用例针对
Hadoop架构 henan程序媛 hadoop 大数据分布式
一、案列分析1.1案例概述现在已经进入了大数据(BigData)时代，数以万计用户的互联网服务时时刻刻都在产生大量的交互，要处理的数据量实在是太大了，以传统的数据库技术等其他手段根本无法应对数据处理的实时性、有效性的需求。HDFS顺应时代出现，在解决大数据存储和计算方面有很多的优势。1.2案列前置知识点1.什么是大数据大数据是指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的大量数据集合，
非关系型数据库天秤-white nosql
一、为什么要用Nosql1.单机MySQL的时代。一个基本的网站访问量一般不会太大，单个数据库完全足够。那时候更多使用的静态网页html，服务器根本没有太大压力。这时候网站的瓶颈是什么？-数据量如果太大，一个机器放不下。-数据量太大需要建立数据的索引（B+Tree），一个服务器内存放不下。-访问量读写混合，一个服务器承受不了。2.memcached缓存+MySQL+垂直拆分（读写分离）。网站80%
Java实现的基于模板的网页结构化信息精准抽取组件：HtmlExtractor yangshangchuan 信息抽取 HtmlExtractor 精准抽取信息采集
HtmlExtractor是一个Java实现的基于模板的网页结构化信息精准抽取组件，本身并不包含爬虫功能，但可被爬虫或其他程序调用以便更精准地对网页结构化信息进行抽取。 HtmlExtractor是为大规模分布式环境设计的，采用主从架构，主节点负责维护抽取规则，从节点向主节点请求抽取规则，当抽取规则发生变化，主节点主动通知从节点，从而能实现抽取规则变化之后的实时动态生效。如
java编程思想 -- 多态百合不是茶 java 多态详解
一: 向上转型和向下转型面向对象中的转型只会发生在有继承关系的子类和父类中（接口的实现也包括在这里）。父类：人子类：男人向上转型： Person p = new Man() ; //向上转型不需要强制类型转化向下转型： Man man =
[自动数据处理]稳扎稳打,逐步形成自有ADP系统体系 comsci dp
对于国内的IT行业来讲,虽然我们已经有了"两弹一星",在局部领域形成了自己独有的技术特征,并初步摆脱了国外的控制...但是前面的路还很长.... 首先是我们的自动数据处理系统还无法处理很多高级工程...中等规模的拓扑分析系统也没有完成,更加复杂的
storm 自定义日志文件商人shang storm cluster logback
Storm中的日志级级别默认为INFO，并且，日志文件是根据worker号来进行区分的，这样，同一个log文件中的信息不一定是一个业务的，这样就会有以下两个需求出现： 1. 想要进行一些调试信息的输出 2. 调试信息或者业务日志信息想要输出到一些固定的文件中不要怕，不要烦恼，其实Storm已经提供了这样的支持，可以通过自定义logback 下的 cluster.xml 来输
Extjs3 SpringMVC使用 @RequestBody 标签问题记录 21jhf
springMVC使用 @RequestBody(required = false) UserVO userInfo 传递json对象数据，往往会出现http 415，400,500等错误，总结一下需要使用ajax提交json数据才行，ajax提交使用proxy，参数为jsonData，不能为params；另外，需要设置Content-type属性为json，代码如下：（由于使用了父类aaa
一些排错方法文强chu 方法
1、java.lang.IllegalStateException: Class invariant violation at org.apache.log4j.LogManager.getLoggerRepository(LogManager.java:199)at org.apache.log4j.LogManager.getLogger(LogManager.java:228) at o
Swing中文件恢复我觉得很难小桔子 swing
我那个草了！老大怎么回事，怎么做项目评估的？只会说相信你可以做的，试一下，有的是时间！用java开发一个图文处理工具，类似word，任意位置插入、拖动、删除图片以及文本等。文本框、流程图等，数据保存数据库，其余可保存pdf格式。ok,姐姐千辛万苦，
php 文件操作 aichenglong PHP 读取文件写入文件
1 写入文件 @$fp=fopen("$DOCUMENT_ROOT/order.txt", "ab"); if(!$fp){ echo "open file error" ; exit; } $outputstring="date:"." \t tire:".$tire."
MySQL的btree索引和hash索引的区别 AILIKES 数据结构 mysql 算法
Hash 索引结构的特殊性，其检索效率非常高，索引的检索可以一次定位，不像B-Tree 索引需要从根节点到枝节点，最后才能访问到页节点这样多次的IO访问，所以 Hash 索引的查询效率要远高于 B-Tree 索引。可能很多人又有疑问了，既然 Hash 索引的效率要比 B-Tree 高很多，为什么大家不都用 Hash 索引而还要使用 B-Tree 索引呢
JAVA的抽象--- 接口 --实现百合不是茶
抽象接口实现接口 //抽象类 ,方法 //定义一个公共抽象的类 ,并在类中定义一个抽象的方法体抽象的定义使用abstract abstract class A 定义一个抽象类例如： //定义一个基类 public abstract class A{ //抽象类不能用来实例化，只能用来继承 //
JS变量作用域实例 bijian1013 作用域
<script> var scope='hello'; function a(){ console.log(scope); //undefined var scope='world'; console.log(scope); //world console.log(b);
TDD实践（二） bijian1013 java TDD
实践题目：分解质因数 Step1：单元测试： package com.bijian.study.factor.test; import java.util.Arrays; import junit.framework.Assert; import org.junit.Before; import org.junit.Test; import com.bijian.
[MongoDB学习笔记一]MongoDB主从复制 bit1129 mongodb
MongoDB称为分布式数据库，主要原因是1.基于副本集的数据备份， 2.基于切片的数据扩容。副本集解决数据的读写性能问题，切片解决了MongoDB的数据扩容问题。事实上，MongoDB提供了主从复制和副本复制两种备份方式，在MongoDB的主从复制和副本复制集群环境中，只有一台作为主服务器，另外一台或者多台服务器作为从服务器。本文介绍MongoDB的主从复制模式，需要指明
【HBase五】Java API操作HBase bit1129 hbase
import java.io.IOException; import org.apache.hadoop.conf.Configuration; import org.apache.hadoop.hbase.HBaseConfiguration; import org.apache.hadoop.hbase.HColumnDescriptor; import org.apache.ha
python调用zabbix api接口实时展示数据 ronin47
zabbix api接口来进行展示。经过思考之后，计划获取如下内容： 1、获得认证密钥 2、获取zabbix所有的主机组 3、获取单个组下的所有主机 4、获取某个主机下的所有监控项
jsp取得绝对路径 byalias 绝对路径
在JavaWeb开发中，常使用绝对路径的方式来引入JavaScript和CSS文件，这样可以避免因为目录变动导致引入文件找不到的情况，常用的做法如下：一、使用${pageContext.request.contextPath} 　　代码” ${pageContext.request.contextPath}”的作用是取出部署的应用程序名，这样不管如何部署，所用路径都是正确的。
Java定时任务调度：用ExecutorService取代Timer bylijinnan java
《Java并发编程实战》一书提到的用ExecutorService取代Java Timer有几个理由，我认为其中最重要的理由是：如果TimerTask抛出未检查的异常，Timer将会产生无法预料的行为。Timer线程并不捕获异常，所以 TimerTask抛出的未检查的异常会终止timer线程。这种情况下，Timer也不会再重新恢复线程的执行了;它错误的认为整个Timer都被取消了。此时，已经被
SQL 优化原则 chicony sql
一、问题的提出　在应用系统开发初期，由于开发数据库数据比较少，对于查询SQL语句，复杂视图的的编写等体会不出SQL语句各种写法的性能优劣，但是如果将应用系统提交实际应用后，随着数据库中数据的增加，系统的响应速度就成为目前系统需要解决的最主要的问题之一。系统优化中一个很重要的方面就是SQL语句的优化。对于海量数据，劣质SQL语句和优质SQL语句之间的速度差别可以达到上百倍，可见对于一个系统
java 线程弹球小游戏 CrazyMizzz java 游戏
最近java学到线程，于是做了一个线程弹球的小游戏，不过还没完善这里是提纲 1.线程弹球游戏实现 1.实现界面需要使用哪些API类 JFrame JPanel JButton FlowLayout Graphics2D Thread Color ActionListener ActionEvent MouseListener Mouse
hadoop jps出现process information unavailable提示解决办法 daizj hadoop jps
hadoop jps出现process information unavailable提示解决办法 jps时出现如下信息： 3019 -- process information unavailable3053 -- process information unavailable2985 -- process information unavailable2917 --
PHP图片水印缩放类实现 dcj3sjt126com PHP
<?php class Image{ private $path; function __construct($path='./'){ $this->path=rtrim($path,'/').'/'; } //水印函数，参数：背景图，水印图，位置，前缀,TMD透明度 public function water($b,$l,$pos
IOS控件学习：UILabel常用属性与用法 dcj3sjt126com ios UILabel
参考网站： http://shijue.me/show_text/521c396a8ddf876566000007 http://www.tuicool.com/articles/zquENb http://blog.csdn.net/a451493485/article/details/9454695 http://wiki.eoe.cn/page/iOS_pptl_artile_281
完全手动建立maven骨架 eksliang java eclipse Web
建一个 JAVA 项目： mvn archetype:create -DgroupId=com.demo -DartifactId=App [-Dversion=0.0.1-SNAPSHOT] [-Dpackaging=jar] 建一个 web 项目： mvn archetype:create -DgroupId=com.demo -DartifactId=web-a
配置清单 gengzg 配置
1、修改grub启动的内核版本 vi /boot/grub/grub.conf 将default 0改为1 拷贝mt7601Usta.ko到/lib文件夹拷贝RT2870STA.dat到 /etc/Wireless/RT2870STA/文件夹拷贝wifiscan到bin文件夹，chmod 775 /bin/wifiscan 拷贝wifiget.sh到bin文件夹，chm
Windows端口被占用处理方法 huqiji windows
以下文章主要以80端口号为例，如果想知道其他的端口号也可以使用该方法..........................1、在windows下如何查看80端口占用情况?是被哪个进程占用?如何终止等. 这里主要是用到windows下的DOS工具,点击"开始"--"运行",输入&
开源ckplayer 网页播放器，跨平台(html5, mobile)，flv, f4v, mp4, rtmp协议. webm, ogg, m3u8 ！天梯梦 mobile
CKplayer，其全称为超酷flv播放器，它是一款用于网页上播放视频的软件，支持的格式有：http协议上的flv,f4v,mp4格式，同时支持rtmp视频流格式播放，此播放器的特点在于用户可以自己定义播放器的风格，诸如播放/暂停按钮，静音按钮，全屏按钮都是以外部图片接口形式调用，用户根据自己的需要制作出播放器风格所需要使用的各个按钮图片然后替换掉原始风格里相应的图片就可以制作出自己的风格了，
简单工厂设计模式 hm4123660 java 工厂设计模式简单工厂模式
简单工厂模式（Simple Factory Pattern）属于类的创新型模式，又叫静态工厂方法模式。是通过专门定义一个类来负责创建其他类的实例，被创建的实例通常都具有共同的父类。简单工厂模式是由一个工厂对象决定创建出哪一种产品类的实例。简单工厂模式是工厂模式家族中最简单实用的模式，可以理解为是不同工厂模式的一个特殊实现。
maven笔记 zhb8015 maven
跳过测试阶段： mvn package -DskipTests 临时性跳过测试代码的编译： mvn package -Dmaven.test.skip=true maven.test.skip同时控制maven-compiler-plugin和maven-surefire-plugin两个插件的行为，即跳过编译，又跳过测试。指定测试类 mvn test
非mapreduce生成Hfile，然后导入hbase当中 Stark_Summer map hbase reduce Hfile path实例
最近一个群友的boss让研究hbase，让hbase的入库速度达到5w+/s，这可愁死了，4台个人电脑组成的集群，多线程入库调了好久，速度也才1w左右，都没有达到理想的那种速度，然后就想到了这种方式，但是网上多是用mapreduce来实现入库，而现在的需求是实时入库，不生成文件了，所以就只能自己用代码实现了，但是网上查了很多资料都没有查到，最后在一个网友的指引下，看了源码，最后找到了生成Hfile
jsp web tomcat 编码问题王新春 tomcat jsp pageEncode
今天配置jsp项目在tomcat上，windows上正常，而linux上显示乱码，最后定位原因为tomcat 的server.xml 文件的配置，添加 URIEncoding 属性： <Connector port="8080" protocol="HTTP/1.1" connectionTi