以下是根据论文归纳出的一些查询优化器公式和知识点,有没有用不知道,先码起来。
处理SQL语句是从解析用户输入的SQL语句开始,经过一系列优化过程,最终生成机器代码并执行的过程。这个过程涉及到多个复杂的步骤,每个步骤都是为了确保SQL语句能够高效、正确地执行。通常包括以下四个主要步骤:
这个步骤负责对用户输入的SQL语句进行词法和语法分析,检查SQL语句是否遵循SQL语法规则。
解析器通常使用像yacc这样的工具来完成这个工作,语法解析的结果是一个“抽象语法树”(Abstract Syntax Tree, AST),这是一个表示SQL语句结构的内部数据结构。
在确定了每个查询块的执行计划并在抽象语法树中表示这个计划之后,代码生成器被调用。代码生成器是一个将ASL树转换为机器语言代码的程序,这些代码用来执行优化器选择的计划。它使用一组有限的代码模板,每种连接方法(包括不需要连接的情况)都对应一个模板。嵌套查询的查询块被当作“子程序”处理,它们在执行时返回值给调用它们的查询块。
在代码生成器阶段,解析树被转换成可执行的机器代码和相关的数据结构。这些生成的机器代码可以直接执行,也可以保存在数据库中,以备将来执行。当代码执行时,它会通过存储系统接口(RSI)调用System R的内部存储系统(RSS)来执行物理存储关系的扫描。这些扫描操作会沿着优化器选择的访问路径进行。
代价评估公式用于估算执行特定查询的资源消耗,主要包括I/O和CPU的消耗。
数据库优化器使用以下统计信息来估计查询的代价:
关系T:
对于T的任意索引I:
用户可以通过执行UPDATE STATISTICS
命令来更新这些统计信息。
选择率是指满足某个条件的元组占总元组的比例,用于估计查询的选择性:
column = value:
column1 = column2:
column > value 或 (v1 < column < v2):
column IN (list of values):
逻辑表达式的选择率:
在所有可能的访问路径中,优化器会根据上述代价评估公式和选择率,选择一个总代价最小的路径。如果查询需要按照某种特定的顺序(比如由GROUP BY或ORDER BY子句指定的顺序)输出元组,而这个顺序可以通过索引直接获得,那么这个顺序被称为一个“有趣的顺序”,优化器在决定使用索引的时候会考虑这个因素。
嵌套循环连接是最简单的连接方法,它涉及两个步骤:
嵌套循环连接的成本计算公式为:
C-nested-loop-join(path1, path2) = C-outer(path1) + N * C-inner(path2)
其中:
C-outer(path1)
是遍历外表的成本。N
是外表中满足连接谓词的元组数量。C-inner(path2)
是遍历内表的成本。这种方法在内表非常小或者外表中满足连接条件的元组非常少时可能是有效的,但是如果两个表都很大,这种方法将会非常低效。
合并连接是一种更高效的连接方法,尤其是当两个表的连接列都已经排序时。合并连接的步骤如下:
合并连接的成本计算公式为:
C-merge(path1, path2) = C-outer(path1) + N * C-inner(path2)
其中:
C-outer(path1)
是读取并排序外表的成本。N
是外表的元组数量。C-inner(path2)
是读取内表的成本。如果内表没有预先排序,你可能需要先对内表进行排序,这会增加额外的成本。
对于已排序的内表,我们可以使用以下公式来计算内部扫描的成本:
C-inner(sorted list) = TEMPPAGES/N + W * RSICARD
其中:
TEMPPAGES
是存储内表所需的临时页面数。N
是外表的元组数量。W
是CPU和IO之间的权重因子。RSICARD
是在合并过程中预计会读取的内表元组数量。这个公式假设在合并过程中,内表的每个页面只被读取一次,这是基于内表已经被排序的事实。由于内表是排序的,合并连接可以有效地通过比较排序键来快速找到匹配的元组,而不必遍历整个内表。
在实际的数据库查询优化中,优化器会考虑多种因素来选择最佳的连接策略,包括表的大小、索引的存在、连接列的排序状态以及内存的可用量。优化器还会使用统计信息来更精确地估计成本和选择率,从而生成一个总体成本最低的查询执行计划。