【每周推荐阅读】C-Store:列式存储数据库

Record-based与column-based是数据库和存储系统里面两种不同的data layout。我们的思维逻辑是基于行记录的,即Record-based data layout,数据记录都是一行一行来存储和访问。但在很多数据库应用中发现(尤其是读请求为主要数据访问的数据库),人们往往只是访问一行记录中的某些属性数据,而不得不将整行数据读取出来,其中很多冗余的IO操作和数据其实没有必要的。如果能将避免这些冗余的IO操作和数据访问,那数据库访问的性能和吞吐将可以得到大大提高。C-Store就是在这样的背景下研发出的最早的列式存储管理的存储系统,其基本思想就是将原来数据库表中的每一列数据单独存储在一起,这样用户在访问某个属性数据的时候,只需要读取该行的对应列数据即可,从而大大减少了数据读取的IO量,提高了整个吞吐。

C-Store点燃了column-based数据库或者read-optimal/read-friendly database的研发的热潮,但其核心思想column-based也随后一直延伸到了很多方面。早些年我在负责typhoon的twister表格系统研发的时候,就是从列存储的角度去构造数据管理模型,从而为调研应用及广告特征数据分析提供一种在海量数据下实现高速数据访问的解决方案。后来,我们把整个最核心的生成列存储和记录重组的逻辑抽象成了公共库的基础组件,即column IO,成为和google公共库record IO并列的两大IO引擎组件。

本周推荐阅读是2005年发表在VLDB的column-based数据库的鼻祖之作C-store: a column-oriented DBMS,从中可以了解列存储的基本设计思想与优缺点。

你可能感兴趣的:(store)