流式数据湖平台Hudi核心概念三:索引

1.索引

Hudi通过索引机制将给定的hoodie keyrecord key+分区路径)映射到文件id,实现了高效的upstart。一旦将记录的第一个版本写入文件,record key和文件组/文件id之间的映射就永远不会改变。简而言之,映射的文件组包含一组记录的所有版本。

对于Copy-On-Write表,可以实现快速的追加和删除操作,避免了对整个数据集进行连接以确定要重写的文件。对于Merge-On-Read

你可能感兴趣的:(数据湖,大数据,数据仓库,flink,分布式,spark)