ORC、Parquet 等列式存储的优点

南墨2年前技术文章788

ORC 和Parquet 都是高性能的存储方式,这两种存储格式总会带来存储和性能上的提升

  • Parquet:

1. Parquet 支持嵌套的数据模型,类似于Protocol Buffers,每一个数据模型的schema 包含多个字段,每一个字段有三个属性:重复次数、数据类型和字段名。重复次数可以是以下三种:required(只出现1 次),repeated(出现0 次或多次),optional(出现0 次或1 次)。每一个字段的数据类型可以分成两种:group(复杂类型)和primitive(基本类型)。

2. Parquet 中没有Map、Array 这样的复杂数据结构,但是可以通过repeated和group 组合来实现的。

3. 由于Parquet 支持的数据模型比较松散,可能一条记录中存在比较深的嵌套关系,如果为每一条记录都维护一个类似的树状结可能会占用较大的存储空间,因此Dremel 论文中提出了一种高效的对于嵌套数据格式的压缩算法:Striping/Assembly 算法。通过Striping/Assembly 算法,parquet 可以使用较少的存储空间表示复杂的嵌套格式,并且通常Repetition level 和Definition level 都是较小的整数值,可以通过RLE 算法对其进行压缩,进一步降低存储空间。

4. Parquet 文件是以二进制方式存储的,是不可以直接读取和修改的,Parquet文件是自解析的,文件中包括该文件的数据和元数据。

  • ORC:

1. ORC 文件是自描述的,它的元数据使用Protocol Buffers 序列化,并且文件中的数据尽可能的压缩以降低存储空间的消耗。

2. 和Parquet 类似,ORC 文件也是以二进制方式存储的,所以是不可以直接读取,ORC 文件也是自解析的,它包含许多的元数据,这些元数据都是同构ProtoBuffer 进行序列化的。

3. ORC 会尽可能合并多个离散的区间尽可能的减少I/O 次数。

4. ORC 中使用了更加精确的索引信息,使得在读取数据时可以指定从任意一行开始读取,更细粒度的统计信息使得读取ORC 文件跳过整个row group,ORC默认会对任何一块数据和索引信息使用ZLIB 压缩,因此ORC 文件占用的存储空间也更小。

5. 在新版本的ORC 中也加入了对Bloom Filter 的支持,它可以进一步提升谓词下推的效率,在Hive 1.2.0 版本以后也加入了对此的支持。


相关文章

CDH实操--客户端安装

CDH实操--客户端安装

概述安装CDH客户端,主要是方便在CDH部署节点以外,通过客户端的方式连接CDH上的hdfs,hive和hbase服务1、安装jdk(适配CDH即可,一般1.8)2、获取安装包3、部署安装包把安装包解...

stress压测工具

1、stress 概述stress是一个linux的压力测试工具,主要用来模拟系统负载较高时的场景,用于对系统的CPU、IO、内存、负载、磁盘等进行压力测试2、安装yum install -y epe...

Kafka Leader 和 Follower 故障

Kafka Leader 和 Follower 故障

前言:       在kafka集群工作过程中,难免会碰到某个kafka服务实例宕机或挂掉的情况,服务一旦挂掉,意味着某个分区中的leader或follower将不能正常工作了       具体来说,...

大数据集群二次开发及调优使用指导(一)-HDFS

1.   典型业务调优涉及HDFS的相关业务一般可以分为IO密集型业务,计算密集型业务,低延迟业务,高吞吐量业务1.1     低延迟业务计...

mysql 导出 csv 参数 secure_file_priv 设置

mysql 导出 csv 参数 secure_file_priv 设置

一、功能secure_file_priv 参数是用来限制数据导入和导出操作的效果,例如由LOAD data和SELECT…INTO OUTFILE语句和LOAD_FILE()函数。只有具有“FILE”...

Oozie web console is disabled 问题解决

Oozie web console is disabled 问题解决

一、问题一a、错误现象b、解决方案①、根据提示查看Oozie Quick Start 发现是缺少ExtJS 2.2库(必须是2.2版)下载ExtJS2.2下载地址:http://archive.clo...

发表评论    

◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。