ORC、Parquet 等列式存储的优点

南墨2年前技术文章599

ORC 和Parquet 都是高性能的存储方式,这两种存储格式总会带来存储和性能上的提升

  • Parquet:

1. Parquet 支持嵌套的数据模型,类似于Protocol Buffers,每一个数据模型的schema 包含多个字段,每一个字段有三个属性:重复次数、数据类型和字段名。重复次数可以是以下三种:required(只出现1 次),repeated(出现0 次或多次),optional(出现0 次或1 次)。每一个字段的数据类型可以分成两种:group(复杂类型)和primitive(基本类型)。

2. Parquet 中没有Map、Array 这样的复杂数据结构,但是可以通过repeated和group 组合来实现的。

3. 由于Parquet 支持的数据模型比较松散,可能一条记录中存在比较深的嵌套关系,如果为每一条记录都维护一个类似的树状结可能会占用较大的存储空间,因此Dremel 论文中提出了一种高效的对于嵌套数据格式的压缩算法:Striping/Assembly 算法。通过Striping/Assembly 算法,parquet 可以使用较少的存储空间表示复杂的嵌套格式,并且通常Repetition level 和Definition level 都是较小的整数值,可以通过RLE 算法对其进行压缩,进一步降低存储空间。

4. Parquet 文件是以二进制方式存储的,是不可以直接读取和修改的,Parquet文件是自解析的,文件中包括该文件的数据和元数据。

  • ORC:

1. ORC 文件是自描述的,它的元数据使用Protocol Buffers 序列化,并且文件中的数据尽可能的压缩以降低存储空间的消耗。

2. 和Parquet 类似,ORC 文件也是以二进制方式存储的,所以是不可以直接读取,ORC 文件也是自解析的,它包含许多的元数据,这些元数据都是同构ProtoBuffer 进行序列化的。

3. ORC 会尽可能合并多个离散的区间尽可能的减少I/O 次数。

4. ORC 中使用了更加精确的索引信息,使得在读取数据时可以指定从任意一行开始读取,更细粒度的统计信息使得读取ORC 文件跳过整个row group,ORC默认会对任何一块数据和索引信息使用ZLIB 压缩,因此ORC 文件占用的存储空间也更小。

5. 在新版本的ORC 中也加入了对Bloom Filter 的支持,它可以进一步提升谓词下推的效率,在Hive 1.2.0 版本以后也加入了对此的支持。


相关文章

配置跨集群互信

1.源集群修改项创建跨域krbtgt Principal进入kadmin命令行,执行以下2条命令:(如有加密算法需要添加加密算法部分)addprinc krbtgt/源集群realm@目标集群real...

MySQL运维实战(4.3) SQL_MODE之ONLY_FULL_GROUP_BY

设置ONLY_FULL_GROUP_BY后,对有group by子句SQL,select的字段要么是group by中的字段,要么对字段进行聚合运算,否则sql执行报错。不设置ONLY_FULL_GR...

Redis Sentinel与Cluster安装部署(二)

3.2cluster部署1、在对应的机器,下载、解压redis #详见sentinel部署内相关命令 2、创建对应的文件目录   mkdir -p /usr/lcoal/redis5/clust...

MySQL运维实战之ProxySQL(9.1)ProxySQL介绍

MySQL运维实战之ProxySQL(9.1)ProxySQL介绍

mysql通过复制技术实现了数据库高层面的可用,但是对于应用来说,当后端MySQL发生高可用切换时,应该怎么处理?我们考虑几种方案:1、使用域名绑定。应用通过dns连接后端实例,当后端发生切换后,将d...

Apache trino的ldap认证开启

Apache trino的ldap认证开启

1、背景由于trino 默认没有开启用户认证体系,需要ldap用户进行认证。开启tls和ldap用户认证。提高安全性2、配置前置条件。trino 集群已经部署完成ldap 服务openjdk 版本大于...

MySQL 8.0 新特性:Persisted System Variables

MySQL 8.0 新特性:Persisted System Variables

一、前言MySQL 5.7 之前我们修改参数变量后,需要将其手动写入到服务端配置文件中,否则重启后又恢复原有的配置,在 8.0 中可以在 MySQL 客户端直接将参数持久化,节省在服务器操作的步骤,下...

发表评论    

◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。