大数据集群部署规划(四)组件建议规格

南墨2年前技术文章736

类型

指标名称

规格

说明

HDFS

单对NameNode最大文件数

1亿

-

单DataNode最大block数

500万

GC参数 -Xmx32G

单个DataNode磁盘最多block数

50万

-

单个目录下最多文件目录数(不含递归)

100万

配置参数:

dfs.namenode.fs-limits.max-directory-items

每个文件中可包含的最大块数

100万

配置参数:

dfs.namenode.fs-limits.max-blocks-per-file

文件路径最大长度

8000

配置参数:

dfs.namenode.fs-limits.max-component-length

最小块大小

1048576

配置参数:

dfs.namenode.fs-limits.min-block-size

单个DataNode允许的最少正常磁盘个数

1

配置参数:

dfs.datanode.failed.volumes.tolerated

Yarn

单NodeManager可分配的最大内存

物理内存*0.8

-

单NodeManager可分配的最大vcore

逻辑CPU*1.25~2

虚拟机环境请勿超分

HBase

HBase RegionServer数量

128

单个HBase服务的RegionServer实例数

单个RegionServer实例的Region数量

2000

每个RegionServer实例支持的最大Region数

单个RegionServe支持的活跃Region数量

200

每个RegionServer实例支持的最大活跃Region数

Hive

单Hive表支持的分区数量

1万

单个Hive表建议的最大分区个数

单表最大文件数量

100万

单个Hive表建议存储在HDFS上的最大文件个数

最大分区数量

300万

单个Hive服务所有表建议的最大分区个数

单HiveServer最大并发数

500

单个HiveServer实例支持的最大并发个数

Kafka

单Kafka集群节点数

256

-

Topic名称最大长度

200字节

Topic名称长度限制在200字节以内

Solr

单Solr集群实例数

200

Solr进程数

单SolrServer支持的Core数量

200

-

单Core支持的记录数

1~4亿

-

单SolrServer最大内存配置

32GB

采用G1的GC算法

单SolrServer内存和磁盘最优比例

1:20

-

Elasticsearch

单Elasticsearch集群实例数

512

-

单Elasticsearch集群支持的最大shard数

7万

单Elasticsearch集群最大数据量2PB

单Elasticsearch集群支持的最大索引数

5000

-

单Elasticsearch实例最大内存配置

32GB

采用G1的GC算法

单shard支持的记录数

1~4亿

-

单shard支持存储的数据量

20GB

-

单EsNode实例,最大shard数

200

-

单EsNode实例,最大存储量

5TB

-

单EsNode实例内存和磁盘最优比例

1:50

热数据最优比例1:50

冷数据最优比例1:100

ZooKeeper

每个ZooKeeper实例,单个IP最大连接数

2000

-

每个ZooKeeper实例,最大连接总数

20000

-

默认参数情况下,最大ZNode数

400000

-

单个ZNode大小

4M

-

Flume

单集群Flume最多实例数

32

Flume最大实例数

Presto

单集群计算实例数

1-32

-

所有计算实例的Worker总个数上限

400

-

单个计算实例的Coordinator/Worker的JVM下限

1GB

-

单个计算实例的Coordinator个数

1-3

-

单个计算实例的Worker个数

1-256

-

ClickHouse

单集群ClickHouse实例数

64

单集群ClickHouse支持的最大实例数

每个ClickHouseServer实例,支持的最大表数量

5000

-

每个ClickHouseServer实例,单个表支持的最大分区数

10000

-

Kudu

Master数量

一般3台即可

与复制因子数相同,为奇数

tablet server数

不超过100

限制:300

tablet数/tablet server(含副本)

1000+

限制:4000

tablet数/表/tablet server(含副本)

60+

限制:60

单台tablet server存储数据(含副本,压缩后)

8TB+

限制:10TB

单tablet存储数据(超过会性能下降、合并失败、启动慢)

10G

限制:50G

单tablet对应CPU核心数(不考虑副本,不考虑小表)

1

限制:多对1

tablet server内存

16G以上最佳

限制:不低于4G

 


相关文章

Ranger-hdfs插件部署

Ranger-hdfs插件部署

部署在两个namenode节点解压插件cd /opt/hadooptar -xzvf ranger-2.4.0-hdfs-plugin.tar.gz -C /opt/cd /opt/ranger-2....

MySQL主从部署(同步+半同步)

一、环境规划1.1服务器规划服务器 IP 版本 配置 Mysql 端口 角色172-16-104-8 172.16.104.8 CentOS release 6.8 (Final) 4c8g 5.7....

Ambari部署

Ambari部署

Ambari 官方资料入口:https://www.cloudera.com/products/open-source/apache-hadoop/apache-ambari.htmlAmbari 相...

sqlserver迁移job步骤

sqlserver迁移job步骤

1)源服务器 sql server 找到sql server 代理,选中作业 2)按F7 弹出作业对象资源管理器,全选中作业 3)右击单出编写job 脚本窗口,将job 创建脚本保存到查询编辑器窗口 ...

CDH实操--hive高可用

CDH实操--hive高可用

前言在CDH中,hive metastore、hiveserver2若角色单实例部署,或者部署多个实例但是连接配置任选其一的话,均存在单点问题,一旦实例故障就会影响业务稳定;这时我们就好考虑高可用部署...

CDH实操--impala增加ldap认证

CDH实操--impala增加ldap认证

本文基于cdh安装ldap主主模式,并且配置haproxy+keepalived基础上进行配置。一、impala配置ldap1、impala配置中增加ldap相关验证2、重启过时配置。3、ldap验证...

发表评论    

◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。