跳至内容
Cdh6.3.2 集群规划
在 GitHub 编辑

CDH6.3.2 集群规划

基础

硬件信息

内存硬盘核数
bjuc49.optaim.com128G10T32
bjuc50.optaim.com128G10T32
bjuc51.optaim.com128G10T32
bjuc52.optaim.com128G10T32
bjuc53.optaim.com128G10T32
bjuc54.optaim.com128G10T32
bjuc55.optaim.com128G10T32

环境

系统:

ubuntu18.04

jdk:

oracle-j2sdk1.8-1.8.0+update181-1.x86_64.rpm

mysql:

Mariadb-10.1.45

username=root

password=Qwaszx@zxc

49和50上的hive库互为主从

Cloudera Manager:

Cloudera Express 6.3.1

CDH:

CDH6.3.2

systemctl restart cloudera-scm-server

CDH包含框架

ComponentVersion
Apache Avro1.8.2
Apache Flume1.9.0
Apache Hadoop3.0.0
Apache HBase2.1.4
HBase Indexer1.5
Apache Hive2.1.1
Hue4.3.0
Apache Impala3.2.0
Apache Kafka2.2.1
Kite SDK1.0.0
Apache Kudu1.10.0
Apache Solr7.4.0
Apache Oozie5.1.0
Apache Parquet1.9.0
Parquet-format2.4.0
Apache Pig0.17.0
Apache Sentry2.1.0
Apache Spark2.4.0
Apache Sqoop1.4.7
Apache ZooKeeper3.4.5

集群规划

49505152535455
mariadbmariadb
cm_server
cm_agentcm_agentcm_agentcm_agentcm_agentcm_agentcm_agent
namenodenamenode
datanodedatanodedatanodedatanodedatanodedatanodedatanode
RMRM
NMNMNMNMNMNMNM
zookeeperzookeeperzookeeper
kafkakafkakafka
hivehive
sparksparkspark_history
flinkflink
sqoopsqoop
kudukudu
impala
flume
hue
Oozie
sentry

数据迁移

HDFS数据迁移:

hadoop distcp -skipcrccheck -update hdfs://10.11.90.12:8020/zyz/ifansb/ hdfs://10.11.20.52:8020/zyz/ifansb/

hadoop distcp -skipcrccheck -update hdfs://10.11.90.12:8020/user/hive/warehouse/ifansb.db hdfs://10.11.20.52:8020/user/hive/warehouse/ifansb.db

hive 元数据迁移:

第一步先把旧集群得元数据导出来
然后导入新集群的mysql对应的库里
查询升级所需的脚本
./schematool -dbType mysql -upgradeSchemaFrom 1.10 -dryRun -passWord scm -userName scm
再mysql中依次执行所需的脚本,最后补全缺少的table
在CDH中更新hive metaStore namenode

hive分区补全

msck repair table table_name;

权限刷新

hdfs dfsadmin -refreshUserToGroupsMappings

Hive server2 HA

<property>
	<name>hive.server2.support.dynamic.service.discovery</name>
	<value>true</value>
</property>

JDBC

#hive session
hive.spark.client.future.timeout=60s
hive.spark.client.connect.timeout=600s
hive.spark.client.server.connect.timeout=600s

!connect jdbc:hive2://bjuc55.optaim.com:2181,bjuc54.optaim.com:2181,bjuc53.optaim.com:2181/;serviceDiscoveryMode=zooKeeper;zooKeeperNamespace=hiveserver2

beeline --hiveconf hive.server2.logging.operation.level=NONE  -u "jdbc:hive2://10.11.20.55:2181,10.11.20.54:2181,10.11.20.53:2181/;serviceDiscoveryMode=zooKeeper;zooKeeperNamespace=hiveserver2"  -n hive