大数据技术实战---项目中遇到的问题及项目经验.docxVIP

  • 2
  • 0
  • 约3.66千字
  • 约 4页
  • 2022-12-13 发布于陕西
  • 举报

大数据技术实战---项目中遇到的问题及项目经验.docx

大数据技术实战---项目中遇到的问题及项目经验 问题导读: 1、项目中遇到过哪些问题? 2、Kafka消息数据积压,Kafka消费能力不足怎么处理? 3、Sqoop数据导出一致性问题? 4、整体项目框架如何设计? 项目中遇到过哪些问题 7.1 Hadoop宕机 (1)如果MR造成系统宕机。此时要控制Yarn同时运行的任务数,和每个任务申请的最大内存。调整参数:yarn.scheduler.maximum-allocation-mb(单个任务可申请的最多物理内存量,默认是8192MB) (2)如果写入文件过量造成NameNode宕机。那么调高Kafka的存储大小,控制从Kafka到HDFS的写入速度。高峰期的时候用Kafka进行缓存,高峰期过去数据同步会自动跟上。 7.2 Flume小文件 Flume上传文件到HDFS时参数大量小文件? 调整hdfs.rollInterval、hdfs.rollSize、hdfs.rollCount这三个参数的值。 7.3 Kafka挂掉 (1)Flume记录 (2)日志有记录 (3)短期没事 7.4 Kafka消息数据积压,Kafka消费能力不足怎么处理? (1)如果是Kafka消费能力不足,则可以考虑增加Topic的分区数,并且同时提升消费组的消费者数量,消费者数=分区数。(两者缺一不可) (2)如果是下游的数据处理不及时:提高每批次拉取的数量。

文档评论(0)

1亿VIP精品文档

相关文档