02_尚硅谷大数据技术之SparkCore(V5.0).docxVIP

  • 11
  • 0
  • 约6.86万字
  • 约 65页
  • 2023-05-17 发布于河南
  • 举报

02_尚硅谷大数据技术之SparkCore(V5.0).docx

尚硅谷大数据技术之SparkCore ————————————————————————————— 更多Java –大数据 –前端 –python人工智能资料下载,可百度访问:尚硅谷官网 尚硅谷大数据技术之SparkCore (作者:尚硅谷研究院) 版本:V5.0 第1章 RDD概述 1.1 什么是RDD RDD(Resilient Distributed Dataset)叫做弹性分布式数据集,是Spark中最基本的数据抽象。 代码中是一个抽象类,它代表一个弹性的、不可变、可分区、里面的元素可并行计算的集合。 RDD类比工厂生产。 ·1.2 RDD五大特性 第2章 RDD编程 2.1 RDD的创建 在Spark中创建RDD的创建方式可以分为三种:从集合中创建RDD、从外部存储创建RDD、从其他RDD创建。 2.1.1 IDEA环境准备 1)创建一个maven工程,工程名称叫SparkCore 2)创建包名:com.atguigu.createrdd 3)在pom文件中添加spark-core的依赖 dependencies dependency groupIdorg.apache.spark/groupId artifactIdspark-core_2.12/artifactId

文档评论(0)

1亿VIP精品文档

相关文档