Spark弹性分布式数据集笔记:启动方式与RDD操作详解.pdfVIP

  • 0
  • 0
  • 约4.69千字
  • 约 5页
  • 2026-04-27 发布于北京
  • 举报

Spark弹性分布式数据集笔记:启动方式与RDD操作详解.pdf

启动方式:

[root@master~]#pyspark

主机上设置两个CPU工作(在主机上工作)

[root@master~]#pyspark--masterlocal[2]

指定集群运行

#pyspark--masterspark://master:7077

增大虚拟机的CPU数量

查看本机CPU数量

计算机管理设备管理器处理器

虚拟机增加CPU数量

关闭虚拟机增加虚拟机处理器的数量重启虚拟机

启动相应进程

启动hadoop启动spark

设置两个CPU进行操作

[root@master~]#pyspark--masterlocal[2]

sc

SparkContextmaster=local[2]appName=PySparkShell

linux=sc.textFile(hdfs://master:9000/input/Linux.txt)

linux.count()

linux.collect()

linux.first()

linux.take(3)

=========RDD操作

RDD创建有三种方式:

从集合中创建

data=[10,20,30,40,50,60]

rdd1=sc.paralleli

文档评论(0)

1亿VIP精品文档

相关文档