FAQ第二期-Spark案例实战答疑.pdfVIP

  • 3
  • 0
  • 约4.38千字
  • 约 11页
  • 2026-04-18 发布于浙江
  • 举报

FFAAQQ第第二二期期--SSppaarrkk案案例例实实战战答答疑疑

你好,我是蔡元楠。

这里是第二期答疑,上周我结束了Spark部分的内容,时隔一周,我的Spark案例实战答疑终于上线了。

通过10讲的Spark学习,相信你已经对Spark的基本特性有了深入的了解,也基本掌握了如何使用各类常用

API,如RDD、DataSet/DataFrame、Spark Streaming和Structured Streaming。今天我将针对模块三中提

出的一些共性留言做一个集中答疑。

我首先要为积极留言的同学点个赞,感谢同学亲自动手实践,有的同学还通过查阅官方API文档的形式

找出了正确的实现方式,这非常值得鼓励。

第第1188讲讲

在第18讲中,kylin同学留言问到,为什么用我通篇用的是DataFrame API而不是DataSet。这是因为

-2-

PySpark的SQL库只有DataFrame,并没有DataSet。不过在Scala和Java中,DataSet已经成为了统一的SQL

入口。

斯盖丸同学问道,第18讲代码中groupBy(‘value’)中value是什么意思?

这里我说一下,SparkSession.read.tex

文档评论(0)

1亿VIP精品文档

相关文档