写好pyspark是不是就不用学scala了
个人觉得可以。
但pyspark是在jvm上做了一层封装,每次想跟源码的时候跟到java调用我就看不懂了,不过我觉得pyspark相关的api用熟练已经足够了。
■网友
看你的场景吧~ 如果是在生产环境中使用,建议还是scala,当前版本的PySpark实现是基于Py4J,需要将数据通过native socket的方式从jvm传输给python进程,相关的代码可以查看PythonGatewayServer等,传输的过程中有Ser/De开销,在数据集比较大的时候性能下降会更明显,当然社区在这方面也有很多努力,比如最近的基于Apache Arrow的python udf的vectorize的优化,具体可以参见DataBricks的blog https://databricks.com/blog/2017/10/30/introducing-vectorized-udfs-for-pyspark.html 总结一下,简单开发,比如本地,当然可以使用PySpark,如果是生产环境,建议Scala。
■网友
一般使用应该是没有什么大问题的,但是懂,并且用得好就很难了。
■网友
可以,但是请用Spark SQL的新API,因为DF和DS由Spark解析优化,最后实际是在JVM上生成原生的优化很好的RDD计算,而直接用Python写原生RDD API的话,性能有较大损失。
■网友
完全可以。如果只使用spark 不调用它内部的api的话,Python 完全可以胜任,而且结合Python自身的库如numpy,会更加方便实用。
■网友
看应用场景吧,数据量没到TB级的话,我觉得PySpark完全没啥问题,简单方便,Python支持的第三方模块贼多。对于数据科学,数据分析人员来说,Python是门非常友好的语言,学习Scala的成本比较高。
【写好pyspark是不是就不用学scala了】 详细的性能,及各方面对比,可以看看这篇文章
dennis:Apache Spark一定要用Scala?PySpark的性能详解(译)
■网友
基本业务场景可以满足,但是高阶的就没办法了,毕竟pyspark是后来的
■网友
pyspark支持的并不是很好,最好用java和scala。
■网友
学习不求多,胜在精通,需要什么学什么。
■网友
我觉得可以,感觉看了题主的描述并不需要深度使用Spark,并且也不需要对Spark内部的东西有太多了解,只是使用API的话我觉得是可以的,当然有余力的话推荐学学scala
推荐阅读
- 银行系统的研发岗(程序员)是不是很难进(校招)推广到国企的研发岗(程序员)呢
- 鬼斗车|安全性是不是韩系车短板?到车里去寻找下答案!
- 孩子|张奶奶笔记:母乳是不是吃饱了?(权威文献摘录)
- Syniverse是不是南京最难进的IT公司
- 如果把DNS从godaddy转到DNSPOD是不是所有的二级域名都要重新设置,然后等这个各个ISP的缓存重新解析啊
- 看看老板是不是在画饼
- 当有人形容你翻脸比翻书还快,咋回答
- 优酷的立体声功能是不是脑残设计
- 妙招|有需要的快收藏吧你家宝宝是不是已经开始流口水了?护理有妙招
- Apple Pay 是不是有闪付功能的卡才能用
