写好pyspark是不是就不用学scala了

个人觉得可以。
但pyspark是在jvm上做了一层封装,每次想跟源码的时候跟到java调用我就看不懂了,不过我觉得pyspark相关的api用熟练已经足够了。

■网友
看你的场景吧~ 如果是在生产环境中使用,建议还是scala,当前版本的PySpark实现是基于Py4J,需要将数据通过native socket的方式从jvm传输给python进程,相关的代码可以查看PythonGatewayServer等,传输的过程中有Ser/De开销,在数据集比较大的时候性能下降会更明显,当然社区在这方面也有很多努力,比如最近的基于Apache Arrow的python udf的vectorize的优化,具体可以参见DataBricks的blog https://databricks.com/blog/2017/10/30/introducing-vectorized-udfs-for-pyspark.html 总结一下,简单开发,比如本地,当然可以使用PySpark,如果是生产环境,建议Scala。
■网友
一般使用应该是没有什么大问题的,但是懂,并且用得好就很难了。

■网友
可以,但是请用Spark SQL的新API,因为DF和DS由Spark解析优化,最后实际是在JVM上生成原生的优化很好的RDD计算,而直接用Python写原生RDD API的话,性能有较大损失。

■网友
完全可以。如果只使用spark 不调用它内部的api的话,Python 完全可以胜任,而且结合Python自身的库如numpy,会更加方便实用。
■网友
看应用场景吧,数据量没到TB级的话,我觉得PySpark完全没啥问题,简单方便,Python支持的第三方模块贼多。对于数据科学,数据分析人员来说,Python是门非常友好的语言,学习Scala的成本比较高。
【写好pyspark是不是就不用学scala了】 详细的性能,及各方面对比,可以看看这篇文章
dennis:Apache Spark一定要用Scala?PySpark的性能详解(译)

■网友
基本业务场景可以满足,但是高阶的就没办法了,毕竟pyspark是后来的

■网友
pyspark支持的并不是很好,最好用java和scala。
■网友
学习不求多,胜在精通,需要什么学什么。
■网友
我觉得可以,感觉看了题主的描述并不需要深度使用Spark,并且也不需要对Spark内部的东西有太多了解,只是使用API的话我觉得是可以的,当然有余力的话推荐学学scala


    推荐阅读