机器学习(包括大数据、数据挖掘等等)岗位的竞争力是啥

首先,机器学习最重要的是数据,而不是算法。没有足够的高质量的数据,什么样的算法都没用。如果有数据质量好数量够,怎样的模型都能出不错的结果。
第二,深度学习跟传统的算法的区别,主要是深度学习的模型把feature engineering的过程内嵌在里头了。其实在很多项目里头,如果data scientist很有经验,对领域也非常了解,能够非常有效地整理和清理数据,并做出很好的features,那么哪怕用很简单的线性模型也能得到比deep learning更好的结果。而且这类简单的模型的结果还很好理解。比如,你建了一个模型来判断是不是批准一个贷款。很多情况下,并不是给个批不批的结果就行的。如果不批,还得理解模型是怎么做出这个判断的。如果没有这一步,一来没法判断和检测模型的正确性,二来也没办法提供好的客户体验。
第三,有很多人在做算法研发。但是真正有效的新算法是非常少的。在工业界中,大家大多时候都是用现有的算法甚至是现成的软件包。现在很多包都很好用,往往一行代码就能用起来。但是,一个好的数据科学家不是调个包就行的。他需要能够对各种算法有比较深层次的了解,知道它们的优缺点,知道各种算法什么时候用,该怎么用。而且对所处领域有非常熟悉,知道怎么去定义问题,搜集数据,处理数据,建立模型,和把模型产品化。最好还能够根据自己所面对的问题customize算法。做好这些东西,需要很好的编程能力,理论功底和行业经验。

■网友
首先,在公司中,针对具体的业务场景,用什么样的模型合(哪怕是一个简单的模型)适,如何对模型进行调参,如何让你的模型对于不同的数据都有一个较好的泛化能力。这些都是需要经过大量调试和工程经验积累的,我们看起来轻描淡写,但是背后的工作是无法忽略的。
另外,在我们公司,需要不断的对新技术进行预言,有可能目前这项技术还不适合工程化,但是要保持技术的先进性。另外,其实目前很多最新的技术模型,都已经在产品中有体现了。
在大公司,会接触到更多的数据,跟复杂真实的业务场景,知道你最应该解决的问题。
其实,在预言的时候,你如果能够提出新的方法,并适合产品化,是最好的。
【机器学习(包括大数据、数据挖掘等等)岗位的竞争力是啥】

■网友
现在广告ctr预估模型已经不简单了,rnn,cnn各种模型都在用了,提升很明显。而且数据量大的情况下模型工程实现也很复杂的。你那个百度前辈可能只是跟你吹一下牛而已。总之模型从理论到实际运用鸿沟还是很大的。


    推荐阅读