数据挖掘实习应该准备啥

【数据挖掘实习应该准备啥】 实习可以说是半只脚踏入校招,还是需要非常认真对待的,尤其是BAT校招,实习重要性你懂的。
机器学习算法理解,面试官挺喜欢问聚类、LR、SVM、随机森林、GDBT、xgboost、EM算法、神经网络等等常规算法,以及简单算法聚类、LR、随机森林等hadoop分布式实现。有时也要求现场推导,常见的就是LR求导(必考,划重点啦),SVM的最优化公式,优化方法BFGS推导等,李航的《统计学习方法》与周志华的西瓜书刷三遍准没错。扩展方面,比如自然语言的word2vec原理与主题模型LDA(《LDA数学八卦》很赞),图像方面可以聊聊alexnet(论文很赞)、vgg-net等,推荐系统(项亮《推荐系统》还是很值读一读的),计算广告FFM算法,AlphaGo原理。
数据结构算法,毕竟码农基本功,一般问题不会太难,仔细想没什么问题(适合国内公司bat,国外的公司貌似会比较难)。多练习点递归,哈希,动态规划,广搜和深搜图论相关,多刷leetcode,多刷刷中级、高级就行了 。 来自Cyber 的参考资料。
京东招聘的数据挖掘实习生,供参考:
职责:
1、采用最新大数据处理技术,与之前在google,雅虎,腾讯,百度等知名公司工作过的高级工程师一起构建稳定的、可水平扩展大数据计算处理系统,支持广告业务发展。
2、基于分布式数据库,构建大规模商业数据的adhoc查询引擎和OLAP系统。
3. 构建基于spark的数据挖掘算法与pipline,为广告与内部业务提供技术与数据业务服务。
职位要求:
1、计算机或数学相关专业
2、对大数据处理系统有热情,愿意主动跟踪大数据技术方向
3、熟练掌握Java语言,有Hadoop、Spark stack经验和分布式数据库经验者优先
4. 对于scala与函数式编程有兴趣与基础者优先。对spark源码有研究者优先。


    推荐阅读