进化计算在云计算和大数据中的应用有哪些方面

我目前不知道有谁做过所谓的进化计算,大数据跟这个似乎也没有什么直接关系
■网友
在另一个问题下回答过类似的,直接粘贴过来,希望对你有帮助
【进化计算在云计算和大数据中的应用有哪些方面】 我来举个数据挖掘的例子。
假设你有如下数据,每行代表某个顾客的某次商品购买记录,每个整数是某个商品的编号
1 2 3 4
1 3 4 6 7 11 34 19 40 45 100
5 6
22 55 7
... ...
假设这个数据一共包含了990002人次对41276个商品的购买记录。
现在需求是
经可能多地找出一系列商品(20个),它们具有一定的共现性(同时被购买超过20次以上)
好了,现在购买记录的总数是990002个,而噪声阈值是20。
而商品总数是41276个。
这个问题就是数据挖掘中的长模式挖掘
你可以想象难点在哪了-------组合爆炸,候选项实在是太太太太多了。
即使是一些高性能的模式挖掘算法如FP-Growth,面对此类问题也会跑得跟乌龟一样慢(FP-Growth不用检验候选项,它面对此类问题跑得慢主要是因为面对这么大的数据,如此低的噪声阈值会让他的FP-TREE出奇地大,不仅构造这颗TREE花费大量时间,而且可能内存不够用,这些不用了解,只要明白这是个很棘手的问题就好了。)
那么,解决此类问题,目前能想到的最经济实用的办法就是进化算法(PSO, GA and so on )
比如遗传算法,生成一堆长度为20的基因, 其中每个染色体代表一个商品,通过他们的支持度(同时被购买的次数),选择,淘汰,交配,变异,如此往复,在过程中把符合条件的基因存起来作为输出结果。
我曾经水过一篇这个方向的论文,不过用的不是遗传,是二元粒子群算法(BPSO)
Frequent item sets mining from high-dimensional dataset based on a novel binary particle swarm optimization
我的GitHub上分享了一个自己做的该算法的Python包pybpsohd.pyd,和一个用GA解决此类问题的包pyarmga.pyd,都是c++写的,有兴趣可以一起交流交流
DMDarkness/Data-mining

■网友
谢邀,但是这块技术没接触过。帮你再腰几个人。


    推荐阅读