进化计算在云计算和大数据中的应用有哪些方面
我目前不知道有谁做过所谓的进化计算,大数据跟这个似乎也没有什么直接关系
■网友
在另一个问题下回答过类似的,直接粘贴过来,希望对你有帮助
【进化计算在云计算和大数据中的应用有哪些方面】 我来举个数据挖掘的例子。
假设你有如下数据,每行代表某个顾客的某次商品购买记录,每个整数是某个商品的编号
1 2 3 4
1 3 4 6 7 11 34 19 40 45 100
5 6
22 55 7
... ...
假设这个数据一共包含了990002人次对41276个商品的购买记录。
现在需求是
经可能多地找出一系列商品(20个),它们具有一定的共现性(同时被购买超过20次以上)
好了,现在购买记录的总数是990002个,而噪声阈值是20。
而商品总数是41276个。
这个问题就是数据挖掘中的长模式挖掘
你可以想象难点在哪了-------组合爆炸,候选项实在是太太太太多了。
即使是一些高性能的模式挖掘算法如FP-Growth,面对此类问题也会跑得跟乌龟一样慢(FP-Growth不用检验候选项,它面对此类问题跑得慢主要是因为面对这么大的数据,如此低的噪声阈值会让他的FP-TREE出奇地大,不仅构造这颗TREE花费大量时间,而且可能内存不够用,这些不用了解,只要明白这是个很棘手的问题就好了。)
那么,解决此类问题,目前能想到的最经济实用的办法就是进化算法(PSO, GA and so on )
比如遗传算法,生成一堆长度为20的基因, 其中每个染色体代表一个商品,通过他们的支持度(同时被购买的次数),选择,淘汰,交配,变异,如此往复,在过程中把符合条件的基因存起来作为输出结果。
我曾经水过一篇这个方向的论文,不过用的不是遗传,是二元粒子群算法(BPSO)
Frequent item sets mining from high-dimensional dataset based on a novel binary particle swarm optimization
我的GitHub上分享了一个自己做的该算法的Python包pybpsohd.pyd,和一个用GA解决此类问题的包pyarmga.pyd,都是c++写的,有兴趣可以一起交流交流
DMDarkness/Data-mining
■网友
谢邀,但是这块技术没接触过。帮你再腰几个人。
推荐阅读
- 子良说汽车|崔克“唯一”的车型?TREK Domane进化史
- 求各位推荐一个性价比高的游戏本预算在10000以内
- 当前云计算服务公司如果判断其价值
- 汽车|谁说没有天生聪颖?小鹏P7增“剪刀门”、G3i再进化!
- “理性”是决策和选择中的最优解吗解析非理性的理性集合能否覆盖全部非理性怎样看待AI进化之路
- 数学专业学生 想申请计算机的phd或master 尤其对云计算产业感兴趣 请问有啥书籍推荐。
- 赛车|是什么让F1车手死里逃生?以生命为代价的F1安全配置进化
- 超级试驾|全面进化抢鲜试驾全新一汽奔腾B70
- 自己打算在家附近加油站旁边开一家洗车店,怎么样更好的拉客源
- 汽车|伴你同行80年 哈曼的智能座舱进化论
