我想问一下有关KDD Cup2012的问题,我下载了tencent给出的数据,我怎么样做前期处理呢为了做聚类分析。

你下的应该是track1数据,这个数据量已经超出一般统计软件可处理的范围了。python是一个解决办法,但根据你的情况,建议你用mysql+navicat进行处理(原因:安装使用相对简单,加好索引处理几百万级数据速度还算可以),具体教程百度一下就可以
■网友
你问题太多完全没有基础,给你指条明路吧——python。
■网友
筛数据是必然的,不然你就一个训练集一个测试集没法重复测试,筛的办法随机就行还有你有些算法根本不用去试,像协同过滤这种算法真的没问题吗?KDD是2GB的大数据训练集+1GB的测试集,你用协同过滤就算放在sqlserver里跑要跑出预测报告运行起码也得1个小时以上,微博数据都是即时增长的,这种低效算法还没等你算完新数据已经更新了,考虑其他方法吧只会matlab也不是不能做,把训练集缩小以后csv直接导入,不过估计性能不行(我没试过,但有同学用matlab跑movielens数据跑了8个小时才跑完),一般这种情况数据导进数据库系统用数据库处理,如果你不会数据库的那就用C写效率高,matlab我一般拿来做闭环仿真用,用来做大数据处理不是很适合
■网友
你好,可不可以请你把数据集发我一下,我急用但是下载不下来~邮箱ligongpsfuture@foxmail.com,非常感谢


    推荐阅读