CSDN原来 Kylin 的增量构建,大有学问! | 原力计划( 二 )
- 在进行增量构建时 , 将增量部分的起始时间和结束时间作为增量构建请求的一部分提交给 Kylin 的任务引擎
- 任务引擎会根据起始时间和结束时间从 Hive 中抽取相应时间的数据 , 并对这部分数据做预计算处理
- 【CSDN原来 Kylin 的增量构建,大有学问! | 原力计划】将预计算的结果封装成为一个新的 Segment, 并将相应的信息保存到元数据和存储引擎中 。 一般来说 , 增量部分的起始时间等于 Cube 中最后一个 Segment 的结束时间 。
本文插图
2、 设置日期范围创建 Cube 结束后 , 在 build 时设置计算数据的日期 。
本文插图
注意事项注意构建 Cube 时 , 选择的分区时间为 , 起始时间(包含)、结束时间(不保存) , 对应了从 Hive 从获取数据源的条件 。 3、查看Segment第一天同步成功
本文插图
接着我们想再计算下一个日期的数据:
本文插图
第二天同步成功
本文插图
根据层量同步方案 , 得出一个结论:每天生成一个 Segment , 一年就有365个 Segment。 当用户查询时 , 系统不知道数据在哪个 Segment 中 , 所以需要扫描所有的 Segment(扫描356个表) , 扫描多个表/多个 Segment 会降低数据查询效率 。 【增量方案带来的问题】补充:文件越多效率越慢 。
- 1个文件10G和10000个文件共10G 读取一个文件更快(寻址开销、频繁发开关闭)
- 一个文件夹内的文件特别多 , 这个文件夹打开的时间就会特别长 。
- 当系统越来越慢 , 越来越慢 , 越来越慢 , 越来越慢,有可能是某一个目录中的数据没有及时的清空或删除 。
推荐阅读
- 小畜播报|于小彤陈小纭疑似分手?删除动态,原来早有预兆!
- 小逗搞笑|这姑娘原来是打算跳水的
- 再看清你本来的面目,说你原来是这样的人,我对你的感觉大概就是
- 三星手机|为什么三星手机,在我国越来越没市场了?原来这是必然结果
- 『恒星』北极星原来是个“三体”,3颗星都比太阳大,最大的能装5万多太阳
- 游戏圈那点事|元气骑士巨弓巨斧视觉惊人!原来凉屋爱玩这一类 它还很实用
- LOL|凭什么The shy以魔封神?直播细节揭秘英雄心得,原来你也可以!
- 海南农家水井出现大量桃花水母是怎么回事?什么情况?终于真相了,原来是这样!
- 银行被骗9300万|银行被骗9300万是怎么回事?什么情况?终于真相了,原来是这样!
- 张翰|张翰工作室否认与郑爽复合是怎么回事?什么情况?终于真相了,原来是这样!
