超大数据量,怎样加快写文件的速度( 四 )




超大数据量,怎样加快写文件的速度


图7 挑战2 基础设施跨越式变更
● 挑战3:系统扩展性要求高
如图8所示,批量业务其中一个特征就是有固定的执行时间窗口。新一代系统要求可以通过扩展,同等时间提供当前业务量三倍的支撑能力。业务量是根据“项号”到“料号”核销业务试点范围而增加的,监管部门第一阶段将在有限范围内试点精细化核销,一旦成功将迅速拓展范围,其业务三倍增长将是阶梯式增长,并非平缓增长,也不会留给软件系统调整的时间。因此,构建此类系统,必须从设计阶段就做好相应准备。


超大数据量,怎样加快写文件的速度


图8 挑战3 系统扩展性要求高


超大数据量,怎样加快写文件的速度


解决方案

项目预算、实施周期固定,需要在现有条件下,综合各类因素给出最佳方案。而关系型数据库运行在小型机,虽然原系统负载较高,但如果做优化,尚有相当潜力可挖,如果将原有小型机上的单机多线程实现业务全部使用存储过程实现,即批量业务全部下沉到数据层,将有效节省开发成本。
但此方案经过模拟测试,其支撑能力有限——仅能支撑现有1.5倍业务量,随后,除升级硬件外,并无其他扩展方案。另外一个途径就是将业务上移至应用层实现,通过分布式并行计算技术,将业务由多台计算机处理,原有数据库,由于不再需要执行批量业务的存储过程,专职负责数据读写及事物,其承载能力相比之前还会有相当的提升(如图9)。分布式并行计算可以很好适应虚拟化部署,提供足够处理能力,扩展性极佳,但采用分布式并行计算技术也会带来一些问题,譬如并行业务开发较复杂,部署,运维也会相对较难。


超大数据量,怎样加快写文件的速度


图9 分布式并行处理
分布式计算技术解决方案
综合衡量利弊,我们最终选择了基于分布式并行计算技术的解决方案。项目时间紧迫,显然不能从零开发一款分布式并行处理平台,选择开源或商业产品是最佳选择。我们遴选若干款可以用于批量业务分布式并行处理的产品或方案,进行了横向对比。针对采用分布式并行处理方案带来的开发、部署、运维方面的成本和问题和解决当前问题的需求,我们将并行批量处理平台选择标准归结为以下七个方面:业务开发、作业调度、集群部署、高可用性、故障处理、逻辑更新、运维监控。各维度考量标准如表1所示。
表1 各维度考量标准

超大数据量,怎样加快写文件的速度



超大数据量,怎样加快写文件的速度



超大数据量,怎样加快写文件的速度


如图10所示,业界可用的开源项目、解决方案并不丰富,我们也进行了一定的评估,但或多或少存在一些问题。如果基于开源项目改造,也可以达成项目目标,但项目周期并不允许我们这样做。

超大数据量,怎样加快写文件的速度


图10 开源框架分析


推荐阅读