超大数据量,怎样加快写文件的速度( 二 )



银行证券:账户结息、日终结算、资产托管业务(清算、核算、估值、监督) 、信用卡出账;保险公司:签单、理算、轧账、分红、稽核等;福利彩票:投注开奖处理;社会保障:应收核定、应付核定、批量划款;智能交通:车牌、车型、颜色分析、车辆轨迹分析、车辆流量分析;智慧教育:学生考试成绩报告分析;电信运营商:月账单计费、扣费;基因测序:基因序列对比;数据交换:海量数据ETL、清洗转换。

超大数据量,怎样加快写文件的速度


图1 批量业务典型场景


超大数据量,怎样加快写文件的速度


批量业务面临新的挑战

随着云计算、虚拟化应用渐渐成熟,以及信息安全、自主可控等信息化建设理念的出现,政企应用的架构及基础设施正在经历着变革,越来越多的政企应用开始使用互联网技术,采用国产化中间件,并部署在云、虚拟化、x86架构的基础设施上。这场变革中,政企应用都需要应对将原有部署在大型机、小型机等专有设备的各类系统迁移到云、虚拟化、x86环境所带来的各类挑战。对于政企应用中广泛存在的批量业务而言,迁移面临的挑战尤为艰巨。
由于业务量大、业务时间窗口有限,现有批量业务大多使用大型机、小型机等专有设备,或使用存储过程运行于专有设备的数据库中,如果直接部署至云、虚拟化、x86环境,直接面临的就是云、虚拟化、x86环境单体处理能力严重下降,导致业务无法正常完成的问题。


超大数据量,怎样加快写文件的速度


分布式并行计算技术

为解决这个问题,采用分布式并行计算技术无疑是一个上佳选择,通过多机并行处理方式,既可以解决单体处理能力不足的问题,还可以充分利用云、虚拟化、x86环境资源弹性供给,扩展便利的优势,使批量业务处理系统具有较高的可靠性和极强的扩展能力。
分布式并行计算技术起源于科学计算领域,随着云计算、虚拟化等技术的广泛应用,分布式并行计算技术应用的领域得到了极大的扩充,大数据处理领域的Hadoop、Spark就是典型的分布式并行计算技术的应用实例。相关领域如流计算、交互查询、图计算都是近年来十分活跃的领域,各类开源框架、商业产品也十分丰富,如图2所示。


超大数据量,怎样加快写文件的速度


图2 分布式并行计算技术


超大数据量,怎样加快写文件的速度


案例背景

纵观现有的分布式并行计算技术的各类框架产品,其主要面向的场景是大数据处理,对于政企应用中广泛存在的批量业务却关注不多,可以应用的框架、产品更是凤毛麟角。一款合格的政企应用产品,除了解决海量批量业务快速处理的问题之外,还需对批量业务开发调试、批量处理系统部署、运维、调度、故障处理等多方面提供充分的支持,这样才能满足政企的需要。本案将从一个政企应用批量业务面临的挑战入手,分析采用分布式并行处理架构决策的过程,分析构建批量业务处理平台应考量的因素,并分享我们的经验。
如图3所示,某系统负责全国加工贸易出口业务。加工贸易是指经营企业进口全部或者部分原辅材料、零部件、元器件、包装物料(简称“料件”),经加工或装配后,将制成品复出口的经营活动。我国现行的法规规定对进口料件实施监管下的暂缓缴纳各种进口税费的制度。即加工企业料件仅记账,不缴纳税费,出口成品后,说明成品和料件对应关系,实现“核销”。


推荐阅读