运维数据:建设与落地AIOps的基石

自全球著名IT咨询机构Gartner在2017年正式提出AIOps以来 , 国内外各个企业与厂商都在积极探索与尝试利用大数据、机器学习技术来改进和增强传统IT运维能力(如在监控、自动化和服务管理等方向) 。


运维数据:建设与落地AIOps的基石

----运维数据:建设与落地AIOps的基石//----

关于AIOps , 业界有很多的定义和解释 , 但笔者在2019年底参加Gartner全球IO大会时 , 分析师CharleyRich一语道破了本质:“智能运维另外一个名字就是数据分析;(MynameisAIOps,butyoucancallmeDataAnalytics……)” 。 所以 , 拨开迷雾 , 除了各种各样数据应用场景、高深复杂的算法和酷炫的可视化 , 其最基础的部分就是数据——运维数据是构建和落地AIOps的基石 。

运维数据驱动AIOps成为必选项

业务增长速度快、架构复杂度指数级升高 , 带来的是运维数据的极大变化 。 传统运维数据一般仅涉及到底层基础设施以及部分应用 , 但是在以用户体验和业务结果为核心的外向型运维管理模式下 , 运维数据的边界已然被打开了 。

现在的运维数据不仅包括面向多层技术栈的各类参数与文件 , 同时还包括了各种用户体验的数据以及与企业休戚相关的核心业务质量KPI等 , 如下图所示 。


运维数据:建设与落地AIOps的基石

----运维数据:建设与落地AIOps的基石//----

面向全栈的运维数据

运维数据:建设与落地AIOps的基石。运维数据的另外一个特点是数据类型的多样性(Variety) , 可分为时序型指标、追踪(关联)模型、日志数据、配置管理数据、告警事件、工单数据和运维知识/运维知识图谱等类型 。

运维数据边界的开放 , 同时意味着数据量的极速暴涨 , 以某大型企业运维部门的数据为例 , 在2017年数据处理量稳定在150亿条/天 , 2018年的数据是800亿条/天 , 而到2019年中处理量已经达到了惊人的2000亿条/天 , 数据洪水带来价值挖掘成本也越来越高 。

运维监控另一个突出特点是问题发现的敏捷性 , 故障发生的同时就要根据数据实现事件的产生与消息通知 。 因此大部分运维数据都是流式数据 , 数据的价值随着时间的流逝而降低 , 因此必须实时计算并给出秒级响应 。

运维监控最核心任务之一就是对业务应用的故障预防、定位与处置 。 而在处理突发故障时 , 现有工具和解决手段存在效率低、不准确、不及时的问题 , 因为我们面向的IT环境架构比以往规模更大、复杂度更高、海量数据的挖掘更困难 , 而处理海量、实时、多样的数据并产生高价值的工作恰恰是机器学习的特长 。 因此 , 利用机器学习等AI技术对运维数据进行处理的AIOps , 成为运维发展的必然走向 。

面向智能运维的数据体系方案

落地AIOps战略 , 一方面要强调运维数据的基础作用 , 另一面要形成运维数据治理与应用的全局体系 , 围绕规划、系统与实施三个阶段 , 面向运维数据的全生命周期与业务导向结果 , 从数据的整体规划、运维数据源、数据采集、数据的计算与处理、指标管理体系规划与实施、专业运维数据库的建立以及数据的典型应用场景等多角度着手 , 如下图所示 。


推荐阅读