运维数据:建设与落地AIOps的基石( 二 )


运维数据:建设与落地AIOps的基石

----运维数据:建设与落地AIOps的基石//----

【面向AIOps的数据体系建设】

面向未来的基于数据驱动的运维管理模式将以主动、集中、业务价值为核心 , 构建一种颠覆传统运维的全新管理方法:

●从IT系统的各个对象 , 以及现有监控工具中获取全量 , 海量以及多样的运维数据;

●将指标、事件、告警、日志、工单等各类运维数据在运维大数据系统上进行统一存储与处理;

●通过机器学习和先进的运维场景分析方法 , 主动识别和响应数据模型潜在的问题 , 评价IT基础设施和应用对于业务运营的影响 。

运维数据:建设与落地AIOps的基石。数据作为企业的核心资产 , 提升数据分析能力、数据决策水平以及数字化运维效能 , 努力营造“基于数据说话、基于数据管理、基于数据决策”的工作氛围是数字化转型的行动方针 。

对于运维团队 , 面向不断变化的业务与极速挑战 , 更要用“夯实数据基础 , 提升数据质量 , 稳步推进数据应用”作出表率 。 借助新的运维数据管理模式 , 能对IT系统以及业务进行高效精准的管理 , 辅助故障根因分析 , 有效降低MTTD(MeanTimeToDetect , 平均故障检测时间)和MTTR(MeanTimeToRestore , 平均故障恢复时间) , 并大幅减轻运维工作压力 , 显著降低成本 , 不断提升服务质量和用户体验 。

运维数据的典型应用场景

所有运维数据的智能运维场景 , 都是AIOps本身的应用场景 , 这里用问题发现、智能告警、故障诊断、数据预测等几个典型场景进行举例说明 。

(1)智能异常检测:企业IT系统规模的扩大、运维环境的复杂化、监控数据量的海量增长 , 使得运维人员从海量的数据中发现问题的难度也越来越大 。 而智能异常检测通过基于历史数据模型的异常检测等方法 , 能够自动、实时、准确地从监控数据中发现异常 , 为后续故障的分析与处理提供基础 。 根据对象的不同异常检测可划分为数据源异常检测、文本异常检测、数据源异常检测 。

(2)智能异常预测:在实际的运维过程中 , 故障往往不是独立存在的 。 海恩法则告诉我们 , 任何不安全的事故都可以预防 。 智能异常预测通过对重要特性数据进行预测算法学习来实现故障的提前诊断、从而避免损失 。 故障预测的典型场景包括:磁盘故障预测、网络故障预测以及内存泄露预测等 。

(3)故障关联分析:在运维过程中 , 各类监控工具每天会产生大量冗余的告警 , 而这些告警之间可能存在一些关联 , 只有找到产生告警的根本原因才能快速、有效地对故障进行处理 。 关联分析可以用于发现隐藏在大型数据集中有意义的联系 。 在智能运维中 , 我们通过对历史数据的学习和分析 , 发现有意义的关联数据 , 再通过对关联数据的分析建立业务与硬件的拓扑关系 , 从而实现故障的提前预警以及根源分析 。

(4)故障根因分析:对故障进行根源分析是在众多可能引起故障的因素中 , 追溯到导致故障发生的症结所在 , 并找出根本性的解决方案 。 利用机器学习或者深度学习的方法 , 我们可以找出不同因素之间的强相关关系 , 并利用这些关系 , 推断出哪些因素是根本性的因素 。 故障根因分析可以帮助用户快速诊断问题、提高故障的定位速度以及修复效率 。


推荐阅读