
“我们的运维自动化做了很多年了,每年都在投钱,但到底做到什么程度了?”
“隔壁银行说他们已经到L3级了,我们怎么判断自己到了哪一级?”
“等保合规要求越来越高,领导让我们做个运维成熟度评估,怎么评?”
这些问题,几乎是每个运维负责人心照不宣的困惑。干了这么多年运维,花了这么多钱,到底怎么衡量自己的自动化水平?怎么规划下一步的方向?
超自动化运维的成熟度模型,就是为了回答这个问题。
要理解超自动化运维的成熟度,首先要看清运维本身的发展历程。我国数据中心运维大体经历了四个阶段:
第一阶段:手工运维阶段。 信息化发展初期,所有运维工作全靠人工完成,依赖个人知识、技术及经验。运维人员一旦出现问题,全面影响企业运行。
第二阶段:流程化、标准化运维阶段。 当运维业务量增长超过人力增长,企业开始建立运维流程,通过制度化、标准化运作,规范不同人员的操作差异。巡检报告质量水平基本一致,降低了对人的依赖。
第三阶段:平台化、自动化运维阶段。 利用DCIM等平台工具,把可复用及标准化程度较高的工作梳理出来,用算法整合实现自动化运维,对执行过程进行监管。当前我国大多数数据中心正处于这一阶段,呈现平台化、自动化、可视化的典型特征。
第四阶段:智能运维阶段。 通过全方位监控系统感知并准确定位故障,通知智能决策系统下发变更、维护等指令,实现运维从数据输入到预测性维护全过程的数字化,呈现出无人化、智能化、数字孪生等特征。
超自动化运维的成熟度模型,借鉴了汽车自动驾驶的分级思路——从“全部人工”到“完全无人驾驶”,逐级递进。参照中国信通院提出的数据中心设施自动化运行能力分级,超自动化运维可分为五个等级:
L1级——运行辅助(人工为主,设施辅助):实现数据的监控采集,具备设施及系统的故障报警能力。当前行业内大量企业处于这一级别,有告警系统,但发现问题后全靠人工处理。
L2级——部分运行自动化(设施为人工辅助):由人主责,设施辅助共同完成任务。无论设施完成程度,始终以人作为主责方。自动化工具开始介入,但运维人员仍然是“驾驶员”。
L3级——有条件运行自动化(设施主控,人工辅助):实现半自动运行和远程控制,故障后的应急操作可在设施半自动模式下完成。初步解放了运维人员的脚、眼和手——不再需要现场巡检,远程即可完成大部分操作。
L4级——高度运行自动化(设施全自动化运行):可预测系统和设施劣化趋势及故障,能基于自动化调控措施实现极致能效,初步解放运维人员大脑,在较长时间内允许无人在场。故障发现、分析、处置逐步自动化,日常运维接近“无人化”。
L5级——完全运行自动化(无人运行):设施全自动运行、调度、预测,不期望人进行干预,特殊情况下可由运维人员远程接管,做到现场无人值守。
成熟度评估不能只看“自动化覆盖了多少”。一个完整的评估框架,应该从五个能力域和多个过程域进行全面衡量:
设备管理能力域:评估设备监控、告警管理、设备状态管理、设备健康度管理等方面。是否实现了全覆盖监控?告警是否智能降噪?设备健康度是否有预测模型?
流程管理能力域:评估维修、维保、巡检、演练等关键活动。巡检是否实现了自动化全覆盖?应急预案是否可自动执行?
质量管理能力域:评估风险管理、事件管理、问题管理、资料文档管理等方面。事件响应是否流程化?问题根因分析是否自动化?
资源管理能力域:评估能效管理、容量管理、资产与配置管理等方面。资产配置是否自动发现、自动更新?容量规划是否有预测?
人员与组织管理能力域:评估供应商管理、交接班管理、培训与考核等方面。人员技能是否匹配自动化水平?组织架构是否支持转型?
在具体的评估方法上,可以参考以下可量化的里程碑指标来判断所处阶段:
评估维度 | L1-L2(基础级) | L3(稳健级) | L4(先进级) | L5(引领级) |
|---|---|---|---|---|
自动化覆盖率 | <30% | 30%-70% | 70%-90% | >90% |
巡检自动化率 | 人工为主 | 部分自动化 | 全覆盖自动 | 智能化自愈 |
故障处置方式 | 人工响应 | 半自动辅助 | 自动闭环 | 预判式免疫 |
合规审计 | 人工记录 | 半自动报告 | 自动合规 | 操作即合规 |
人员参与度 | 全程人工 | 远程监控 | 无人值守 | 自进化运行 |
超自动化运维不是一蹴而就的。从L1到L5,每一个等级的跃升都需要清晰的规划、扎实的投入和持续的迭代。
关键是要先知道自己在哪,才知道下一步往哪走。 对照成熟度模型,给你的运维体系做一次全面“体检”,找到差距,明确路径,才能真正从“人工硬扛”走向“无人驾驶”。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。