运维告警管理规范(运维监控告警分类)

来源网友投稿 645 2023-01-17

本站部分文章、图片属于网络上可搜索到的公开信息,均用于学习和交流用途,不能代表睿象云的观点、立场或意见。我们接受网民的监督,如发现任何违法内容或侵犯了您的权益,请第一时间联系小编邮箱jiasou666@gmail.com 处理。
本篇文章给大家谈谈运维告警管理规范,以及运维监控告警分类对应的知识点,希望对各位有所帮助,不要忘了收藏本站喔。 今天给各位分享运维告警管理规范的知识,其中也会对运维监控告警分类进行解释,如果能碰巧解决你现在面临的问题,别忘了关注本站,现在开始吧!

本文目录一览:

运维告警管理——告警的灵活分派

当下运维人员的一大头疼事,便是复杂而凌乱的告警,无法将告警信息进行灵活分类,通知给不同的人,这样就加大了 IT运维 人员对告警信息的判断难度,进而无法快速的的定位到根因,也就无法快速的解决问题。

睿象云 智能告警 平台Cloud Alert(简称CA)快速接入各类事件,通过人工智能算法自动发现、诊断、修复IT系统运行事故,并能帮助企业形成最佳事件管理流程,让业务运行更加安全可靠;

灵活的分派策略:

在CA的分派策略当中,用户可以根据不同的应用,选定不同的筛选条件,将条件相结合,让指定的告警通知到特定的人;例如:在zabbix应用中,用户可以选择告警级别、告警内容、主机、服务、告警对象、hostgroups、applications等筛选条件,将告警条件相结合,使得告警通知到的人。用户也可以选择将告警通知到组、排班、钉钉、企业微信等协作通知方式;为了防止重要的告警遗漏,CA平台也推出了分派升级策略,当告警在用户指定的时间内未被认领或关闭时,会通知到第二负责人,同样的也可以设置第三、第四负责人,以此类推。

功能详情见视频: http://video.aiops.com/CA.assignment.mp4

更多功能欢迎登陆睿象云官网进行体验~

如何才能做到对告警通知有效管理?

其实在一线运维工作中运维告警管理规范,常常是福不双至运维告警管理规范,故障不单行。每有运维问题发生运维告警管理规范的时候,往往会密集发生多个告警。当这些告警来袭的时候,一线运维人员要针对它的类型、等级、告警对象和内容等进行检查并选用合适的方法来应对。

告警等级较高时,比如持续出错的应用告警,在查验后会立即分派通知相关的负责人在第一时间开具事件工单,做对应的流程追踪;而遇到低等级或次要的系统告警,则可以暂缓处置,留作观察。

传统的处置方式需要用经验来判断问题的影响范围和严重性,再通过人工进行派单以及通知下游处理人员,这样效率低下,无法满足现今业务响应速度的要求运维告警管理规范了。

究其原因,有些周期性发生的高频问题,往往并不是最棘手的,是可以延后处置的。反而偶发的问题,比较需要特别关注(如果这是原始定级较高的故障,更应该第一时间关注)。

所以,在告警发生的时候,可以使用告警优先级推荐算法来分析处理问题。根据规律特征进行判别,看是否需要立即关注。再配合自动化工具,将推荐等级与原始等级都高的告警加上筛选规则,进行自动化开单处置。发现推荐等级与原始等级有背离的部分,可以筛选出来做复盘,对告警原始的等级进行优化,或者转化成升降级的规则逻辑来处置告警等级。

对于告警系统的运维,需要注意哪些点?

告警系统作为运维部门的哨兵,对故障告警起到至关重要的作用,有时候几分钟的差距就会造成大量的损失。

1、 所以告警系统必须足够稳定

告警系统绝对不能宕机,否则等于瞎子,失去了对告警的实时性监控。同时告警消息不能阻塞,对于日志、指标等关键数据的告警生成处理也不能缓慢。

2、应对可能存在的告警风暴

有时候,一旦出现异常情景,往往会带来告警风暴,这时候对告警系统通道就有很大的压力,轻则阻塞通道,重则服务宕机。

3、解决告警通道的资源有限的问题

目前告警一般都是通过微信、短信、电话、钉钉,集中方式发给运维负责人,其中微信、钉钉都涉及到资源使用上限,一旦消息发送这类配额耗尽,那么等于告警通道彻底断掉,也就无法及时告警。

对这类问题,可以提前做好扩容工作,尽可能的提升钉钉、微信通道每月发送信息上线。

类似短信、电话这类的方式,使用次数直接和资金挂钩,一个告警风暴下来,往往及时几千倍的费用,非常恐怖。

对于以上情况,也可以对已发送的信心数据进行统计,在剩余配额不足10%的时候,发出资源不足的预警。

同时对于每种告警设置或者每个被监控的业务系统做内部消息配额设置,超过配额一样发出预警。

4、灵活的通知方式

一般告警发送后,都可以通过不同的渠道告知客户,但是如果遇到发送通道堵塞(例如微信配额不足,邮件发送不出去),系统应该具有自动切换发信通道的能力,一般可以事先设定候选优先级,例如微信不行了,就发送钉钉和电话。 关于运维告警管理规范和运维监控告警分类的介绍到此就结束了,不知道你从中找到你需要的信息了吗 ?如果你还想了解更多这方面的信息,记得收藏关注本站。 运维告警管理规范的介绍就聊到这里吧,感谢你花时间阅读本站内容,更多关于运维监控告警分类、运维告警管理规范的信息别忘了在本站进行查找喔。
上一篇:aiops运维实例(aiops 自动化运维)
下一篇:智能安防产业未来的应用及技术趋势
相关文章

 发表评论

暂时没有评论,来抢沙发吧~