以往,我们在做监控的时候,其实是以一个技术人的视角在发现我们系统运行中的故障。但有时候系统运行的很好,线上业务却出现了大规模的用户流失、业务流程不可用、数据错误甚至在金融业务中最可怕的“资损”等现象。
为了解决这个问题,我们需要换一种思路,从目前大家主流关心的机器、网路、服务实例中抽出来,来看看发生了哪些事情会对业务和用户产生最大风险的,然后再从风险出发,去分析我们系统哪些地方能够感知这些风险,最终进行风险的预警和拦截。为此,我们建立了一套新的基于业务风险的监控体系,以及配套的一系列监控平台。这些监控平台在实现时的思路和有趣的小创新也会在这次演讲中分享。
最终,在这套监控体系完成并且全部业务实践后,线上问题 P0 问题得到了一个明显的收敛,下降了60%,且我们观测的由监控召回而避免的 P0 问题数,业务效果明显。
演讲提纲:
- 转换思路:系统没故障,线上真的稳定吗
- 基于业务风险的监控体系
- 以金融业务举例的风险类型
- 基于业务风险梳理监控体系的方法论
- 服务业务风险监控的监控平台体系
- 基于时序数据的异常检测平台:画骨智能监控平台
- 基于异常插入的报警策略回测
- 大范围报警策略量化评估
- 基于增强学习的报警策略智能推荐
- 低代码的数据校验平台
- 基于知识库的问题定位组件平台
- 实践效果及总结
你将获得:
- 从一个新的视角看待监控
- 一套基于业务风险梳理监控体系的方法论
- 在监控系统搭建中,一些利用到机器学习的实用的思路