研发背景
随着IT系统上云,传统运维模式面临挑战,主要体现在:
- 监控对象几何级增长:从几个到上千个,人力无法胜任。
- 调用承载关系复杂:从简单对应到极其复杂,需要引入运维工具。
- 分布式架构挑战:数据分片、异地存储,传统维护模式难以为继。
- 混合云挑战:IaaS/PaaS/SaaS层故障难以关联分析,快速定位。
- 云原生架构挑战:原有基于Oracle及传统架构的运维手段、经验不可用。
云上IT运维需求包括:
- 工具集市:支持低代码开发运维工具,形成工具集市并共享。
- 知识共享:建立企业级运维知识库。
- 关联监控:通过主数据治理,实现故障根因快速定位。
- AI注智:引入AI算法,实现动态告警阈值及故障趋势预测、关联分析、根因分析。
- 统一监控:按系统/场景/专业等维度,整IaaS/PaaS/SaaS的监控手段,实现全省IT系统监控统一纳管。
- 统一调度:固化常见故障自动化处理手段,探索实现故障自动发现、自动调度、自动修复;集中管控日常巡检等作业计划。
- 统一展现:建设可视化大屏,数据、系统可视监控赋能运维赋智运维生态。
从融合监控到智能监控
总体目标:构建云-网-业-数-安融合监控体系,实现统一采集、统一调度、融合云、融网、融平台、融AI。
总体架构:
- 六中心一门户:监控中心、智能监控中心、智能调度中心、AI中心、智能工具中心、智能知识中心、统一门户。
- 核心能力:统一门户、基础配置中心(CMDB数据源)、智能监控中心、智能调度中心、AI中心、智能工具中心、智能知识中心。
总体部署模式:
- 1+X两级部署:智慧运营大脑(SaaS版本)和行业运营大脑(私有化部署)。
- 平台部署:运营商侧集中部署或客户内网单独部署。
- 网络需求:SaaS版本无需客户侧提供服务器,行业运营大脑需客户提供主机等运行环境。
- 适用场景:使用电信天翼云、专线等云网融合产品的客户或安全保密要求高的客户。
配置中心:
- 整合多维监控数据源,CMDB主数据治理。
- 打通集团翼龙、省内主机、网络、日志、动环、业务等,汇聚整合142个系统、2545个SaaS指标、15753个PaaS指标、3631个IaaS指标,120个其他指标,共计2.2万余个监控点。
监控中心:
- 实现监控客户端统一,无需安装多个采集进程。
- 关联监控实施方案:建立数字孪生模型,实现跨IaaS/PaaS/SaaS的关联监控。
- 低代码大屏展示平台:搭建“1+N+1”架构,实现云/网/数/业/安等20余个大屏应用。
调度中心:
- 告警自愈:通过监控告警,智能匹配自愈规则,自动调度执行基于低代码开发平台服务编排的自愈能力。
AI中心:
- 动态阈值/故障趋势预测:引入统计检验、KNN、孤立森林等算法,实现动态阈值判单。
- 知识图谱:基于资产-事件的IT运维知识,构建全流程端到端监控图谱,实现告警归并和收敛、故障根因分析和快速定位。
- NLP自然语言交互:打造IT服务台智能问答机器人、微信告警通知、微信对话交互、微信告警自动语音外呼等多模态的运营交互能力。
- 企业大模型探索:利用ChatGLM实现IT运维规范等公文内容的智能搜索。
元宇宙:
- 打造云上第二监控现场,确保极端情况下IT运营监控安全不中断。
- 搭建元宇宙应用平台,打造元宇宙样板间,逐步摸索积累经验,为后续对外服务奠定基础。
应用案例:
- 某市卫健委融合监控:基于用户的整体云网部署架构,可视化呈现用户云网结构全貌,实现对多云资源、网络专线的一体化监控。
- 某市政务云融合监控:监控127平台宿主机和13个租户共242台云主机和漏洞情况,实现云内一体化的融合监控。
- 政府热线监控:对市民热线专线、云上主机及主要业务系统指标进行融合监控。