来源:鑫智奖·2026第七届金融机构数智化转型优秀案例评选
获奖单位:恒丰银行
荣获奖项:智能运维创新优秀案例奖
一、项目背景及目标
运维数字化和智能化等新需求难以用传统运维方法解决,需要跳出现有模式,用新的角度和与之相适应的运维理念去解决。行业内运维工具平台化建设成为共识,呈现自动化和智能化趋势。运维数智化平台将运维经验和知识标准化并沉淀到运维平台,解决竖井化建设模式弊端,促进运维自身的数字化转型。
(1)构建自动化巡检,建设可扩展多模态的自动化巡检模型;
(2)整合分散数据,建设“运维分析集市”,以规范分析+集中存储支撑数据驱动决策;
(3)赋能运维中心,以智能手段提高自动化与资源调度效率,落地容量预测等智能场景,推动运维从“人工操作”向“数据智能”升级,实现效能跃迁;
(4)引入AI智能体,通过多模态巡检+趋势分析,识别异常自动触发故障自愈,实现“检测-分析-处置”闭环。
随着恒丰银行数智化转型的加速推进,各类业务系统、IT基础设施不断迭代扩容,IT运维场景愈发复杂多元,对运维效率、响应速度、管控精度提出了全新的高标准要求。从银行业整体趋势来看,高效、智能、集约的一体化运维模式,已成为降本增效、保障业务稳定运行的核心刚需。当前迫切需要打破运维壁垒,实现运维流程自动化、运维数据一体化、运维管理智能化,解决运维痛点,支撑业务持续稳健发展。
当前业务系统复杂度与运维工作量呈现指数级增长,传统运维模式弊端日益凸显,已无法满足高效运营的发展需求,核心存在三大痛点:
一是运维入口分散,操作效率较低。运维系统数量繁多,工具建设呈现竖井化、烟囱化,平台相互独立,日常巡检、故障排障等工作需要频繁切换不同操作入口,操作流程碎片化、不连贯,不仅增加运维人员重复工作量,还增加人力运营成本。
二是数据孤岛突出,管理能力较弱。运维数据分散存储于各个独立系统,缺乏统一整合与共享机制,日常巡检工作依赖人工跨平台调取数据、手动汇总表格、线下登记记录,存在数据更新不及时、信息不一致、准确性难以保障等问题,无法为运维决策提供有效支撑。
三是人工依赖度较高,自动化、智能化水平不足。变更执行、配置下发、故障排查等核心运维环节,以人工操作为主,运维工作量大,因人为失误引发运维风险的风险高,制约故障响应与问题处理速度。
为破解传统运维难题,补齐运维管理短板,实现运维工作质量提升,特启动本项目,打造智能化、一体化运维管理体系,助力数智化转型稳步推进,实现运维模式全面升级,具体目标如下:
(1)构建全量自动化巡检体系
搭建可扩展、多模态的自动化巡检模型,实现服务器、网络设备、应用系统、数据库等全品类IT资源全覆盖。通过多源数据汇聚、融合AI智能异常检测技术,替代传统人工巡检,实现运维异常精准识别、快速发现,提升巡检全面性与时效性,降低人工巡检成本。
(2)打造一体化运维分析集市
整合分散的运维数据资源,建立高效、顺畅的应急信息快速同步机制,实现运维数据统一归集、分析、共享,打破数据孤岛,为故障处置、运维决策提供实时、精准的数据支撑。
(3)搭建统一脚本自动化平台
建设集中化脚本管理平台,实现运维脚本统一管控、自动化执行与配置精准下发。全面覆盖变更执行、配置下发、故障处理等重复性运维操作,推动运维工作自动化落地,提升运维操作准确率,释放运维人力,降低人为操作风险。
(4)形成智能应用系统画像
构建全面的应用系统运行画像,深度探索AI智能体应用、容量趋势预测分析、故障自愈、数字画像等智能化场景,实现运维工作从被动响应向主动预测、自动处置转变,全面提升运维智能化水平,保障业务系统稳定、高效、安全运行。
二、创新点
(1)数字底座破除竖井化:采用低代码技术架构实现各运维系统的高效串联与流程贯通,解决竖井化建设模式弊端,推动运维模式向集约化、一体化、数字化转型。
(2)AI智能体驱动闭环:对接AI智能体,基于历史数据与关联分析,实现多模态异常识别+智能决策提供,自动触发故障自愈。
(3)数据驱动决策:整合分散数据,建立“运维分析集市”,支撑实时监控与趋势预测,通过数据驱动预判系统风险。
三、项目技术方案
1.核心功能规划
运维数智化平台按照功能模块划分为运维数据集市、智能巡检平台、脚本自动化平台、智能系统画像四大核心模块,同时加强权限与安全管控,各模块协同联动,形成覆盖运维全流程的一体化管控体系。
(1)运维数据集市
运维数据集市是平台的数据核心底座,构建数据整合-分析-可视化一体化数据中台,为平台各项智能功能与管理决策提供全面、精准、实时的数据支撑。
①多源数据接入:全面对接应用监控平台、系统监控平台、日志管理平台、鲁班批处理调度系统、网络设备监控、运维自动化平台等各类现有运维系统,接入应用数据、交易数据、系统数据、日志数据、数据库数据、批量数据、网络数据、特色运行数据等多维度运维数据,实现数据全域汇聚。
②数据标准化处理:对接入的海量异构数据进行统一清洗、格式转换、去重整合与质量校验,消除数据冗余与误差,构建标准化、规范化运维数据资产库。
③分层存储架构:采用“实时存储+离线存储”双架构模式,既能保障实时数据(如系统指标、运行日志、实时告警)的高速写入与实时查询,又能保障离线数据(如资产台账、历史巡检记录、历史故障信息)的长期留存与批量分析。
④可视化与数据服务:提供资产概览、巡检状态、趋势分析、性能容量分析等多维度可视化报表,支持自定义报表配置、数据导出;支持按资产、时间、异常类型等多条件精准检索,实现运维数据全流程数据追溯,辅助根因分析。
⑤应急数据支撑:建立应急信息实时同步通道,优化数据架构,提升应急场景下数据调取效率,降低应急同步延迟,为突发故障处置提供实时数据保障。
(2)智能巡检平台
搭建可扩展、多模态的自动化巡检体系,融合AI智能异常检测技术,替代传统人工巡检,实现巡检工作标准化、自动化、智能化,全面掌握IT系统运行状态。
①全维度巡检指标:以应用系统巡检报告为例,指标覆盖交易成功率检查、交易量前十交易分析、系统交易量情况分析、日志及应用服务状态检查、定时任务或批量任务检查、数据库前十大表文件大小和表空间膨胀情况、表分区及序号自动计数检查、数据库表空间使用情况等核心运维巡检场景,实现运维关键指标全覆盖。
②自动报告生成:依托运维数据集市的巡检数据与巡检报告模型算法,系统按预设周期自动生成周巡检报告、季度巡检报告、重大保障与特殊时期专项巡检报告,自动推送至运维人员邮箱。
③巡检数据管理:支持用户自定义时间段查询、导出巡检报告,提供巡检结果统一视图,实现巡检信息快速检索、汇总与分析;搭建智能巡检看板,实时展示应用运行状态、异常告警列表、趋势预测结果等,直观呈现系统运行健康度。
(3)脚本自动化平台
建设集中化、标准化脚本管理与执行平台,实现运维操作自动化、流程化,减少人工干预,降低操作风险,实现故障智能处置与自愈。
①标准化脚本管理:搭建集中化脚本管理库,梳理并标准化运维原子操作库,实现运维脚本统一录入、审核、存储、版本管控,杜绝脚本混乱与违规使用。
②自动化流程管控:对接运维自动化平台,依托运维数据集市数据支撑,构建任务编排→专家审核→脚本执行→结果校验全流程自动化体系,支持一键变更发布、一键状态巡检,替代重复性人工操作,提升运维效率。
③智能故障处置:对接AI智能体,基于历史运维数据与关联分析算法,自动检测网络、应用、数据库、中间件等多维度运行状态,实现多模态异常识别、根因定位并生成分析报告;支持自动/手动执行异常应用实例重启、异常网络流量隔离等修复操作,实现故障自愈,保障业务系统持续稳定运行。
④工单闭环管理:异常故障触发后自动生成运维工单,精准推送至对应运维人员,支持工单自动流转、处置进度实时跟踪、处置结果自动回写,形成工单发起-处置-闭环全流程管理,实现运维任务可追溯。
⑤操作日志追溯:全面记录所有自动化操作的执行时间、操作参数、执行结果与操作人员,支持操作日志精准查询与全程追溯,为故障复盘、流程优化提供依据。
(4)智能系统画像
围绕企业级IT架构,构建全生命周期、多视角的智能应用系统画像体系,实现应用系统全方位精准管控,提升IT资产管理与运维管控精细化水平。
①多维度画像指标:建立覆盖架构完整性、风险合规完整性、自动化覆盖度、监控覆盖度、容量健康度、证书/秘钥健康度、资源记录完整性、知识完整性等核心指标的画像模型,全面反映应用系统运行与管理状态。
②协同绘制机制:搭建业务、架构、开发、测试、总装、运维多视角实例化的应用画像协同机制,依托运维数据集市中数据,通过线上化管理、自动化实施、人工补全相结合的方式,逐步完善应用画像自绘制、自更新能力,保证应用系统画像质量。
(5)权限与安全管控
平台采用严格的身份认证与权限管控机制,保障系统访问安全、数据安全与操作合规。
①统一身份认证:对接身份认证管理系统IAM,实现用户账号统一注册、认证、注销与管理。
②精细化权限分配:对接云平台配置管理数据库CMDB,获得用户与应用对应关系,依据“知所必需、最小权限、职责分离”的原则,实现用户权限最小化。
③智能权限模型:建立基于RBAC+ABAC模型的访问规则,实现权限精准映射与动态管控。通过梳理角色,划分人员职能与最小必要权限,实现权限映射,配置超级管理员、普通管理员、应用运维人员、操作系统专业人员、中间件专业人员、数据库专业人员等多类角色权限,确保菜单操作、数据访问权限与角色匹配,提升安全性与合规性。
2.技术架构
(1)核心架构理念:双平面隔离
本平台在网络安全层面划分为物理隔离的两个平面,以满足金融级安全运维要求:
①数据平面:
访问控制:面向办公网和生产网用户,通过单独域名访问。
功能定位:仅提供只读类、非敏感操作,如巡检报告查看、数据报表分析及大屏展示。
②执行平面:
访问控制:仅限生产运维区跳板机访问,独立域名在办公网物理不可达。
功能定位:负责网络故障自动化诊断(Runbook)、批量作业下发等高危执行操作。
(2)部署单元详细说明
①入口与转发层(Nginx)
数据入口:托管Vue3静态文件,通过特定的请求头X-Platform:inspect将请求转发至巡检主平台后端,实现菜单的平台级过滤。
执行入口:同样托管Vue3文件,将执行类请求转发至执行平台处理,并注入X-Platform:exec标识。
②业务逻辑层(核心后端)
数据主平台(Java/SpringBoot):基于若依框架,是整个平台的“大脑”。负责RBAC权限管理、审计日志、Token签发、定时任务调度(Xxl-Job)以及Linux服务器的直接运维。
执行平台(Python/FastAPI):专注复杂网络环境的执行逻辑。利用Netmiko适配多数厂商网络设备,通过WebSocket实时推送执行日志,并从Redis读取巡检主平台签发的Token进行身份验证,实现免登录跳转。
③数据处理与适配层
数据接入单元(Python):负责从APM、Zabbix、日志平台等外部数据源,通过API、文本、Excel或数据库直连方式采集原始运维数据。
数据运算单元(Java):消费数据接入单元采集的数据,执行复杂的聚合统计,并生成PDF/Excel格式的标准化巡检报告。
数据模型单元(Java):负责与行内CMDB对接,通过全量/增量机制将MongoDB中的非结构化资产数据转换为关系型数据同步至主库。
(3)基础设施与外部对接
①数据存储
GoldenDB:作为全局共享的主数据库,存储所有业务数据、执行记录和审计日志,支持业务逻辑层、数据处理与适配层的所有单元通过MyBatisPlus或SQLAlchemy访问。
Redis:承担Token共享、Session同步及数据接入单元、数据运算单元之间的任务队列职责,是双平面解耦而不失连接的关键。
②目标对象
服务器:Linux(由数据主平台通过SSHJ直接执行)及Windows。
网络设备:华为、H3C、Cisco等各厂商设备(由执行平台通过Netmiko引擎执行)。
(4)安全与合规亮点
物理级隔离:执行功能在网络平面上完全隐藏,黑客即使攻破办公网也无法触达执行引擎。
指令管控:所有操作必须经过数据接入单元指令库审核,配合数据主平台的多级审批流程,杜绝临时命令带来的风险。
四、运营情况
运维数智化平台已部分落地生产环境并持续迭代研发,整体运营成效显著。
在智能巡检领域,平台已完成与系统监控、应用监控等运维系统的数据汇聚整合,依托自动化巡检能力,实现对两万余台服务器的全域覆盖,每月自动生成标准化巡检报告2000余份。依托容量趋势分析实现智能预警,可提前识别并处置潜在风险,回收冗余配置的服务器资源,在降低运维风险的同时,有效减少资源浪费。
在自动化运维实施方面,平台完成网络设备与服务器资源深度集成,大幅提升运维执行效率与标准化水平,为业务稳定运行提供可靠支撑。
五、项目成效
运维数智化平台为恒丰银行内部自主研发的系统,聚焦内部运维业务需求,不参与外部市场竞争。平台上线运行后,有效支撑运维人员快速响应、高效处置各类问题,显著提升运维工作质效,降低人力投入与运维操作风险,减少因系统故障、服务中断带来的潜在经济损失与社会影响,为信息系统安全稳定运行提供坚实保障。
六、经验总结
在运维数智化平台项目建设与推广过程中,遇到诸多问题,积累了较为丰富的实施经验,也形成了可复用的改进思路。
项目建设阶段,采用敏捷开发模式,通过拆分小迭代、分步落地实施的策略,先上线基础能力,再逐步迭代完善核心智能功能,但仍然出现部分模块开发延期,后续项目实施计划中多预留10%缓冲时间,在关键节点合理增配开发资源,进一步降低开发延期风险,有效保障了平台稳步推进。
针对多系统对接场景,平台涉及运维系统数量多、接口对接复杂。虽前期已开展接口现状调研,但实际落地中仍存在对接难点,一定程度影响实施进度。后续同类项目将强化前期深度摸排,细化接口方案与对接流程,提前做好技术协调,最大限度避免工期延误,提升项目整体实施效率。以上两项导致工期短暂延误,在未来的项目实施中均应避免。
更多金融科技案例和金融数据智能优秀解决方案,请在数字金融创新知识服务平台-金科创新社案例库、选型库查看。
热门跟贴