来源:鑫智奖·2026第七届金融机构数智化转型优秀案例评选
获奖单位:太保科技
荣获奖项:专家好评TOP10优秀案例奖
一、项目背景及目标
在国家对金融行业自主创新要求的大背景下,中国太保积极贯彻落实国家信创发展战略,以私有云的方式建立一云多芯的信创新云,为中国太保信创生态的稳健发展注入了澎湃动力。在全面支持信创的基础上,中国太保新云进一步建设的重点是提升信创环境下的保险应用业务连续性能力。
纵观历年监管对于业务连续性的要求,2019年银保监合并以后,监管对于保险要求与银行贴近看齐,2019银保监发29号文《银行业保险业突发事件信息报告要求》明确了重要业务中断30分钟作为突发事件上报。2024金融监管局11号文《关于加强银行保险机构重要信息系统运行的通知》,重要系统应至少满足具备同城和异地灾备能力,且大型机构同城或异地,应当具备完全接管并可长期运行主要业务的能力。
基于上述背景,有必要基于信创云进一步推进双活建设,一方面可以满足监管对于保险业务连续性的要求,另一方面可以减少业务损失,保证用户满意度,提升企业抗风险能力,保护品牌价值。
二、创新点
1.“8横4纵”业务高可用能力层次体系
业务角度高可用采用“8横4纵”能力层次体系,纵向为高可用级别,包括:数据中心级、机柜级、节点级和部件级。太保业务高可用双活能力建设目标为最高等级,即数据中心级;横向为每一个业务流程经过的关键路径,每个路径都需要做到高可用的层级。关键路径包括:数据存储层、数据库处理层、分布式中间件层、APP处理层、WEB接入层、安全防护层、负载均衡层/GSLB、互联网入口/核心网络层,每一层都由信创生态中的软、硬件构成。
2.“一个中心、四个支撑”双活建设方案
“一个中心”是指以应用系统双活建设为中心,实现重要业务及其强依赖业务系统做到数据中心级双活。“四个支撑”是指由信创双活云、混合云管平台、配套基础设施平台和业务连续性平台这四个方面提供双活支撑能力,为业务高可用各关键路径的双活实现提供平台级的解决方案。应用系统双活建设聚焦于“8横4纵”能力层次体系的APP处理层和WEB接入层的双活,并结合“四个支撑”共同实现各关键路径的高可用,从而实现整体业务的双活能力。
应用系统双活实现应用服务同时部署在同城两个生产中心,并且在灾备中心部署应用/数据容灾。应对单应用故障,可快速进行应用切换接管流量;应对单数据中心故障,可快速进行数据中心切换接管生产流量;应对城市级灾难,可跨地域接管生产中心流量。另外,在双活架构下,同城双中心可同时承担应用生产流量,能有效提高资源利用率。
信创双活云实现同城云平台底座和云产品的双活容灾架构,确保信创目录下计算、存储、网络、数据库、中间件、安全等服务具备金融级高可用的双活容灾能力。在此基础上,通过信创双活云面向保险业务应用赋能,为应用提供配套的双活云服务,结合应用双活改造实现完备的双活容灾能力。另外,信创双活云实现了同城双活,结合成都灾备云实现两地三中心的架构,为应用系统实现同城容灾、异地灾备提供了运行环境。
混合云管平台实现双活云以及多云多AZ的统一入口,为用户提供良好的操作体验,有利于资源的统一纳管和高效利用。
配套基础设施平台实现包括CMDB、监控、自动化运维等方面服务的升级优化,全面支持信创双活架构下的应用数据管理、运行监测、高可用运行和自动化切换处置需求。
业务连续性平台实现通过平台确保双活容灾演练和真实切换的有序、高效和安全执行。
三、项目技术方案
1.应用系统双活建设
按照两地三中心模式下太保应用部署原则“同城双活、同城容灾,异地灾备”进行应用系统双活建设,通过大同城满足业务连续性要求,通过小异地满足异地容灾要求。同城(部署业务同城双活和业务同城容灾)应对两个场景,一是应对单数据中心级灾难,通过流量切换快速接管双活业务,应用切换接管同城容灾业务,二是可应对应用级故障,通过应用主备切换接管生产流量,保障业务间的有效互访;异地(部署异地数据备份与应用异地容灾)主要应对城市级灾难时业务系统的异地恢复,另外承担一些特定应用的异地容灾接管。
应用系统双活建设的技术方案分为两类:传统双活和单元化双活。
传统双活模式下,应用跨数据中心部署,数据库、中间件、网络等组件跨数据中心组成双活、分布式或主备集群,两个数据中心的应用实例访问同一个集群;单元化双活模式下,业务分库分表,单元化部署在两个或以上数据中心,异构集群部署,每个数据中心是一个独立的业务处理单元。目前主推方案是传统双活模式,单元化双活方案业务改造量大,但是扩展能力强,故障仅影响局部,而且向多活模式演进简单,作为后续继续推进的技术方案。
2.信创双活云建设
信创双活云的建设中,数据中心1 AZ和数据中心2 AZ组成同城双活架构,并在第三数据中心AZ部署仲裁服务和部分云产品的分布式架构副本。三个AZ组成一朵云,三机房两两之间的光纤传输双向延时不超过1.5ms,绕行延迟不超过3ms。数据库、中间件等云产品通过三AZ分布式部署保障业务数据零丢失(RPO=O)。
信创双活云建设的重点是信创目录下各类云产品的同城双活容灾支撑能力以及数据中心机房级双活容灾能力,主要包括云平台底座和管控服务、应用发布、容器、微服务组件、计算资源、存储资源、网络产品、数据库、中间件、安全产品的同城双活容灾能力建设,以及跨数据中心网络故障容灾绕行、机房级双活容灾切换等方面,通过信创双活云对于“8横4纵”能力层次体系中各关键路径进行有力支撑。具体建设内容包括:
云平台底座和管理双活:数据中心1 AZ、数据中心2 AZ采用大规模底座,第三机房AZ采用敏捷型底座,各AZ底座属于同一朵云,构成双活容灾架构;在运维、资源、服务管理方面,两个机房各部署一套组件并形成双活,业务请求随机负载均衡到两个机房的服务节点,容灾的时候无需人工干预,由存活的节点提供服务;应用发布和容器方面,平台双机房部署形成双活;微服务方面,支持注册中心、API网关、服务治理、任务调度、动态配置、服务网格等组件的双活,单机房故障时不影响整体服务可用性。
计算、存储双活:服务器方面,双机房各部署一套集群,通过负载均衡调度对外呈现同一个VIP地址。单机房故障时负载均衡通过健康检查探测将故障集群摘流。另外也可以两边使用不同VIP地址,通过智能DNS将外部访问导入到两个数据中心机房,当出现机房级故障时在DNS解析中去掉故障机房地址;对象存储方面,双机房各部署一套集群,外部数据访问通过域名解析为同一个VIP,一个机房对外提供服务,另一个机房接收同步数据。单机房故障后进行VIP切换,前后域名不变。
网络双活:负载均衡和业务网关方面,服务节点部署在两个机房,通过配置大小段路由控制流量指向,单机房故障和网络孤岛场景下通过BGP协议自动收敛,把流量导入到正常机房;跨数据中心网络访问方面,当一个AZ网络出现故障时,流量可以通过另一个AZ绕行。例如当数据中心1、数据中心2之间网络中断时,网络流量可以通过第三机房AZ绕行,总体业务不中断。
数据库、中间件双活:支持多款关系型信创数据库(包括OceanBase、达梦、TD-SQL等)的双活容灾能力。OceanBase支持5副本或3副本架构部署在同城三个AZ,单AZ故障时,剩余两个AZ对应副本满足多数派,服务仍然可用。达梦支持在一个机房部署一套主备的数据守护集群,在另一个机房部署两个异步备机,同时采用确认监视器集群管理各节点主备切换关系,自动处理故障。TD-SQL支持两地三中心5副本部署方案,任意2台机器故障不影响整体服务使用;非关系型数据库方面,支持MongoDB同城容灾,在主、备机房采用3节点副本部署,单机房故障后通过容灾模块切换将Hidden节点提升为Primary节点;redis同城容灾方面,双机房各部署1套集群,共同组成1个逻辑上的集群。redis的访问链路经过负载均衡、Proxy再访问到redis数据库,主、备机房redis形成数据复制关系,并引入HA服务负责巡检和触发HA操作,单机房故障后将负载均衡切换到正常机房Proxy;消息队列同城容灾方面,双机房各部署一套RocketMQ集群,RocketMQ内每一对主备Broker被拆分在不同的机房,单机房级故障后将正常机房的Broker切换为主节点。
安全双活:安全方面典型的有WAF双活,两个机房WAF集群组成双活集群,WAF服务通过负载均衡进行访问,当一个机房故障时,WAF本身不需要任何操作,可以依赖负载均衡进行切换,将访问到故障机房的流量切换到正常机房负载均衡VIP上。负载均衡自动探测WAF服务可用性,对于故障机房WAF进行摘流。
3.混合云管平台、配套基础设施平台和业务连续性平台建设
在混合云管平台建设方面,通过统一门户实现多朵云运维入口的统一,同时对接不同时期建设的云,对外呈现统一的云平台入口和工作界面,为用户提供良好的操作体验,有利于资源的统一纳管和高效利用。另外,通过混合云管平台同时管理双活云下的多个AZ,对于双活资源和应用进行统一管理,有效提升双活场景下的资源管理和应用部署、发布效率。
在配套基础设施建设方面,升级优化CMDB系统,提升数据质量和数据服务能力,适配信创云双活应用架构的配置管理和数据关联;监控平台方面对于监控告警的覆盖面、可读性、优先级、及时性等方面进行全面治理,且结合双活容灾架构特点,为容灾切换提供有效的预警和判断依据;自动化运维方面,对于双活场景下的容灾切换提供自动化操作支持,结合CMDB的关联性数据和监控的业务探测能力实现精准的自动化切换和恢复。另外,实现基础设施平台本身的双活容灾能力,在灾难场景下确保平台本身的可用性。
在业务连续性平台建设方面,通过平台有序开展双活容灾演练,提升应急处理能力;通过平台对于双活容灾切换场景进行组织和编排,确保切换任务有序、高效和安全执行。
四、运营情况
在“一个中心”建设方面,应用系统双活建设聚焦在发生机房级不可用时,保证关键业务系统的关键交易链路仍然可用,实现了技术目标为同城机房级双活RPO为0、RTO<20分钟(双活业务开始切换到恢复时间小于20分钟),业务目标为重要业务及其强依赖业务系统做到数据中心级双活(即数据中心故障时,关键业务可实现数据中心级切换),应用业务连续性能力得到大幅提升。
在“四个支撑”建设方面,信创双活云实现了新云的同城双活容灾能力,目前已通过了包括机房级双活容灾演练、网络级双活容灾演练、云产品双活容灾演练、云管控面双活容灾演练等一系列双活容灾能力验证。通过演练已验证太保新云可以为应用系统提供信创生态下的计算、存储、网络、数据库、中间件、安全、应用发布、容器、微服务等各方面的双活支撑能力,为应用系统双活建设打下了坚实基础。混合云管实现了多平台多数据中心资源的统一纳管,支持双活集群和应用的统一部署,大幅提高了发布效率和安全性。配套基础设施平台和业务连续性平台的建设也取得了较大进展,通过CMDB、监控、自动化、双活容灾切换演练协同流程的优化,为应用双活容灾能力的实现提供了各方面的支持。
五、项目成效
截至2026年4月份,太保已完成信创双活云的建设,并推广集团和各子公司共24个应用系统实现信创双活上线,主要成效如下:
1.推动自主可控
信创双活建设是落实国家信创战略的重要实践,实现从芯片、操作系统、数据库到中间件、应用系统全面自主可控,摆脱对国外技术的依赖。
2.保障业务连续性,避免业务损失
通过采用“一个中心、四个支撑”的双活建设方案,实现了应用系统双活能力改造,构建了应用服务的同城双活容灾能力,满足了业务连续性要求和监管要求。通过双活架构实现RPO=0、RTO<20分钟,业务中断时间大幅压缩,有效避免因系统故障导致的业务损失。
六、经验总结
项目建设经验总结:
1.“8横4纵”能力层次体系是顶层设计,横向覆盖全业务关键路径(存储、数据库、中间件、应用、接入、安全、负载均衡、网络),纵向明确高可用等级(从数据中心级到部件级)。双活建设不能仅关注应用层或数据库层,必须形成“全链路、全层级”的能力矩阵,避免单点短板。
2.“一个中心、四个支撑”模式强调,应用双活是建设的最终目标,而云平台与云产品是承载这一目标的能力底座。在双活项目建设中,不能过度聚焦于基础设施层(如存储、网络)的双活能力,而忽视应用自身的架构改造,包括无状态化设计、会话保持机制、读写分离改造等关键环节。必须坚持应用双活改造与平台能力支撑同步推进的原则。同时,应用应结合自身架构特点,制定明确的故障场景下的业务切换预案,并通过常态化演练,持续提升切换效率与安全性。
推广经验总结:
1.项目目标聚焦“重要业务及其强依赖业务系统”实现双活。不宜一次性推动全量应用双活。应优先选择交易链路清晰、依赖关系可控、业务价值高的系统作为试点,验证技术栈与流程后再横向复制。
2.信创改造与双活改造可合并为同一项目周期,避免重复申请资源、重复测试、业务多次割接等成本压力。
更多金融科技案例和金融数据智能优秀解决方案,请在数字金融创新知识服务平台-金科创新社案例库、选型库查看。
热门跟贴