云专线出现故障后,公网访问正常但云上业务无法连接,这个现象在运维工作中很常见。根本原因在于公网和专线走的是两条完全独立的网络路径,它们的路由表、网关设备和访问控制策略都是隔离的。专线断了,只影响专线这条通道,公网那条路只要运营商的骨干网没问题,就依然畅通。但为什么云上业务本身连不上呢?
第一,路由优先级和最长匹配原则导致流量走错路
很多云上业务在配置时,会把内部管理网段、数据库网段或者某些特定应用的访问流量强制指向专线接口,在云平台的路由表里为这些目标网段设置了下一跳为专线网关的明细路由。公网用户访问云上业务的公网IP,那是一条默认路由或静态路由指向互联网出口,两者不冲突。但当专线故障时,专线网关状态变为不可达,云平台内部的路由表不会自动把那些明细路由切换到公网出口,因为路由策略里没有写备份路径。结果就是,从云上业务服务器返回给客户端的响应数据包,发现目的地址匹配的是那条专线路由,于是尝试从专线接口发出,但专线已经断了,数据包在云内网关处就被丢弃或积压,业务握手失败。
第二,专线两端的边界网关协议邻居断开后,云上VPC内的虚拟路由器会停止向本地数据中心发布云内网段的路由,同时也会撤销从本地收到的路由。但对于云上业务本身,如果它依赖与本地数据中心之间的内网通信,比如需要连接本地数据库或文件服务器,那么专线断了之后,业务进程在尝试建立内网连接时,因为路由表中没有替代路径,连接请求直接超时。而公网访问正常,只是说明公网IP的端口监听和负载均衡器工作正常,但业务逻辑可能在处理请求过程中需要回连本地资源,这一步失败就会返回错误页面或连接重置。
第三,安全组和网络访问控制列表的入站规则通常只对公网IP开放了特定端口,而对专线过来的流量可能放行了更宽的内网范围。当专线故障后,如果有人试图通过公网IP直接访问业务,但业务的服务监听地址绑定了内网IP而不是公网IP,或者防火墙策略只允许专线来源IP访问,那么公网请求虽然能到达云平台的外网入口,但在转发到后端服务器时会被安全组拦截。
第四,很多云上业务使用了弹性公网IP绑定的NAT网关或负载均衡器,这些设备本身与专线网关是独立的。专线故障不影响这些设备的公网转发能力,但业务后端服务器如果配置了默认网关指向专线,或者有策略路由强制回包走专线,那么即使请求从公网进来了,响应包也回不去。
最后,故障排查时要先确认专线物理端口状态、光功率和运营商侧链路,同时检查云平台上的路由表、BGP邻居状态和VPC路由传播情况。如果业务急用,可以临时把业务服务器的路由指向公网网关,或者调整安全组允许公网临时访问内网服务,但要注意安全风险。
Vecloud整合国际宽带、SDWAN、MPLS专线与IPLC专线,并提供数据中心租赁服务,全面提升企业网络性能。
热门跟贴