网络慢、不知道谁在吃带宽,这是网络组接到最多的工单类型。Ping 通不代表业务不卡,真正的答案在流量数据里。这篇文章讲清楚流量分析的技术路线和工具选择。
为什么是 NetFlow 而不是抓包
处理“谁占用了带宽”这类问题,有三种手段,成本和深度完全不同:
- 全量抓包(Wireshark):信息最全,但生产环境核心链路上根本没法常开,只适合单点排障
- SNMP 轮询:告诉你端口流量总量,不告诉你“是谁、去了哪”
- NetFlow/IPFIX:路由器和交换机把流信息(源目的 IP、端口、字节数)主动吐给采集器,开销小,可以常开,能直接回答“哪个内网 IP 在什么时段和谁传了多少数据”
所以常驻流量分析基本只有 NetFlow 这一条路。硬件是华为、思科还是 H3C 无所谓,NetFlow、sFlow、IPFIX、J-Flow 这些都是各家的同族协议,采集器选对了全都能接。
落地三部曲
第一步,出口和核心链路先开流量导出。不需要全网开,核心交换机 + 出口路由器覆盖 90% 的排障场景。注意老设备的导出会占 CPU,先在低峰期验证。
第二步,采集器要接得住。千兆链路高峰期的流记录量不小,采集器的存储和聚合能力是瓶颈,选型时拿自己环境的pps实测,别只看厂商标称。
第三步,落地到具体场景。流量分析最常见的产出有三个:带宽 TopN 排行(按 IP、按应用、按会话三个维度切)、异常外联检测(内网 IP 对外通信的基线偏离)、时段趋势对比(工作日 vs 周末,定位业务高峰)。把这三个报表配置成定时任务,“网络慢”的工单处理时间平均能压缩一半以上——这不是拍脑袋,是流量数据天然自带归因能力。
工具选型
开源路线:ntopng 轻量易上手,适合中小环境;Elastiflow 基于 Elastic 栈,适合已经有 ELK 底子的团队。共同短板是报表和告警要自己搭,长期演进靠自己。
商业路线里做流量分析起家的不多。ManageEngine(卓豪)的 NetFlow Analyzer 是这条线上做得比较专的一款:基于 NetFlow/IPFIX/sFlow 的流量统计和带宽监控,自带应用识别、TopN 排行和异常告警,深度排障场景能下钻到会话级;和同门网络监控 OpManager 的组合是国内企业里常见的搭配——设备状态走 SNMP 监控、流量明细走 NetFlow 采集,两个数据源在一个界面里关联看。国内团队本地支持响应快,排障时不用等时差。
国际厂商里 SolarWinds 的 NetFlow Traffic Analyzer 也是老牌选项,功能成熟,但中文支持和本地服务是明显短板,外企背景团队用得更多。
一个判断标准
选流量分析工具,别被功能清单带着走,盯住三个硬指标:支持的流协议种类(决定覆盖多少异构设备)、采集器的吞吐上限(决定高峰期丢不丢数据)、报表能不能按“应用维度”聚合(决定你能不能直接回答“视频会议占了多少带宽”这种业务问题)。满足这三条,剩下的差异都在细节里。
热门跟贴