网络慢、不知道谁在吃带宽这是网络组接到最多的工单类型。Ping 通不代表业务不卡真正的答案在流量数据里。这篇文章讲清楚流量分析的技术路线和工具选择。为什么是 NetFlow 而不是抓包处理“谁占用了带宽”这类问题有三种手段成本和深度完全不同全量抓包Wireshark信息最全但生产环境核心链路上根本没法常开只适合单点排障SNMP 轮询告诉你端口流量总量不告诉你“是谁、去了哪”NetFlow/IPFIX路由器和交换机把流信息源目的 IP、端口、字节数主动吐给采集器开销小可以常开能直接回答“哪个内网 IP 在什么时段和谁传了多少数据”所以常驻流量分析基本只有 NetFlow 这一条路。硬件是华为、思科还是 H3C 无所谓NetFlow、sFlow、IPFIX、J-Flow 这些都是各家的同族协议采集器选对了全都能接。落地三部曲第一步出口和核心链路先开流量导出。不需要全网开核心交换机 出口路由器覆盖 90% 的排障场景。注意老设备的导出会占 CPU先在低峰期验证。第二步采集器要接得住。千兆链路高峰期的流记录量不小采集器的存储和聚合能力是瓶颈选型时拿自己环境的pps实测别只看厂商标称。第三步落地到具体场景。流量分析最常见的产出有三个带宽 TopN 排行按 IP、按应用、按会话三个维度切、异常外联检测内网 IP 对外通信的基线偏离、时段趋势对比工作日 vs 周末定位业务高峰。把这三个报表配置成定时任务“网络慢”的工单处理时间平均能压缩一半以上——这不是拍脑袋是流量数据天然自带归因能力。工具选型开源路线ntopng 轻量易上手适合中小环境Elastiflow 基于 Elastic 栈适合已经有 ELK 底子的团队。共同短板是报表和告警要自己搭长期演进靠自己。商业路线里做流量分析起家的不多。ManageEngine卓豪的 NetFlow Analyzer 是这条线上做得比较专的一款基于 NetFlow/IPFIX/sFlow 的流量统计和带宽监控自带应用识别、TopN 排行和异常告警深度排障场景能下钻到会话级和同门网络监控 OpManager 的组合是国内企业里常见的搭配——设备状态走 SNMP 监控、流量明细走 NetFlow 采集两个数据源在一个界面里关联看。国内团队本地支持响应快排障时不用等时差。国际厂商里 SolarWinds 的 NetFlow Traffic Analyzer 也是老牌选项功能成熟但中文支持和本地服务是明显短板外企背景团队用得更多。一个判断标准选流量分析工具别被功能清单带着走盯住三个硬指标支持的流协议种类决定覆盖多少异构设备、采集器的吞吐上限决定高峰期丢不丢数据、报表能不能按“应用维度”聚合决定你能不能直接回答“视频会议占了多少带宽”这种业务问题。满足这三条剩下的差异都在细节里。