每分钟断一次:一次 VLAN 二层环路的定位实录
问题现象
某客户网络中,汇聚交换机上联口 G1/0/23、G1/0/24 反复 up/down。两个端口同属动态聚合组 BAGG1,上联对端设备(推测为大楼核心/上联设备)。翻动极有规律:约每 60 秒断一次,断开 30~33 秒后自动恢复,业务随之每分钟中断一轮。
排查定位
本次通过远程导出设备日志做时序关联分析,三条线索共同锁定了与链路质量完全不同的根因。
线索一:翻动周期过于整齐。从 15:49:04 到 15:55:42 连续 7 轮,每约 60 秒断一次、断 30~33 秒后恢复。分钟级周期性是典型的”定时器动作”特征——光衰、模块故障等物理层抖动不会这么整齐。
线索二:每次都是对端先动作。日志显示 GE1/0/24 inactive 的原因是 peer port did not have the Synchronization flag(对端 LACP 同步标志丢失),GE1/0/23 随后物理 down——说明是上联对端设备先阻断了它那一侧的端口,本机只是被动感知。
线索三:环路报警与断链精确同频。同一时间轴上,下联口 G1/0/5 每分钟报一次 LPDT/4/LPDT_LOOPED: A loop was detected on GigabitEthernet1/0/5 in VLAN 1910,时间与 23/24 断链精确同步。
三条线索合起来的原因链非常清晰:VLAN 1910 在 G1/0/5 下属网段存在二层环路 → 对端设备的环回检测每 60 秒检测一次,检测到环路后阻断面向本机的聚合口 → 30 秒后环路解除、链路恢复 → 环路源头未根除,下一个检测周期再次阻断,如此循环。G1/0/23、G1/0/24 的反复 up/down 不是链路或光模块故障,而是环路检测机制在”定时拉闸”。

改善方向
定位完成后,源头尚未根除,以下为建议的改善措施:
- 治本——沿 G1/0/5 找到环路源。通过 LLDP 邻居信息确认下联设备,重点检查其网段内是否存在双上联、傻瓜交换机、网线回环;在汇聚设备上开启 MAC 漂移观察(display mac-address mac-move),可最快定位到环路端口。
- 收紧本机环检动作。接入侧端口把环检动作从 block 改为 shutdown(loopback-detection action shutdown),发现环路直接关闭端口并告警,避免”每分钟断网 30 秒”式的持续震荡。
- 防止误伤上联。环路应在接入边缘切断,核心/上联设备的环检不应每分钟把整个汇聚的上联打断——建议核对对端设备同时段日志,确认其阻断策略并评估调整。
- 结构加固。检查 VLAN 1910 网段的 MSTP 部署,用户侧边缘端口配置 stp edged-port 加 BPDU 保护;傻瓜交换机不参与生成树的场景,依靠环检 shutdown 兜底。
- 可观测性建设。把环检(LPDT)与链路翻动日志接入 SNMP trap/网管告警,环路一出现即可看到确切源端口,缩短下次故障的定位时间。
验证结果
15:57:09 之后至日志导出时刻(16:50),环路检测报警与端口翻动均已停止,链路当前稳定。但环路源头尚未根除,存在复发风险,需待改善措施落地后持续观察确认。
总结
- 分钟级周期性翻动(每 60 秒断 30 秒)几乎可以直接排除物理层故障,指向定时器机制——环回检测、生成树、保活机制都可能成为”幕后定时器”。
- 多条互不相干的日志在同一秒对齐,是跨层问题定位的关键:上联口的 LACP 同步丢失与下联口的环检报警同频出现,直接锁定二层环路根因。
- 环路治理的三个层面缺一不可:源头排查(双上联/回环线缆)、边缘防护(edged-port + BPDU 保护 + 环检 shutdown)、告警闭环(trap/网管告警)。