可以通过 ICMP 和 TCP 层面的主动探测来判断可达性。常用工具有 ping、traceroute(或 mtr)以及基于 TCP 的 tcptraceroute。当 ping RTT 稳定且丢包率低于 1% 时,基本认为链路可达;若 ICMP 被丢弃,则用 TCP 三次握手检测 80/443/自定义端口来验证业务可达性。
建议从多个监测点(国内不同机房或云厂商)向韩国目的端发起探测,结合 Looking Glass 或运营商 BGP 检查路由状态,避免单点监测误判。
核心指标包括 延迟(Latency)、抖动(Jitter)、丢包率(Packet Loss)、带宽利用率(Throughput)以及 BGP 连通性(如邻居状态、路由可达)。此外,TCP 重传率、应用层响应时间和 MPLS/LSP 状态对 CN2 这类骨干链路也很重要。
常见阈值:延迟(到韩国)小于 80ms 为优,80–150ms 为可接受;丢包率超过 1% 需排查,抖动过大(>30ms)则影响实时业务。带宽利用率长期超过 70% 应考虑扩容或流控。
推荐使用组合式工具:主动探测用 Ping、MTR、Smokeping;流量分析用 NetFlow/sFlow、IPFIX;性能与告警用 Prometheus + Grafana、Zabbix、Nagios;路由与 BGP 可视化用 ExaBGP、BGPStream、Looking Glass。云端或混合环境下可引入 ThousandEyes 做互联网路径与应用感知监测。
在关键出入口部署被动采集(NetFlow)和主动探针(每分钟一次或更高频率),并将数据集中到时序数据库,配置历史对比和告警策略。
告警策略应分级:L1(延迟/丢包短暂抖动)、L2(持续性能劣化)、L3(链路不可达或 BGP 全失)。自动化响应包括流量切换(备链路)、脚本触发重建会话、自动采集故障抓包以及通知相关组(短信/钉钉/工单)。
示例:若 5 分钟内丢包率>2% 或 RTT 增加 50% 且持续 3 次采样,触发 L2 告警并自动从主链路切换到备用 CN2/普通互联网链路,同时抓取 30s pcap。
定位步骤:1)确认本端链路与设备无异常(接口错误、队列饱和)。2)使用多点 traceroute/mtr 确定问题是否发生在国内出口、国际中转还是韩国机房入站。3)检查 BGP 路由是否发生变动或被污染。4)将采集到的时序、流量和抓包上传给运营商或对端,并使用 Looking Glass 验证对端视角。
协同处理时附上时间线(UTC)、采样数据(RTT/丢包/流量曲线)、抓包样本和 BGP 路由快照,便于韩国运营商或 CN2 维护方快速定位链路/中转点问题。