1.1 背景:CN2是运营商级国际骨干线路,低时延高稳定。运维目标:保证ECS对外连通、EIP稳定、链路时延在SLA内。
1.2 准备信息:记录账号ID、Region(ap-southeast-1)、所有相关实例ID、VPC ID、EIP、路由表ID与安全组ID。
2.1 控制台与CLI:登录阿里云控制台并确认权限;安装阿里云CLI(aliyun)并配置AccessKey:aliyun configure。
2.2 本地测试工具:安装 ping、traceroute、mtr、iperf3、tcpdump。建议在一台位于新加坡的跳板机(ECS)做测试。
3.1 指标监控:在CloudMonitor中创建监控项(带宽使用、丢包率、时延、CPU、磁盘)并设置告警阈值。
3.2 巡检脚本示例:每天定时运行 traceroute -n target && mtr -r -c 100 target 保存结果,上传到日志中心。
4.1 基础连通性:从跳板机执行 ping -c 5 <目标IP>,若丢包高则继续。
4.2 路径定位:traceroute -n <目标IP>,或 mtr -r -c 100 <目标IP>,记录第一跳丢包点和时延突变。
4.3 MTU与碎片:ifconfig 或 ip link 查找 MTU;若怀疑碎片,使用 ping -M do -s 1472 <目标IP> 逐步调小。
5.1 VPC路由表:控制台 > VPC > 路由表,确认目的网段走向正确。
5.2 安全组与ACL:核对入站/出站规则是否允许对应端口与源/目的IP。
5.3 检查EIP绑定:若EIP失联,控制台查看EIP状态,必要时解绑并重绑到目标实例。
6.1 判断是否为跨境链路问题:从不同区域做对比traceroute,若在境外骨干节点丢包,通常为对端或运营商层面。
6.2 收集证据:保存 traceroute、mtr 输出与CloudMonitor历史时延曲线,准备提交工单。
7.1 立即隔离:若影响范围小,可先下线单台实例或切流量到备用实例(ECS快照与镜像)。
7.2 重启网络服务:在实例上执行 sudo systemctl restart network 或 ip link set dev eth0 down && ip link set dev eth0 up。
7.3 抓包上传:tcpdump -i eth0 -s 0 -w /tmp/capture.pcap host <对端IP>,并通过OSS或工单上传。
8.1 工单准备内容:填写影响时间、影响范围、实例ID、VPC ID、路由表ID、traceroute/mtr/tcpdump文件、告警截图。
8.2 提交方式:控制台 > 工单 > 网络类,选择国际链路或EIP问题,附上上述材料并催单(提供UTC时间与联系号码)。
9.1 验证方法:问题修复后执行 ping、mtr、iperf3 测试(iperf3 -c <对端> -t 60);比对修复前后RTT与丢包率。
9.2 监控恢复:确保CloudMonitor在未来24-72小时无同类告警,调整告警策略防复发。
10.1 常见优化:使用Global Accelerator或CDN分流长距离流量;调整TCP窗口与KeepAlive参数减少重传。
10.2 预防措施:定期做跨区域链路测试、配置冗余EIP与多可用区部署。
问:如何快速判断故障出在阿里云还是运营商(CN2)侧?
答:先从多点对比:在同Region不同ECS同时对外traceroute。如果只有部分实例受影响,多为实例/安全组/VPC配置问题;若多个实例相同跳点在境外出现丢包,且时间与运营商维护窗口吻合,多为运营商或CN2侧问题,需提交工单并附traceroute/mtr。
问:突发高丢包,有没有临时缓解手段?
答:可先切换流量到备用EIP或备用可用区,重启网络服务并清理连接表(sudo conntrack -D),短期内降低并发连接数或启用CDN/加速器分流,同时提交工单追踪根因。
问:提交工单时哪些信息是必须提供的以加速处理?
答:必备信息:问题起止时间、影响实例ID/EIP/VPC/路由表、traceroute与mtr原始输出、tcpdump抓包文件、CloudMonitor告警截图、业务影响范围与联系电话。提供越详尽工程师越快定位。